通跑认知评测 · 第三轮反馈(主控 → FinTecEval,2026-06-25)
本文给 FinTecEval 会话直接读取执行。基于第二轮矫正重跑的承接分析 + 主控 5 条勘误 + 一条分工提议。run 目录均指
runs/2026-06-25-cognition-headline/。
背景:第二轮做对了什么 / 漏了什么
钉版本做对了:9 个 finbayes case refreeze 到单一 SUT 6d1d4ee(= 623461f 的纯文档后继、代码等价),版本混淆勘误已修(现 158 条 finbayes 全单版本;第一轮 623461f 仅占 18%)。
但第二轮只重生成了逐 case 数据(report_agent.md + scores_agent.json),叙事层 HEADLINE.md + combined HTML 仍是第一轮(05:56 未刷新),对外头条全部过期;勘误 #1–#4 也没落进文字。
一、矫正后真实数字(主控用项目自带 report_combined.py 8 维等权口径复算)
| 臂 | 综合(矫正后) | 旧 HEADLINE |
|---|---|---|
| Codex | 4.252 | 4.22 |
| Claude | 4.163 | 4.14 |
| FinBayes | 3.959 | 4.05 |
| OpenClaw | 3.939 | 4.00 |
| martin | 3.760 | 3.82 |
| 裸 gpt-5.5 | 3.714 | 3.74 |
FinBayes 对 OpenClaw 从 +0.04 缩到 +0.020、vs 裸 +0.31→+0.245。逐维:intent 4.75(与 Codex 并列、非独占第一)、suitability 4.62(仍第一)、risk_disclosure 4.11(掉第 4,Claude 4.47 第一)、evidence_chain 2.40(最低档,原 2.70)、falsifiability 3.67、task_success 3.89、trajectory 4.25、user_value 3.98。旧 HEADLINE 几乎全部过期、不能再对外引用。
二、勘误清单(逐条带证据)
-
「948 零报错」假 —— 12 条
ok=False全是 claude、在 F-ASHARE-PANIC-03 + F-HK-FLOW-02 各 6 变体,stderr 报option '--allowedTools' argument missing、output 为空、被判满分 1.0。是 CLI 调用 bug、不是拒答。 ⚠️ 这 bug 把 claude 综合压低约 0.37、正在替 FinBayes 美化排行榜——修了 claude 多半登顶第一、FinBayes 与第 2 名差距更大。即便对 FinBayes 不利也请修(否则排行榜不诚实,且「claude 爱凭推理少接地」的 65% 接地解读建立在含 bug 的样本上)。 -
「接地不稳是头号改进」夸大 —— 当前数据 23/24 clean 接地稳定(全场最稳);HEADLINE 引的
[4,0,2]在当前数据里根本不存在。删这条头条 + 那个向量。 -
evidence_chain 根因归错 —— 不是接地不稳(接地很稳),是输出不亮出处。铁证 F-ACCTSTD-02:finbayes 调了 filings 但 ec=2.5、codex 零工具靠引用权威 ec=4.5;ec 判分的 5 题几乎都不是漏调工具。根因改归「不亮出处」。
-
接地率口径 = 调用非返回 ——
report_combined.py只数tool_calls(调用),data_timestamps字段未进判定;原生工具不记返回结果。「调了≠返回了」,79% 是接地意愿非接地成功,加 caveat、降置信。 -
版本混淆 —— 已修(第二轮目的)。但 HEADLINE「61% 在最新 623461f」任何快照都不成立(第一轮
623461f=18% /6d1d4ee=40%),删除。
新增:evidence_chain 这个「最大短板」头条系于单题 F-ROBUST-DEEP-01——refreeze 后 finbayes 改零工具「请补 ticker 我再拉数」、判官 ec=1,单点把 ec 从 ≈2.75 拖到 2.40。该题是「成分股静默陈旧 + 错列」的鲁棒题,「信息不全先问」算不算合规降级请定标准;owner 会看那条输出后定调。
三、分工提议:叙事 / 复算主控接手,FinTecEval 专注引擎正确性
stale HEADLINE 的根因是「叙事层每轮要手动重生成、容易漏」。提议固化分工:
- 主控接手叙事 / 复算层:headline、排名、可主张 / 必撤、对外裁决——主控已在用你们的
report_combined.py复算 + 写矫正后合并裁决。FinTecEval 不必再维护HEADLINE.md/ combined 叙事;主控每轮从scores_agent.json直接复算出口径一致的头条,避免叙事漂移。 - FinTecEval 专注评测引擎正确性:harness、打分 rubric、judge、重跑、数据产物(
scores_agent.json/trajectories.jsonl)。
四、请 FinTecEval 做的(本轮)
- 修 claude harness bug(
--allowedTools缺参 → 12 条空输出),重跑那 12 条、重打分。 - 重跑后给 clean
scores_agent.json+trajectories.jsonl;叙事层(HEADLINE / combined)不用你们刷了、主控接。 - refreeze / 重跑前先
cp scores_agent.json scores_agent.pre.json(否则分数级 before/after 不可复现——judge_cache 内容寻址、旧 packet 的 key 重跑后即失效)。 - F-ROBUST-DEEP-01 判分标准明确(等 owner 定调后告知 ec=1 是否成立)。
收到上面 1–2 的 clean 重跑产物后,主控从新 scores 复算正式头条、把矫正后合并裁决从「临时」转正式。
关联
- 矫正后主控裁决:通跑认知评测·矫正后合并裁决。
- 前序:Step 1.7 审计裁决、FinBayes 臂更新工单。