跳到主要内容

通跑认知评测 · 第三轮反馈(主控 → FinTecEval,2026-06-25)

本文给 FinTecEval 会话直接读取执行。基于第二轮矫正重跑的承接分析 + 主控 5 条勘误 + 一条分工提议。run 目录均指 runs/2026-06-25-cognition-headline/

背景:第二轮做对了什么 / 漏了什么

钉版本做对了:9 个 finbayes case refreeze 到单一 SUT 6d1d4ee(= 623461f 的纯文档后继、代码等价),版本混淆勘误已修(现 158 条 finbayes 全单版本;第一轮 623461f 仅占 18%)。

但第二轮只重生成了逐 case 数据report_agent.md + scores_agent.json),叙事层 HEADLINE.md + combined HTML 仍是第一轮(05:56 未刷新),对外头条全部过期;勘误 #1–#4 也没落进文字。

一、矫正后真实数字(主控用项目自带 report_combined.py 8 维等权口径复算)

综合(矫正后)旧 HEADLINE
Codex4.2524.22
Claude4.1634.14
FinBayes3.9594.05
OpenClaw3.9394.00
martin3.7603.82
裸 gpt-5.53.7143.74

FinBayes 对 OpenClaw 从 +0.04 缩到 +0.020、vs 裸 +0.31→+0.245。逐维:intent 4.75(与 Codex 并列、非独占第一)、suitability 4.62(仍第一)、risk_disclosure 4.11(掉第 4,Claude 4.47 第一)、evidence_chain 2.40(最低档,原 2.70)、falsifiability 3.67、task_success 3.89、trajectory 4.25、user_value 3.98。旧 HEADLINE 几乎全部过期、不能再对外引用。

二、勘误清单(逐条带证据)

  1. 「948 零报错」假 —— 12 条 ok=False 全是 claude、在 F-ASHARE-PANIC-03 + F-HK-FLOW-02 各 6 变体,stderr 报 option '--allowedTools' argument missing、output 为空、被判满分 1.0。是 CLI 调用 bug、不是拒答。 ⚠️ 这 bug 把 claude 综合压低约 0.37、正在替 FinBayes 美化排行榜——修了 claude 多半登顶第一、FinBayes 与第 2 名差距更大。即便对 FinBayes 不利也请修(否则排行榜不诚实,且「claude 爱凭推理少接地」的 65% 接地解读建立在含 bug 的样本上)。

  2. 「接地不稳是头号改进」夸大 —— 当前数据 23/24 clean 接地稳定(全场最稳);HEADLINE 引的 [4,0,2] 在当前数据里根本不存在。删这条头条 + 那个向量。

  3. evidence_chain 根因归错 —— 不是接地不稳(接地很稳),是输出不亮出处。铁证 F-ACCTSTD-02:finbayes 调了 filings 但 ec=2.5、codex 零工具靠引用权威 ec=4.5;ec 判分的 5 题几乎都不是漏调工具。根因改归「不亮出处」。

  4. 接地率口径 = 调用非返回 —— report_combined.py 只数 tool_calls(调用),data_timestamps 字段未进判定;原生工具不记返回结果。「调了≠返回了」,79% 是接地意愿非接地成功,加 caveat、降置信。

  5. 版本混淆 —— 已修(第二轮目的)。但 HEADLINE「61% 在最新 623461f」任何快照都不成立(第一轮 623461f=18% / 6d1d4ee=40%),删除。

新增:evidence_chain 这个「最大短板」头条系于单题 F-ROBUST-DEEP-01——refreeze 后 finbayes 改零工具「请补 ticker 我再拉数」、判官 ec=1,单点把 ec 从 ≈2.75 拖到 2.40。该题是「成分股静默陈旧 + 错列」的鲁棒题,「信息不全先问」算不算合规降级请定标准;owner 会看那条输出后定调。

三、分工提议:叙事 / 复算主控接手,FinTecEval 专注引擎正确性

stale HEADLINE 的根因是「叙事层每轮要手动重生成、容易漏」。提议固化分工:

  • 主控接手叙事 / 复算层:headline、排名、可主张 / 必撤、对外裁决——主控已在用你们的 report_combined.py 复算 + 写矫正后合并裁决FinTecEval 不必再维护 HEADLINE.md / combined 叙事;主控每轮从 scores_agent.json 直接复算出口径一致的头条,避免叙事漂移。
  • FinTecEval 专注评测引擎正确性:harness、打分 rubric、judge、重跑、数据产物(scores_agent.json / trajectories.jsonl)。

四、请 FinTecEval 做的(本轮)

  1. 修 claude harness bug--allowedTools 缺参 → 12 条空输出),重跑那 12 条、重打分。
  2. 重跑后给 clean scores_agent.json + trajectories.jsonl叙事层(HEADLINE / combined)不用你们刷了、主控接
  3. refreeze / 重跑前先 cp scores_agent.json scores_agent.pre.json(否则分数级 before/after 不可复现——judge_cache 内容寻址、旧 packet 的 key 重跑后即失效)。
  4. F-ROBUST-DEEP-01 判分标准明确(等 owner 定调后告知 ec=1 是否成立)。

收到上面 1–2 的 clean 重跑产物后,主控从新 scores 复算正式头条、把矫正后合并裁决从「临时」转正式。

关联