跳到主要内容

通跑第三轮 · FinTecEval 回执(FinTecEval → 主控,2026-06-25)

回应第三轮反馈的 4 条要求 + 5 条勘误。 代码改动:FinTecEval commit 9797f45(承接 0615ce7 的冻结重跑)。run 目录均指 runs/2026-06-25-cognition-headline/。 2026-06-26 Codex 接手补充:F-ROBUST-DEEP-01 已按现有证据定分,维持证据说明分 1 分;未改分数、未重判,只重生成 FinTecEval 报告的完整版本和瘦身版本。

一、Claude 运行错误:已修 + 已重跑 + 实测影响(勘误 #1)

根因坐实:agent_claude.py--allowedTools 放最后拼 *allowed,无沙箱工具的认知题 Sandbox(case).tool_names()=[]allowed=[]claude -p ... --allowedTools(末位无值)→ CLI 报 option '--allowedTools' argument missing → 空输出。命中 F-ASHARE-PANIC-03 + F-HK-FLOW-02 各 6 变体 = 12 条,与你查的一致。

修法:空时补一个不存在的占位工具 mcp__sandbox__none——既不触发 CLI 缺参、又等于禁掉所有工具(认知题本就无受控工具)。

重跑 + 重打分后实测(确认你的预判):

  • claude 空输出 12 → 0;那 2 题 claude 软分均值 1.06 → 4.441.29 → 4.5
  • claude 综合(FinTecEval report_framework 口径)+0.275 → 现清楚第 1;FinBayes 相对位次回落、与第 1 差距拉大
  • 明知对 FinBayes 不利仍修——排行榜现在诚实了。具体数字请你用 report_combined.py 复算为准(我这口径与你 8 维等权略有差异,方向一致)。

二、4 条要求逐条回执

  1. 修 Claude 运行错误 + 重跑 12 条 + 重打分 —— ✅ 完成(见上)。
  2. 干净版 scores_agent.json + trajectories.jsonl —— ✅ 已就绪:
    • runs/2026-06-25-cognition-headline/scores_agent.json(干净、claude 已修)
    • runs/2026-06-25-cognition-headline/trajectories.jsonl(claude 12 条已重跑、其余不动)
  3. 重跑前 cp scores_agent.json scores_agent.pre.json —— ✅ 已留底:
    • scores_agent.pre.json(旧、含 bug)vs scores_agent.json(新、干净)= 你要的分数级 before/after。
  4. F-ROBUST-DEEP-01 判分标准 —— ✅ 维持证据说明分 1 分:题目已经说明「数已挂好」,FinBayes 在 3 次正常运行里完全没调工具,却反问用户要代码;没有把成分、时间点和可靠性说出来。故障和施压运行里虽有部分工具调用,也没有形成可追踪的依据说明。这不是合格的缺数据处理,所以不调分、不重判。

三、隔离口径声明(这次判官没动)

按你「只看 Claude 运行错误本身造成了多少影响」的意图,这次重打分保持原评分来源(中转站 claude-opus-4-6 + gpt-5.5),只对那 12 条变了内容的 Claude 记录重判、其余命中缓存不动。所以 pre.json → json 的差只反映 Claude 运行错误修复,不掺评分来源变动,你能干净复算这次错误对排名的净影响。

附:订阅评分(claude -p / codex exec,省中转站)已建成,开关是 FT_JUDGE_CLI=1(Claude 升 opus-4-8),默认关。要不要把评分来源迁到订阅口径是单独一轮,由 owner 定;迁了会动所有软分,需另一次全量重判。

四、勘误 #2/#3/#4 在 FinTecEval report_framework 的落地

(owner 决定 report_framework 留作 FinTecEval 交付,故按勘误就地修准;HEADLINE/combined 叙事归你。)

  • #2 接地不稳夸大 —— 删掉旧「接地不稳是头号短板」头条。
  • #3 证据说明分偏低的原因 —— ①诊断改成「主要短板 = 答案没有说清依据」,带例子 F-ACCTSTD-02(FinBayes 调了公司文件工具却只得 2.5 分、Codex 没调工具但引用权威来源得 4.5 分)。
  • #4 工具调用率口径 —— §3 接地率 + 术语表 + ①诊断都加提醒:只数工具调用、未核返回,「调了≠返回了」,是调用数据工具的意愿,不是取数成功率,降置信。
  • #5 版本混淆 —— 已由冻结重跑修(单一 6d1d4ee,见 0615ce7)。
  • F-ROBUST-DEEP-01 定分补充 —— 已把 FinTecEval 报告诊断改成“维持证据说明分 1 分”的证据说明,重生成完整 HTML 和瘦身 HTML。

五、分工已对齐

FinTecEval 专注引擎正确性 + 干净数据产物(scores_agent.json / trajectories.jsonl),不再刷 HEADLINE / combined 叙事——你从上面的新 scores_agent.json 直接复算正式头条、把矫正后合并裁决转正式即可。

关联

  • 上游:通跑第三轮反馈
  • 代码:FinTecEval commit 9797f45(Claude 运行错误 + 评分来源开关 + 勘误)、0615ce7(冻结重跑 + 金融7能力 + 客观达成表)。