通跑第三轮 · FinTecEval 回执(FinTecEval → 主控,2026-06-25)
回应第三轮反馈的 4 条要求 + 5 条勘误。 代码改动:FinTecEval commit
9797f45(承接0615ce7的冻结重跑)。run 目录均指runs/2026-06-25-cognition-headline/。 2026-06-26 Codex 接手补充:F-ROBUST-DEEP-01已按现有证据定分,维持证据说明分 1 分;未改分数、未重判,只重生成 FinTecEval 报告的完整版本和瘦身版本。
一、Claude 运行错误:已修 + 已重跑 + 实测影响(勘误 #1)
根因坐实:agent_claude.py 把 --allowedTools 放最后拼 *allowed,无沙箱工具的认知题 Sandbox(case).tool_names()=[] → allowed=[] → claude -p ... --allowedTools(末位无值)→ CLI 报 option '--allowedTools' argument missing → 空输出。命中 F-ASHARE-PANIC-03 + F-HK-FLOW-02 各 6 变体 = 12 条,与你查的一致。
修法:空时补一个不存在的占位工具 mcp__sandbox__none——既不触发 CLI 缺参、又等于禁掉所有工具(认知题本就无受控工具)。
重跑 + 重打分后实测(确认你的预判):
- claude 空输出 12 → 0;那 2 题 claude 软分均值 1.06 → 4.44、1.29 → 4.5。
- claude 综合(FinTecEval
report_framework口径)+0.275 → 现清楚第 1;FinBayes 相对位次回落、与第 1 差距拉大。 - 明知对 FinBayes 不利仍修——排行榜现在诚实了。具体数字请你用
report_combined.py复算为准(我这口径与你 8 维等权略有差异,方向一致)。
二、4 条要求逐条回执
- 修 Claude 运行错误 + 重跑 12 条 + 重打分 —— ✅ 完成(见上)。
- 干净版
scores_agent.json+trajectories.jsonl—— ✅ 已就绪:runs/2026-06-25-cognition-headline/scores_agent.json(干净、claude 已修)runs/2026-06-25-cognition-headline/trajectories.jsonl(claude 12 条已重跑、其余不动)
- 重跑前
cp scores_agent.json scores_agent.pre.json—— ✅ 已留底:scores_agent.pre.json(旧、含 bug)vsscores_agent.json(新、干净)= 你要的分数级 before/after。
- F-ROBUST-DEEP-01 判分标准 —— ✅ 维持证据说明分 1 分:题目已经说明「数已挂好」,FinBayes 在 3 次正常运行里完全没调工具,却反问用户要代码;没有把成分、时间点和可靠性说出来。故障和施压运行里虽有部分工具调用,也没有形成可追踪的依据说明。这不是合格的缺数据处理,所以不调分、不重判。
三、隔离口径声明(这次判官没动)
按你「只看 Claude 运行错误本身造成了多少影响」的意图,这次重打分保持原评分来源(中转站 claude-opus-4-6 + gpt-5.5),只对那 12 条变了内容的 Claude 记录重判、其余命中缓存不动。所以 pre.json → json 的差只反映 Claude 运行错误修复,不掺评分来源变动,你能干净复算这次错误对排名的净影响。
附:订阅评分(
claude -p/codex exec,省中转站)已建成,开关是FT_JUDGE_CLI=1(Claude 升 opus-4-8),默认关。要不要把评分来源迁到订阅口径是单独一轮,由 owner 定;迁了会动所有软分,需另一次全量重判。
四、勘误 #2/#3/#4 在 FinTecEval report_framework 的落地
(owner 决定 report_framework 留作 FinTecEval 交付,故按勘误就地修准;HEADLINE/combined 叙事归你。)
- #2 接地不稳夸大 —— 删掉旧「接地不稳是头号短板」头条。
- #3 证据说明分偏低的原因 —— ①诊断改成「主要短板 = 答案没有说清依据」,带例子 F-ACCTSTD-02(FinBayes 调了公司文件工具却只得 2.5 分、Codex 没调工具但引用权威来源得 4.5 分)。
- #4 工具调用率口径 —— §3 接地率 + 术语表 + ①诊断都加提醒:只数工具调用、未核返回,「调了≠返回了」,是调用数据工具的意愿,不是取数成功率,降置信。
- #5 版本混淆 —— 已由冻结重跑修(单一
6d1d4ee,见0615ce7)。 - F-ROBUST-DEEP-01 定分补充 —— 已把 FinTecEval 报告诊断改成“维持证据说明分 1 分”的证据说明,重生成完整 HTML 和瘦身 HTML。
五、分工已对齐
FinTecEval 专注引擎正确性 + 干净数据产物(scores_agent.json / trajectories.jsonl),不再刷 HEADLINE / combined 叙事——你从上面的新 scores_agent.json 直接复算正式头条、把矫正后合并裁决转正式即可。
关联
- 上游:通跑第三轮反馈。
- 代码:FinTecEval commit
9797f45(Claude 运行错误 + 评分来源开关 + 勘误)、0615ce7(冻结重跑 + 金融7能力 + 客观达成表)。