跳到主要内容

通跑认知评测 · 矫正后正式裁决(主控,2026-06-26)

这是此前暂缓发布的合并裁决。承接对象 = FinTecEval 通跑认知评测(24 题、6 个参评系统、每题多次运行)第二轮矫正重跑 + 主控 5 条勘误 + 监听类报告合并。裁决基于矫正后的数据,用项目自带 report_combined.py 按 8 个维度等权复算;不引用第一轮 HEADLINE.md,因为那份报告已经过期。2026-06-26 已完成三项转正式条件:第三轮叙事说明已刷新,Claude 测试接口错误已修复并复算,F-ROBUST-DEEP-01 已完成定分。本文件现在是正式裁决。

一、矫正后真实定位(主控复算)

参评系统8 维等权综合
Codex4.252
Claude4.163
FinBayes3.959
OpenClaw3.939
martin3.760
裸 gpt-5.53.714

FinBayes 第 3,对通用智能体 OpenClaw 仅 +0.020(差距很小,基本打平),对只用 gpt-5.5 模型、没有金融流程包装的基线系统 +0.245。 逐维看:建议是否合身 4.62(唯一清楚第一)、理解用户意图 4.75(与 Codex 并列)、风险提示 4.11(第 4,Claude 4.47 第一)、过程质量 4.25、用户价值 3.98、任务完成 3.89、能否被验证 3.67、证据说明 2.40(最低档)

二、可诚实主张的(站得住)

  1. 相对基线系统提升 +0.245:FinBayes 相比只用 gpt-5.5 模型、没有金融流程包装的系统有可量化提升——「FinBayes 不只是套一层模型外壳」这条成立。
  2. 建议是否合身 4.62,全场第一:按用户画像给配得上的建议,是矫正后唯一仍独占第一的维度,也正是金融顾问类产品的本职。
  3. 愿意调用数据工具的比例高:正常运行时调用真实数据工具的比例为 79%、与头部并列前二(口径见下方限制 ④)。
  4. 安全边界多数守住:24 题里仅 2 题(F-HK-FLOW-02 / F-ORDERBOOK-DEPTH-01)出现多个参评系统越权,不是 FinBayes 独有短板。

三、必须撤回 / 改写的(第一轮头条已不成立)

旧头条裁决
「全场领跑三维(意图 / 合身 / 风险)」——矫正后只剩“建议是否合身”一维;意图与 Codex 并列、风险掉第 4
「接地率 88%、最爱用真数据」——79%、被 OpenClaw 80% 反超
「948 条运行记录零报错」——12 条 Claude 运行失败(空输出、命令行参数错误)
「接地不稳是头号改进、该取数必取数钉死」——数据反证(23/24 正常运行接地稳定、全场最稳);真正短板是答案没有说清依据
「综合 4.05 / +0.31 vs 裸 / 对 OpenClaw +0.04」——3.96 / +0.245 / +0.02

四、真实短板(矫正后看清)

头号短板 = 证据说明 2.40,最低档。 根因不是不取数(取数很稳定),而是答案没有说清依据——FinBayes 调了工具,但答案里不引用权威来源,评分者看不到依据;对照组 Codex 没调用工具,但引用权威来源,反而拿到高分(F-ACCTSTD-02:FinBayes 2.5 vs Codex 4.5)。这是产品层可以直接改的:让答案显式写出来源、报告期、计算过程;不是数据层缺口。 次级短板:能否被验证 3.67、回答过长(平均 2609 字、最长却非最高分)、任务完成 3.89。

五、必须一起看的限制

  1. 第一轮 HEADLINE.md 仍不可引用:那份报告已经过期。本裁决数字以主控复算、FinTecEval 第三轮报告说明和 2026-06-26 本地检查为准。
  2. Claude 测试接口错误已经修复并纳入判断:修复前 12 条 Claude 空输出压低了 Claude 分数;修复后 Claude 登顶第一,FinBayes 仍是第 3。这个结果对 FinBayes 不利,但必须作为正式裁决的一部分。
  3. 小样本维度只作方向判断:建议是否合身、过程质量、证据说明等维度样本数不大,可以看方向,不宜把小数点后的差距说成确定优势。
  4. 工具调用率不等于取数成功率:评测只数是否调用了数据工具,没有逐条核对工具返回内容;所以 79% 表示“愿意去调数据工具”,不等于“每次都成功拿到正确数据”。
  5. F-ROBUST-DEEP-01 已完成定分:该题维持证据说明分 1 分。原因是题目已经说明“数已挂好”,FinBayes 在 3 次正常运行里没有调工具却反问用户要代码,没有说明成分、时间点和可靠性。这不是合格的缺数据处理。

六、一句话诚实头条(建议替换第一轮)

FinBayes 在同一 gpt-5.5 模型基础上,把“建议更合身、也更愿意调用数据工具”做出了可量化提升(+0.245、建议是否合身全场第一),证明它不是简单套壳;但在说清依据、让结论可验证、控制篇幅上仍弱于前沿模型,并且与通用智能体 OpenClaw 的综合质量差距已经小到基本打平(+0.02)。选 FinBayes 的理由是金融场景适配,不是综合质量碾压。

比第一轮头条弱,但站得住。后续产品改进应优先解决本裁决的头号短板:让答案显式写出来源、报告期、计算过程,不能把网页或工具返回的一个数字直接当成可信结论。

七、状态与下一步

  • 本裁决已转正式:第三轮报告说明已刷新;Claude 测试接口错误已修复并复算;F-ROBUST-DEEP-01 已完成定分。
  • 本裁决只覆盖本轮认知质量评测。涉及越权、授权、偷看未来等办事过程的评测,属于另一批执行题,不在本文件里下结论。