Step 1.7 审计裁决(主控会话,2026-06-24)
阶段 1 唯一交付判据的实证审计。FinTecEval 重接 FinBayes 臂(走生产 ReAct δ)后,主控会话从本会话直接驱动 3 闸门臂补跑 + 稳健打分,并对真实 run 数据(非回执叙述)独立审计。裁决 = 分阶段签:阶段 1「基线不弱于 martin」层通过、owner 2026-06-24 签;新纲领硬门槛层 + vs 裸增量留办事级补验。
§0 裁决摘要
- ✅ 阶段 1 基线判据(FinBayes 不弱于 martin + 反超)= 通过,owner 2026-06-24 签。 所有可比软维 FinBayes ≥ martin 命中 100%,多维大幅领先;
F-2026-06-22事故题(盘口刷屏曾问崩 FinBayes)经修复后门槛 pass + 鲁棒满分。 - ⏳ 完整新纲领 Step 1.7(硬门槛优先级)= 未达,待办事级。 硬门槛(越权/授权/偷看未来)认知级测不了(21/30 格子 unknown、0 fail),需沙箱办事级补验。
- ⚠️ vs 裸 gpt-5.5 增量窄(战略关注项):FinBayes 赢在接地/证据/时点纪律/抗灾,但任务办成≈打平、合规/安全/成本略输裸模型;认知级低估了 FinBayes 的 agentic 差异化,亦需办事级才公允。
§1 跑法(口径)
- 三臂:
finbayes(被测,生产 ReAct δ——真AgentLoop.process_direct+ SOUL 在场 + 真工具轨迹 + token;非旧synthesize_cognition认知核裸跑)/martin_finclaw(竞品 full,带工具)/raw_gpt55(裸底座,无系统提示)。三臂同源中转站 gpt-5.5(apples-to-apples)。 - 题集:10 题锚集(全 7 办事类型 + 全 6 逻辑类型 + 2 真事故题 + 1 认知锚,偏合规/授权重)。
- 裁判:2 旗舰模型(gpt-5.5 + claude-opus-4-6)换位盲评、每维 1–5、IAA<0.7 标 unstable 不发布。
- 数据:30/30 格子完成(29 成功,martin 在
F-ETF-FLOW-01挂 1 格);打分 10/10 题、judge 0 次回中位(干净)。产物在 FinTecEval 仓runs/2026-06-23-step1.7-3arm/(answers.jsonl/results.json/judge_fails.json)。 - 口径边界(诚实):认知级一问一答,无外部编排沙箱工具执行 → 客观硬门槛无受控轨迹可核、打分引擎标
gate_unknown(不当过、亦非 fail)。
§2 核心数据(逐维 3 臂均值 + 只强不弱命中)
| 维度 | FinBayes | martin | 裸 gpt5.5 | FB≥martin | FB>裸 |
|---|---|---|---|---|---|
| 可审计 | 0.96 | 0.29 | 0.79 | 3/3 | 2/3 |
| 鲁棒 | 1.00 | 0.29 | 0.88 | 3/3 | 2/3 |
| 证据链 | 0.79 | 0.17 | 0.50 | 3/3 | 3/3 |
| 风险揭示 | 0.94 | 0.46 | 0.85 | 6/6 | 3/6 |
| 合规 | 0.90 | 0.53 | 1.00 | 5/5 | 0/5 |
| 任务办成 | 0.68 | 0.42 | 0.67 | 7/7 | 3/7 |
| 安全授权 | 0.75 | 0.38 | 1.00 | 1/1 | 0/1 |
| 成本 | 0.36 | 0.13 | 0.47 | 3/3 | 0/3 |
| 数据时点 | 1.00 | 0.00 | 0.88 | 1/1 | 1/1 |
| 适当性 | 1.00 | 0.88 | 1.00 | 1/1 | 0/1 |
耗时(旁证):FinBayes 542s/10 题(均 54s)< full-martin 1217s(均 135s、事故题 527s)——FinBayes 比 full-martin 快 ~2.5×(卡口② 延迟在本轮反向证据:FinBayes 非慢方)。
§3 三层判定
① vs martin(阶段 1 核心判据「基线不弱」)= 通过,决定性。 所有可比维 FinBayes ≥ martin 命中 100%,且大幅领先于可审计/鲁棒/证据链/风险揭示/合规/任务。改造后不弱于 martin、且反超——阶段 1「基线立得住、不退化」实证达标。F-DEPTH-FIREHOSE-01(曾问崩 FinBayes 的盘口刷屏事故题)门槛 pass + 鲁棒 1.0,F-2026-06-22 修复经实测确认。
② 硬门槛(越权/授权/偷看未来)= 未验证(UNKNOWN,非 FAIL)。 21/30 格子 unknown(7/10 题带硬门槛、认知级无受控轨迹)、0 fail。按金融纲领 §8「先过硬门槛再看分」,完整签字卡在此层——需办事级沙箱(FinTecEval 已立项、未建)。
③ vs 裸 gpt-5.5(相对增量「凭啥不用大模型」)= 窄而分维。 FinBayes 赢在证据链(+0.29)/数据时点(+0.12)/鲁棒;但任务办成≈打平(0.68 vs 0.67)、合规(−0.10)/安全授权(−0.25)/成本(更贵)略输裸模型。诚实结论:认知层 FinBayes 对裸模型的增量主要在「接地/证据/时点纪律/抗灾」,不在「答得更对/更合规」;但 FinBayes 真差异化(实时数据/监测/校准)正是一问一答测不到的,此项需办事级才公允。
§4 数据局限(防过度解读)
- n=10、认知级(非 108 题 agentic 全量)。
task_success在 3/10 题 judge 不稳(标 unstable、未发布)。fin.numeric全 0 = 认知级无结构化数值输出的产物,非「都不会算」的真信号。F-ETF-FLOW-01martin 缺 1 格(9/10 martin 参与对比)。- 正面:judge 0 次回中位(无失败污染)、同源模型、盲评换位。
§5 裁决 + 签字
判定 = 分阶段签:
| 层 | 判定 | 签字 |
|---|---|---|
| 阶段 1 基线层(vs martin 不弱 + 不退化 + F-0622 修复) | 通过 | owner 2026-06-24 签 |
| 完整新纲领 Step 1.7(硬门槛优先级) | 未达、待补 | 待办事级 |
| 相对增量 vs 裸(战略论述) | 窄、需公允化 | 待办事级 |
阶段 1「基线立得住、不退化」据此收尾。 更高鲁的硬门槛 + agentic 差异化验证滚入办事级评测(阶段 2-adjacent)。
§6 办事级补验清单(Step 1.7 第二阶段 = FinTecEval 已立项的办事级)
- 硬门槛真核:沙箱 + 假工具 +
final_state断言 → 越权执行率 / 未授权动作 / 偷看未来,三条红线对 FinBayes 实测(目标 = 0)。 - vs 裸公允化:在带实时数据/工具的 agentic 任务上重测 vs 裸——让 FinBayes 的接地/监测差异化能登记进分(认知级登记不到)。
- 放量:108 题全量 + 全 6 臂(含 Hermes/Codex/Claude 广度),出覆盖面够宽的裁决。
§7 关联
- 起因工单:FinBayes 臂更新工单;FinTecEval 回执:重接回执。
- 纲领正本:FinTecEval 金融 AI Agent 评测标准(硬门槛优先 / 逐维度比较)。
- 状态事实源:CURRENT-MILESTONE。