FinTecEval 回执:FinBayes 臂已重接 + 实证 + 底座对齐回问
收到 2026-06-23 工单。已按 §2/§3/§4 重接三臂并跑认知级 6 臂冒烟验证。本回执:①做了什么 ②实证(工单判断被数据印证)③回问 FinBayes 侧(底座对齐 §5 我下一步要的料)。FinTecEval 仓代码改动均在本会话、未提交。
§1 已照工单做的
- FinBayes 臂重接:旧
run_finbayes_*.py的synthesize_cognition认知核裸跑 → 弃用。新建harness/finbayes_react_arm.py,port 自CurvatureLabs/FinBayes/scripts/three_way_compare.py的_finbayes_arm:- 真 ReAct 主回路
AgentLoop.process_direct(answer_extraction_mode="prose_parse"、max_iterations=12)。 - 临时工作区 +
sync_workspace_templates→ SOUL 在场已验证True(DCF 题 system_prompt 含 SOUL)。 TracingProvider抓 system_prompt / 每轮工具 / finish;空答案兜底 message 工具文本。- 补 CountingProvider 口径 token 累加(prompt+completion,工单 §3 缺口)——但见 §3 现状。
goal→prompt/id/axes.task_type→task_type薄映射(工单 §3 陷阱1)。未整模块 import(避开ab_alpha_deltaCASES,工单陷阱2)。
- 真 ReAct 主回路
- martin 臂 → full(工单 §4 建议):
finclaw agent -m <prompt> --logs --no-markdown,--logs正则抓Tool call:工具调用。N2 有损折扣口径待方法学定。 - Hermes:工单未列、owner 补充——FinTecEval 先前误判"未部署"。实为已部署本地
hermesCLI(hermes -z <prompt>一问一答),已接为通用智能体臂。 - SUT pin:FinTecEval
STATE.md已由过期d16052d更到88f68a6。
§2 实证:工单"旧接法测错了东西"被数据印证
认知级 6 臂冒烟(3 纯认知题 × FinBayes-δ / full-martin / Hermes / 裸 gpt-5.5 / Codex / Claude;盲评=中转站 gpt-5.5 + claude-opus-4-6 两旗舰模型换位、每维 1–5、IAA<0.7 标 unstable)。重接前后同题对比,直接验证工单核心判断:
| 题 / 维 | 认知核裸跑(旧/错) | 真 ReAct δ(新/对) |
|---|---|---|
| 评判用户判断 · task_success | 0.38(vs 裸 −0.31) | 0.81(vs 裸 +0.19) |
| BTC/ETH 对比 · trajectory_quality | —(认知核无轨迹) | 1.0(真多步) |
- 真 ReAct 抓到真工具调用:评判题 FinBayes 调
crypto×3 +macro_monitor;对比题crypto×6;DCF 解释题无工具(不需数据,正确)。full martin 对比题调crypto×4 +stock_quote×2。 - 结论:旧认知核裸跑系统性低估 FinBayes(无 grounding、无轨迹维),工单判断成立。重接后 FinBayes 在 grounding-重的题上明显回升、轨迹质量满分。
§3 现状缺口(需 FinBayes 侧供料 / 回问)
底座对齐(工单 §5)——✅ FinTecEval 侧已自解 + 验证(无需 FinBayes 侧再答,记录备审):
- 根因:
finbayes/config/schema.py::_match_provider里forced = agents.defaults.provider,只要 ≠"auto" 就强制用该 provider、无视模型串。先前agents.defaults.provider仍为openai_codex,故即便把 model 改custom/gpt-5.5也仍走 codex 通道(实测报HTTP 400: 'custom/gpt-5.5' not supported when using Codex with a ChatGPT account)。 - 改法(在
finbayes_react_arm.py内存覆盖、不改生产配置文件):config.agents.defaults.provider="custom"+config.providers.custom.api_base="https://api.gpt.ge/v1"+api_key=<keychain VAPI_GPT55>+model="gpt-5.5"+ 清空fallback_models。 - 验证:实测
pinned=relay-gpt.ge-gpt-5.5 / model=gpt-5.5 / token=17832+2565(已报出,cost 维可测)/ 49.9s(快于 codex 95–167s)/ SOUL 在场。三臂现同源中转站 gpt-5.5,达 §5 apples-to-apples。--no-relay可退回 codex 默认。
其余(待 FinBayes 侧 / owner):标答 owner-pending(只影响软维盲评,硬门槛不卡);gpt.ge 仅暴露 gpt-5.5 单底座(FEFM 第二底座信号空缺,不阻塞 gate)。
其余:标答 owner-pending(只影响软维盲评,硬门槛不卡);gpt.ge 仅暴露 gpt-5.5 单底座(FEFM 第二底座信号空缺,不阻塞 gate)。
§4 下一步排期(owner 拍:先反馈 → 再精修 → 后放量)
- 本回执(反馈 + 回问)✓。
- 底座对齐精修:据 FinBayes 侧 §3 回问把 FinBayes 臂钉中转站 gpt-5.5、拿回 token。
- 放量真三臂(工单 §6):FinBayes δ + full martin + 裸 gpt-5.5,over 108 题(或 cases.json 10 锚 + 广度子集),过新打分引擎(硬门槛优先 → 六/八维 → 相对增量 → 软维盲评)→ 出裁决 → 回主控会话审计 → owner 签 Step 1.7。
§5 边界
- 本轮是认知级 3 题冒烟(验管线 + 实证重接影响),非 Step 1.7 裁决。Step 1.7 要 §4.3 的 108 题真三臂 + 主控审计。
- FinTecEval 侧产物:
harness/{run_smoke_cognition,finbayes_react_arm,score_smoke}.py、runs/2026-06-22-smoke-6arm/(report.md + scores.json,runs 默认 gitignore)。代码改动归 FinTecEval 会话,未提交。 - 守跨会话分工:本回执只在治理库工作流加新文件、不改 FinBayes/主控的任何文件。