跳到主要内容

FinTecEval 回执:FinBayes 臂已重接 + 实证 + 底座对齐回问

收到 2026-06-23 工单。已按 §2/§3/§4 重接三臂并跑认知级 6 臂冒烟验证。本回执:①做了什么 ②实证(工单判断被数据印证)③回问 FinBayes 侧(底座对齐 §5 我下一步要的料)。FinTecEval 仓代码改动均在本会话、未提交。

§1 已照工单做的

  • FinBayes 臂重接:旧 run_finbayes_*.pysynthesize_cognition 认知核裸跑 → 弃用。新建 harness/finbayes_react_arm.pyport 自 CurvatureLabs/FinBayes/scripts/three_way_compare.py_finbayes_arm
    • 真 ReAct 主回路 AgentLoop.process_directanswer_extraction_mode="prose_parse"max_iterations=12)。
    • 临时工作区 + sync_workspace_templatesSOUL 在场已验证 True(DCF 题 system_prompt 含 SOUL)。
    • TracingProvider 抓 system_prompt / 每轮工具 / finish;空答案兜底 message 工具文本。
    • 补 CountingProvider 口径 token 累加(prompt+completion,工单 §3 缺口)——但见 §3 现状。
    • goal→prompt / id / axes.task_type→task_type 薄映射(工单 §3 陷阱1)。未整模块 import(避开 ab_alpha_delta CASES,工单陷阱2)。
  • martin 臂 → full(工单 §4 建议):finclaw agent -m <prompt> --logs --no-markdown--logs 正则抓 Tool call: 工具调用。N2 有损折扣口径待方法学定。
  • Hermes:工单未列、owner 补充——FinTecEval 先前误判"未部署"。实为已部署本地 hermes CLI(hermes -z <prompt> 一问一答),已接为通用智能体臂。
  • SUT pin:FinTecEval STATE.md 已由过期 d16052d 更到 88f68a6

§2 实证:工单"旧接法测错了东西"被数据印证

认知级 6 臂冒烟(3 纯认知题 × FinBayes-δ / full-martin / Hermes / 裸 gpt-5.5 / Codex / Claude;盲评=中转站 gpt-5.5 + claude-opus-4-6 两旗舰模型换位、每维 1–5、IAA<0.7 标 unstable)。重接前后同题对比,直接验证工单核心判断:

题 / 维认知核裸跑(旧/错)真 ReAct δ(新/对)
评判用户判断 · task_success0.38(vs 裸 −0.31)0.81(vs 裸 +0.19)
BTC/ETH 对比 · trajectory_quality—(认知核无轨迹)1.0(真多步)
  • 真 ReAct 抓到真工具调用:评判题 FinBayes 调 crypto×3 + macro_monitor;对比题 crypto×6;DCF 解释题无工具(不需数据,正确)。full martin 对比题调 crypto×4 + stock_quote×2。
  • 结论:旧认知核裸跑系统性低估 FinBayes(无 grounding、无轨迹维),工单判断成立。重接后 FinBayes 在 grounding-重的题上明显回升、轨迹质量满分。

§3 现状缺口(需 FinBayes 侧供料 / 回问)

底座对齐(工单 §5)——✅ FinTecEval 侧已自解 + 验证(无需 FinBayes 侧再答,记录备审)

  • 根因:finbayes/config/schema.py::_match_providerforced = agents.defaults.provider只要 ≠"auto" 就强制用该 provider、无视模型串。先前 agents.defaults.provider 仍为 openai_codex,故即便把 model 改 custom/gpt-5.5 也仍走 codex 通道(实测报 HTTP 400: 'custom/gpt-5.5' not supported when using Codex with a ChatGPT account)。
  • 改法(在 finbayes_react_arm.py 内存覆盖、不改生产配置文件):config.agents.defaults.provider="custom" + config.providers.custom.api_base="https://api.gpt.ge/v1" + api_key=<keychain VAPI_GPT55> + model="gpt-5.5" + 清空 fallback_models
  • 验证:实测 pinned=relay-gpt.ge-gpt-5.5 / model=gpt-5.5 / token=17832+2565(已报出,cost 维可测)/ 49.9s(快于 codex 95–167s)/ SOUL 在场。三臂现同源中转站 gpt-5.5,达 §5 apples-to-apples。--no-relay 可退回 codex 默认。

其余(待 FinBayes 侧 / owner):标答 owner-pending(只影响软维盲评,硬门槛不卡);gpt.ge 仅暴露 gpt-5.5 单底座(FEFM 第二底座信号空缺,不阻塞 gate)。

其余:标答 owner-pending(只影响软维盲评,硬门槛不卡);gpt.ge 仅暴露 gpt-5.5 单底座(FEFM 第二底座信号空缺,不阻塞 gate)。

§4 下一步排期(owner 拍:先反馈 → 再精修 → 后放量)

  1. 本回执(反馈 + 回问)✓。
  2. 底座对齐精修:据 FinBayes 侧 §3 回问把 FinBayes 臂钉中转站 gpt-5.5、拿回 token。
  3. 放量真三臂(工单 §6):FinBayes δ + full martin + 裸 gpt-5.5,over 108 题(或 cases.json 10 锚 + 广度子集),过新打分引擎(硬门槛优先 → 六/八维 → 相对增量 → 软维盲评)→ 出裁决 → 回主控会话审计 → owner 签 Step 1.7。

§5 边界

  • 本轮是认知级 3 题冒烟(验管线 + 实证重接影响), Step 1.7 裁决。Step 1.7 要 §4.3 的 108 题真三臂 + 主控审计。
  • FinTecEval 侧产物:harness/{run_smoke_cognition,finbayes_react_arm,score_smoke}.pyruns/2026-06-22-smoke-6arm/(report.md + scores.json,runs 默认 gitignore)。代码改动归 FinTecEval 会话,未提交。
  • 守跨会话分工:本回执只在治理库工作流加新文件、不改 FinBayes/主控的任何文件。