FinBayes 新基线同步 + 阶段一/二测试评测任务交接
致 FinTecEval 评测引擎(系统性评测 owner)。本文做三件事:① 同步 FinBayes 新基线自上次移交后的全部变化;② 把阶段一 / 阶段二的测试与评测任务交给 FinTecEval 分担;③ 把 Step 1.7 闸门 runbook 交 FinTecEval 执行。
分工口径(CURRENT-MILESTONE §7):FinTecEval 拥有系统性评测层;主控做审计 / 验收 / 守正轨;owner 签字。逐切片 live 烟测随工程走,系统层评测归 FinTecEval。
§1 新基线背景同步(自 N1–N7 移交以来的变化,必读)
基线 = CurvatureLabs/FinBayes(大驼峰),martin-finclaw 作上游 baseline 已整体继承(31 金融工具在子包里)。两阶段框架:阶段一「基线立得住、不退化」;阶段二「战略对齐 + 反向矫正」。
阶段一工程侧已落地(分支 claude/baseline-rebuild,已推 owner 个人仓):
- 1.2-a ReAct pivot:真实缺陷是「金融问题被旁路进静态流水线、绕过主回路」的倒置——已拆该旁路;金融意图交主回路 LLM(不预分类/不预编 DAG)。加 MP-4 软质量指引(system prompt 软编码金融 procedure)+ α/δ 末答双口子,A/B 定 默认 δ(结构字段干净)。生产默认
react_cognition=True/delta。多标的并行compare_assetsfan-out。 - 1.2-b 工具广度:核查即达成、已反超 martin。实测每 case 平均 6.8–7.0 个工具 / 16–18 种,martin 仅 1.5 个 / 6 种。
- 1.3 去 martin 化:11 项做 10 项(包
finclaw→finbayes改名、删 martin 文档、license、配置目录迁移、skill 元数据键)。 - 1.4 INV-11 凭证脱敏:确认无新增暴露面。
- 1.6 灵魂重写:把 martin 继承的「Finclaw 爱表态盯盘助手」人格换成 FinBayes 认知形态(判断四要素 = 方向 + 证据/时点 + 可监测失效条件 + 反方 + 不确定性;说人话;动作限定边界内条件化;不裸喊买卖;不写硬执行边界)。
- 1.7 闸门:待跑(本文 §3 交接给 FinTecEval)。
- 全量离线 205 passed、ruff 净。
FinTecEval 必须知道的几条实证修正(旧结论已过时,别再用):
- 延迟不是 3-9x。旧 §6/§8 审计的「FinBayes 慢 martin 3-9 倍」是旧静态流水线的数。ReAct pivot 后实测 δ ≈ martin 的 1.2–2.4x(简单题近平、多标的重题最高 2.4x),换来 7–15 工具 + 完整结构化答案。评测「执行效率」维请按新区间,别套旧 3-9x。
- 工具广度不再是短板,已反转为优势(见 1.2-b)。旧「数据接地只报价、每轮 1 工具」是旧仓的事。
- 旧 30-case baseline json 是旧静态路径(
projects/finbayes/engineering侧引用的 5/26finbayes-vs-martinpmm-finclaw-30case-kimi-results.json:FinBayes 侧 avg 1.93s、全 C/B、13 次工具调用)。新 ReAct 路径预期质量更强但更慢——这是 pivot 取舍。"不退化"对比据此读。 - 此前会话内 6 群体盲评 + 3-judge 的「δ 5/6≥martin」结论用的是改灵魂之前的系统提示,已部分失效,1.7 须用新灵魂重评。
未决/边界(评测时注意,勿当硬约束写死):exec/cron 工具 owner 拍「暂留开」;旧仓 INV-01 工具只读安全标签在切基线时丢失(阶段二加固候选);README「Non-Execution Boundary」硬执行边界与已撤 identity 护栏有张力(阶段二战略对齐 + 未决六)。
§2 交给 FinTecEval 的测试 / 评测任务(阶段一 + 阶段二)
阶段一(当前,P0):
- T-1.7 执行 vs-martin 6 维度闸门(本文 §3)—— 阶段一唯一交付判据。这是当前头号任务。
- N1 agent 行为评测:测真多步 / 真调工具 / 真拉数据,把散在各切片的 agent 行为 live 门收成系统层。
- N2 跨 agent 对比公平化:现 harness 的 martin 工具数取自
--logs正则嗅探、有损、系统性低估 martin;FinTecEval 负责修成公平测量 + 保留锁同模型纪律。 - N3 grounding 深度维:区分「会填格」(有失效条件/反方字段)与「有据」(字段真被工具数据支撑)。新路径每 case 7–15 工具,重点核 grounding 是否真兑现。
- N7 延迟 / 性能:把速度列为评测维度与门(新区间 ~1.2–2.4x)。
阶段二(架构改造期,随工程推进):
- 认知质量随阶段二 cognition ontology 决策(方案 A/B/C)演进的评测;慢循环复盘线(事后校准)建成后的 N4 判断跟进 + 校准评测(两层验证枚举 + 跨时间 Brier + 按市场结构分组)。
- N5 现有评测资产(D1–D11 / MCA 桶 / V 维 / 14 case 校准集)按 agent 框架 + ADR-022 重构对齐。
- N6
evals/包分层倒置依赖反转(与工程会话协调)。
§3 Step 1.7 闸门 runbook 交接(FinTecEval 执行)
判据:同 case 同 provider/model 下 FinBayes(改造后 = 新 ReAct 路径 + 新灵魂, δ)vs martin 6 维度只强不弱(输出质量 / 执行效率 / token / 成功率 / 工具深度 / 结构化完整度)+ 不退化 vs 5/26 baseline。
工程仓已备好的执行件(在 CurvatureLabs/FinBayes,本治理仓不放工程产物,仅给指针):
- runbook:
docs/design/step-1.7-gate-runbook.md(完整跑法:环境前置 / 钉同款 Kimi / D9 martin 配置补救 / 自动 4 维 + 人工 2 维评分 / N2 不对称披露 / 不退化对比 / 签字)。 - 闸门 harness:
scripts/gate_1_7_vs_martin.py(跑新路径 δ + martin,30 个EVALUATION_SCENARIOS,自动算执行效率/工具深度/成功率/结构化完整度,可续跑)。注意:旧scripts/run_finbayes_package_c_30case.py跑的是旧静态路径、不能做闸门。
FinTecEval 执行要点:① 在 owner 终端真模型跑(沙箱可达网关但正式签字口径走 owner 终端);② 钉同款 Kimi(moonshot kimi-k2.6)以对齐 5/26 baseline;③ 跑前确认 martin 的配置目录就位(D9 副作用,runbook §1 已说明补救);④ 自动 4 维 harness 出,质量 + grounding 两维另跑 LLM-judge 盲评或人工、且用新灵魂输出;⑤ 产出一页 6 维对比表 + 净判定,交主控审计、owner 签字。
§4 边界与回路
- FinTecEval 执行评测、产证据;主控独立审计(不信报告自查、读 harness 源码核诚实口径、披露不对称);owner 签字定阶段一是否收尾。
- 评测口径 / case 库 / 公平测量的系统性设计归 FinTecEval;动不变量、定战略方向、跨阶段决策归 owner。
- 工程产物(harness 代码 / run 数据 / 日志)留工程仓与私有运行环境,不进本治理仓;本 workstream 只存评测口径、SSOT 归属、交接与审计结论。