FinTecEval 评测引擎
FinTecEval 是面向金融 AI Agent 的评测引擎。它不是通用 Agent 评测平台;通用 Agent 的任务执行、工具使用、权限控制、恢复能力等内容,是金融评测的基础能力,不是最终目标。
它评什么
FinTecEval 评的是一个金融 Agent 在真实金融任务里的表现:
- 它有没有把用户要办的事办成。
- 它有没有真实使用数据和工具,而不是靠语言补空。
- 它有没有守住金融红线:不越权、不偷看未来、不假装有数据、不在缺少依据和授权时给买卖指令。
- 它有没有解释清楚证据、假设、风险、适用范围和失效条件。
- 它在不同市场、业务、用户画像和压力场景下,强弱分别在哪里。
当前公开目录
| 文档 | 作用 |
|---|---|
| FinTecEval 金融 AI Agent 评测标准 | 主标准。说明评测对象、维度、硬门槛、裁判、结论口径。 |
| Case Library | 题库说明。说明题库规模、覆盖标准、case 结构、样本来源和公开边界。 |
| 评测运行流程 | 从选题、沙箱、运行、打分到报告的执行流程。 |
| 场景标签体系 | 给题打标签、算覆盖、按场景读结果的统一词表。 |
| 术语对照 | 只保留读这些文档必须理解的词。 |
代码和数据在哪里
本知识库放稳定定义和方法,不放完整 JSON 题库、原始运行数据、密钥、产品内部实现和未公开报告。
- 可运行代码、完整题库、校验器和报告生成器在实现仓
FinTecEval。 - 具体产品的一次评测报告,归发起评测的产品或治理工作流保存。
- 本目录可以发布题库规模、覆盖摘要、样例结构和更新规则,但不复制完整题库。
当前状态
截至 2026-06-29,FinTecEval 实现仓的 P0/P1/P2 离线机制验收已经通过:P0 5/5、P1 13/13、P2 9/9,合计 27/27。这个结果说明运行清单、固定入口、报告模板、题库生命周期、裁判协议、金融沙箱、长期校准账本、外部参考登记、发布检查、通用能力档案登记、能力档案报告接入、本地人审样本隔离、本地时间账本样本和 Case Library 治理记录校验的本地合同已经能被机器验证;它不等同于已经完成真实 live 评测、真实人工复核样本、时间裁判结算或治理仓发布实跑。
实现仓 case-library/ 目录中的 Case Library 当前为 112 道题,全部已显式写入生命周期字段。python3 validate.py --require-explicit-lifecycle 通过;python3 validate.py --coverage 显示七类覆盖目标全部达标:评测维度、系统部件、能力地图、金融风险矩阵业务类型、市场结构、特定被测系统信息性标注、用户意图。这个数字是当前实现仓状态,不代表未来固定上限;特定被测系统信息性标注用于诊断,不是 FinTecEval 框架级要求。
这里的覆盖是 Case Library 作为长期题库资产的建设覆盖,不是说每一轮评测都要跑完整题库。面向不同被测对象、阶段目标、能力地图和风险问题时,评测流程会从 Case Library 中选择合适题集,形成该轮评测的运行覆盖和报告结论。题库建设覆盖和单轮评测覆盖必须分开记录。
当前仍未完成的正式证据包括:一次非 offline-smoke 的真实评测臂正式留档运行、5 到 10 条绑定同一正式运行且非 sample_only 的真实人工复核样本、真实观察窗口的时间裁判到期结算样本、至少一个 case 的真实质量治理状态迁移样例,以及带真实仓库、workflow、Railway / 自定义域和公开站点参数的发布检查。公开文档可以说明这些机制和待办,不能把它们写成已经完成的评测结论。
阅读顺序
- 先读 FinTecEval 金融 AI Agent 评测标准,理解评测目标和判断口径。
- 再读 Case Library,理解题库怎样覆盖金融任务。
- 需要落地跑评测时,读 评测运行流程。
- 读结果或补题时,再查 场景标签体系 和 术语对照。