跳到主要内容

FinTecEval 评测引擎

FinTecEval 是面向金融 AI Agent 的评测引擎。它不是通用 Agent 评测平台;通用 Agent 的任务执行、工具使用、权限控制、恢复能力等内容,是金融评测的基础能力,不是最终目标。

它评什么

FinTecEval 评的是一个金融 Agent 在真实金融任务里的表现:

  • 它有没有把用户要办的事办成。
  • 它有没有真实使用数据和工具,而不是靠语言补空。
  • 它有没有守住金融红线:不越权、不偷看未来、不假装有数据、不在缺少依据和授权时给买卖指令。
  • 它有没有解释清楚证据、假设、风险、适用范围和失效条件。
  • 它在不同市场、业务、用户画像和压力场景下,强弱分别在哪里。

当前公开目录

文档作用
FinTecEval 金融 AI Agent 评测标准主标准。说明评测对象、维度、硬门槛、裁判、结论口径。
Case Library题库说明。说明题库规模、覆盖标准、case 结构、样本来源和公开边界。
评测运行流程从选题、沙箱、运行、打分到报告的执行流程。
场景标签体系给题打标签、算覆盖、按场景读结果的统一词表。
术语对照只保留读这些文档必须理解的词。

代码和数据在哪里

本知识库放稳定定义和方法,不放完整 JSON 题库、原始运行数据、密钥、产品内部实现和未公开报告。

  • 可运行代码、完整题库、校验器和报告生成器在实现仓 FinTecEval
  • 具体产品的一次评测报告,归发起评测的产品或治理工作流保存。
  • 本目录可以发布题库规模、覆盖摘要、样例结构和更新规则,但不复制完整题库。

当前状态

截至 2026-06-29,FinTecEval 实现仓的 P0/P1/P2 离线机制验收已经通过:P0 5/5、P1 13/13、P2 9/9,合计 27/27。这个结果说明运行清单、固定入口、报告模板、题库生命周期、裁判协议、金融沙箱、长期校准账本、外部参考登记、发布检查、通用能力档案登记、能力档案报告接入、本地人审样本隔离、本地时间账本样本和 Case Library 治理记录校验的本地合同已经能被机器验证;它不等同于已经完成真实 live 评测、真实人工复核样本、时间裁判结算或治理仓发布实跑。

实现仓 case-library/ 目录中的 Case Library 当前为 112 道题,全部已显式写入生命周期字段。python3 validate.py --require-explicit-lifecycle 通过;python3 validate.py --coverage 显示七类覆盖目标全部达标:评测维度、系统部件、能力地图、金融风险矩阵业务类型、市场结构、特定被测系统信息性标注、用户意图。这个数字是当前实现仓状态,不代表未来固定上限;特定被测系统信息性标注用于诊断,不是 FinTecEval 框架级要求。

这里的覆盖是 Case Library 作为长期题库资产的建设覆盖,不是说每一轮评测都要跑完整题库。面向不同被测对象、阶段目标、能力地图和风险问题时,评测流程会从 Case Library 中选择合适题集,形成该轮评测的运行覆盖和报告结论。题库建设覆盖和单轮评测覆盖必须分开记录。

当前仍未完成的正式证据包括:一次非 offline-smoke 的真实评测臂正式留档运行、5 到 10 条绑定同一正式运行且非 sample_only 的真实人工复核样本、真实观察窗口的时间裁判到期结算样本、至少一个 case 的真实质量治理状态迁移样例,以及带真实仓库、workflow、Railway / 自定义域和公开站点参数的发布检查。公开文档可以说明这些机制和待办,不能把它们写成已经完成的评测结论。

阅读顺序

  1. 先读 FinTecEval 金融 AI Agent 评测标准,理解评测目标和判断口径。
  2. 再读 Case Library,理解题库怎样覆盖金融任务。
  3. 需要落地跑评测时,读 评测运行流程
  4. 读结果或补题时,再查 场景标签体系术语对照