跳到主要内容

术语对照

这页只解释阅读 FinTecEval 公开文档必须理解的词。正文应尽量直接说明,不依赖代号。

当前实现状态:P0/P1/P2 第一轮本地离线机制验收已通过;真实评测臂、人工复核样本、时间结算样本、Case Library 领域复核样本和公开站点发布一致性仍需单独留证。

意思
金融 AI Agent能围绕金融任务读取数据、调用工具、分步骤行动并留下记录的 AI 系统。
被测对象本次要评测的 Agent、模型包装、产品版本或历史版本。
参照对象和被测对象同题比较的对象,例如未加产品改造的大模型、竞品或历史版本。
未加产品改造的大模型不加产品工具、权限、记忆和业务包装,直接回答用户问题的大模型。
Case LibraryFinTecEval 的评测题库。每道题包含用户目标、场景标签、环境、工具、权限、判据和对抗变体等信息。
场景标签给每道题标注市场、任务类型、用户画像、情绪、复杂度等,用于覆盖检查和结果切片。
覆盖检查检查题库是否覆盖应测的维度、业务、市场结构、用户意图和风险场景。
硬门槛先于软评分判断的失败条件,例如未授权执行、偷看未来、伪造数据、触碰合规红线。
软维度不能完全靠规则判断的质量维度,例如逻辑质量、风险揭示、证据表达、用户可读性。
沙箱隔离的评测环境。高风险动作只在沙箱里执行,不影响真实账户、客户、交易或外部系统。
授权门控高风险动作必须取得用户对具体动作的明确授权,不能用泛泛同意替代。
数据时点题目允许使用的数据截止时间。超过这个时间的数据不能进入判断。
证据链从结论追溯到工具调用、数据来源、计算过程和判断依据的记录。
故障注入主动制造空结果、超时、权限不足、坏数据等情况,检查 Agent 是否能恢复或诚实失败。
对抗变体诱导 Agent 越权、假填、过度自信、成本失控或泄露信息的压力题。
留出题不用于产品修正或日常修正,只用于验收泛化能力的题。
多次运行同一道题独立跑多次,用来检查结果是否稳定。
模型裁判由大模型辅助评价软维度。只能作为趋势信号,必须盲评、换位、多裁判并记录一致性。
真人裁判由目标用户或领域专家判断内容是否可理解、可复核,风险边界和下一步是否清楚。成本高,适合抽样、争议题和产品体验判断。
时间裁判对带概率或未来兑现条件的判断,等事实发生后再结算。
场景切片按场景标签汇总结果,说明 Agent 在哪类金融场景强、哪类弱。

容易混淆的旧说法

旧文档里常出现“底线”“及格线”“能力坐标”等说法。新文档统一改成更直接的表达:

旧说法当前说法
底线和未加产品改造的大模型的逐维度比较。
及格线和竞品或历史版本的逐维度比较。
对照臂参照对象。
能力坐标 / 坐标报告逐维度结果和场景切片报告。
题库进料口Case Library。

旧说法保留在历史记录中,公开主文档不再以它们作为主线。