术语对照
这页只解释阅读 FinTecEval 公开文档必须理解的词。正文应尽量直接说明,不依赖代号。
当前实现状态:P0/P1/P2 第一轮本地离线机制验收已通过;真实评测臂、人工复核样本、时间结算样本、Case Library 领域复核样本和公开站点发布一致性仍需单独留证。
| 词 | 意思 |
|---|---|
| 金融 AI Agent | 能围绕金融任务读取数据、调用工具、分步骤行动并留下记录的 AI 系统。 |
| 被测对象 | 本次要评测的 Agent、模型包装、产品版本或历史版本。 |
| 参照对象 | 和被测对象同题比较的对象,例如未加产品改造的大模型、竞品或历史版本。 |
| 未加产品改造的大模型 | 不加产品工具、权限、记忆和业务包装,直接回答用户问题的大模型。 |
| Case Library | FinTecEval 的评测题库。每道题包含用户目标、场景标签、环境、工具、权限、判据和对抗变体等信息。 |
| 场景标签 | 给每道题标注市场、任务类型、用户画像、情绪、复杂度等,用于覆盖检查和结果切片。 |
| 覆盖检查 | 检查题库是否覆盖应测的维度、业务、市场结构、用户意图和风险场景。 |
| 硬门槛 | 先于软评分判断的失败条件,例如未授权执行、偷看未来、伪造数据、触碰合规红线。 |
| 软维度 | 不能完全靠规则判断的质量维度,例如逻辑质量、风险揭示、证据表达、用户可读性。 |
| 沙箱 | 隔离的评测环境。高风险动作只在沙箱里执行,不影响真实账户、客户、交易或外部系统。 |
| 授权门控 | 高风险动作必须取得用户对具体动作的明确授权,不能用泛泛同意替代。 |
| 数据时点 | 题目允许使用的数据截止时间。超过这个时间的数据不能进入判断。 |
| 证据链 | 从结论追溯到工具调用、数据来源、计算过程和判断依据的记录。 |
| 故障注入 | 主动制造空结果、超时、权限不足、坏数据等情况,检查 Agent 是否能恢复或诚实失败。 |
| 对抗变体 | 诱导 Agent 越权、假填、过度自信、成本失控或泄露信息的压力题。 |
| 留出题 | 不用于产品修正或日常修正,只用于验收泛化能力的题。 |
| 多次运行 | 同一道题独立跑多次,用来检查结果是否稳定。 |
| 模型裁判 | 由大模型辅助评价软维度。只能作为趋势信号,必须盲评、换位、多裁判并记录一致性。 |
| 真人裁判 | 由目标用户或领域专家判断内容是否可理解、可复核,风险边界和下一步是否清楚。成本高,适合抽样、争议题和产品体验判断。 |
| 时间裁判 | 对带概率或未来兑现条件的判断,等事实发生后再结算。 |
| 场景切片 | 按场景标签汇总结果,说明 Agent 在哪类金融场景强、哪类弱。 |
容易混淆的旧说法
旧文档里常出现“底线”“及格线”“能力坐标”等说法。新文档统一改成更直接的表达:
| 旧说法 | 当前说法 |
|---|---|
| 底线 | 和未加产品改造的大模型的逐维度比较。 |
| 及格线 | 和竞品或历史版本的逐维度比较。 |
| 对照臂 | 参照对象。 |
| 能力坐标 / 坐标报告 | 逐维度结果和场景切片报告。 |
| 题库进料口 | Case Library。 |
旧说法保留在历史记录中,公开主文档不再以它们作为主线。