场景标签体系
场景标签体系是一套统一词表,用来给每道评测题标注它属于哪类金融任务。出题时用这套词表,读结果时也用这套词表。这样报告才能说清楚:Agent 在哪类场景强、哪类场景弱。
当前实现状态:实现仓 Case Library 共有 112 道 active case,覆盖检查已按本标签体系通过。该结果说明长期题库的结构覆盖达标;不等于每道题都已经完成领域专家复核,也不等于任意一轮评测已经跑完这些 case。
为什么需要统一标签
如果出题的人说“这是衍生品题”,读结果的人按另一套词统计,就无法判断衍生品场景到底表现如何。统一标签解决三件事:
- 出题时知道每类金融任务是否都有样本。
- 题库扩充时能看到缺口。
- 报告中能按场景切片,定位强弱。
十三个维度
机器可读的准确定义以 scenario-ontology.json 为准。本文是人读版。
| 维度 | 机器键 | 这个维度问什么 | 取值 |
|---|---|---|---|
| 任务类型 | task_type | 用户想办什么 | explain 解释 · analyze 分析 · compare 比较 · review 复盘 · risk_id 风险识别 · trade_prep 交易准备 · trade_decision_aid 交易决策辅助 |
| 业务类型 | business_type | 属于哪类金融业务 | investment_advice 投资建议/研究 · trade_execution 交易执行 · lending 授信/贷款 · insurance 保险 · wealth_management 财富管理/组合 · customer_service 客服/运营 |
| 市场 | market | 问的是哪个市场或标的域 | a_shares A股 · us_equities 美股 · hk_equities 港股 · crypto 加密 · rates 利率/债券 · fx_dollar 美元/汇率 · gold 黄金 · macro_cross_asset 宏观跨市场 · general 通用 |
| 市场结构 | market_structure | 这个任务依赖哪类市场结构 | developed_institutional 发达机构市 · developed_sovereign_fund 发达市场长钱配置 · developed_onchain 发达链上结构 · a_share_policy_clearing A股政策出清 · a_share_policy_ignition A股政策点火 · a_share_retail_stampede A股散户踩踏 · a_share_cross_market A股跨市场传导 · em_sovereign_currency_crisis 新兴市场主权/汇率危机 |
| 逻辑类型 | logic_type | 背后是哪类金融逻辑 | macro_liquidity 宏观流动性 · valuation 估值 · risk_appetite 风险偏好 · event_transmission 事件传导 · behavioral_bias 行为偏差 · derivatives_mechanics 衍生品机制 |
| 风险形态 | risk_shape | 主要检查哪类风险 | authz_gate 授权门控 · privacy 隐私 · suitability 适当性 · misleading_advice 误导性建议 · data_asof 数据时点 · evidence_integrity 证据完整性 · robustness_fault 故障恢复 · cost_overrun 成本失控 |
| 时序 | time_horizon | 看多长时间 | event_window 事件窗 · weeks 数周 · mid_long_term 中长期 · na 无时序 |
| 情绪烈度 | emotion_intensity | 用户带着什么情绪 | neutral 中性 · anxious_trapped 焦虑/套牢 · fomo_chasing 追高/FOMO |
| 复杂度 | complexity | 该用多深的回答 | intro_concept 入门概念 · routine_analysis 常规分析 · professional_theory 专业分析 |
| 会话连续性 | session_continuity | 是否要持续跟踪 | one_shot 一次性 · multi_turn 多轮连续 |
| 用户类型 | user_archetype | 谁在问 | retail 散户 · macro_allocator 宏观配置者 · risk_manager 风险管理者 |
| 认知阶段 | cognition_chain_stage | 分析师视角的细分,可选 | context_positioning 情境定位 · evidence_layering 证据分层 · impact_mapping 影响映射 |
| 尺度 | scale | 标的范围,可选 | single_asset 单标的 · macro 宏观 · cross_asset 跨资产 |
怎么用于 Case Library
每道题入库时都要打标签。覆盖检查会统计:
- 每个维度有哪些取值已经有题。
- 哪些取值没有题。
- 哪些取值只有少量题,不足以支撑稳定结论。
当前完整覆盖检查在实现仓运行。治理库发布覆盖标准和摘要,不复制完整 JSON 题库。题库结构覆盖和单轮评测运行覆盖要分开记录:前者说明长期题库建设状态,后者说明某一次评测实际选了哪些题、未覆盖哪些题。
怎么用于报告
评测结束后,报告按同一套标签切片。例如:
被测 Agent 在“交易决策辅助 × 衍生品机制 × 焦虑用户”场景下,证据链弱于参照对象。
这类结论只有在出题和读结果使用同一套标签时才成立。
修改规则
修改标签体系必须同时更新人读文档和机器文件:
- 人读版:本页。
- 机器版:
scenario-ontology.json。
新增或修改维度、取值时,要说明为什么现有标签不能表达这个场景。不能为了某个产品内部实现临时改标签。