跳到主要内容

FinBayes 内测群真实问答田野样本(2026-06-19~21)

给 FinTecEval Case Library 重构当真实场景参考样本。这是一手田野数据:FinBayes 内测群里团队成员这几天真实提的问题,不是设计出来的测试题。

已去标识:去掉发问人身份,个人持仓表态类抽象成「模式」,只保留对出题有用的问题结构。原始完整问答存在运行态会话存档(内测群,2026-06-19~21),需要更细可回那里挖。

边界:本文只提供原始样本 + 结构观察。按 FinTecEval 现行场景标签体系给每条打标,是 FinTecEval 会话的事——本文不预先贴标签,避免两套标签打架。

为什么这批样本值钱

  1. 真实需求,不是想象。30 题旧库是设计出来的;这批是真实用户在真实场景里自发问的,能校准旧库「假设的场景分布」和「真实分布」差多远。
  2. 暴露了一类旧库可能缺的题型:跨资产条件级联推演(「若 BTC 跌到某价位 → MSTR 被动卖币」)、多轮监测设置(用户中途纠正「不要定时、要信号触发」)、判断质询(用户要求 agent 给出某个分价位判断的依据)。
  3. 一个能直接变成评测案例的真实失败:用户明确要「信号触发式提醒」,agent 口头答应并写进长期记忆,但系统只有定时轮询、没有事件触发引擎——承诺了一个不存在的能力。这种「言行不一致」正是评测体系该抓的,可做成一道专门的 case。

样本全集(20 条真实提问,按主题归类)

A. 宏观 / 利率(4 条)

  1. 当前美联储从降息预期转向加息叙事、并开启加息的概率有多大?若加息预计何时开启?会对全球各金融市场和主要标的产生哪些影响?
  2. 当前从降息预期转为加息叙事、甚至转向连续加息的可能性有多大?逻辑和发生路径会是怎样?美联储更新点阵图的逻辑是什么——基于当下事实数据,还是会有预判和预期管理?
  3. 外汇市场 USDCNY 的市场情况,以及短期内(如三个月内)再次走强(回到 7 以上)的可能性和概率?它的涨跌受哪些宏观数据和事件影响?
  4. (承上)把利率变化相关的关键指标及触发位纳入监测。

结构观察:典型「概率 + 时点 + 传导路径 + 受影响标的」四要素复合问,且要求区分「事实驱动 vs 预期管理」。USDCNY 那条带明确阈值触发位(回到 7 以上)。

B. BTC 市场结构(3 条)

  1. 当前 BTC 价格多少?处于短/中/长期什么阶段?是否出现熊市见底信号?
  2. BTC 从日 K 看仍处 bearish 市场结构,回调到 EMA20 遇阻,判断有较大概率再测前低 60k 附近。请从其他方面分析,有哪些打破当前市场结构走向的可能性?(如宏观、或某些低周期发生 CHoCH 后增大大级别走高概率)
  3. 「看 BTC / NVDA 当前位」「看 BTC 修复位」「看 ETH 风险拆解」「看 CRCL 监管影响」(快捷追问型)。

结构观察:用户自带专业市场结构语言(市场结构、EMA20、CHoCH、前低),要求 agent 在用户已有判断之上做反向证伪(「有哪些可能打破我的判断」)——这是「质疑既有 thesis」型,不是从零分析。

C. MSTR / MicroStrategy 事件链(6 条,最密集)

  1. MicroStrategy 这波卖币对市场情绪(机构、个人)的影响?导致这次卖币的可能原因?未来隐患?并根据其公司情况推演:若 BTC 持续下跌(联动其股票),它可能在哪些价位被动再次卖币套现保命,及原因。
  2. (针对 agent 给出的「$50K 以上大概率不被迫卖 / $40K 以下进入压力区 / $30K 附近被动套现风险显著上升 / $20K–$25K 接近生存压力」判断)这个判断如何得出?依据是什么?(如跌破 40K 是否低于其平均成本、是否导致市场不再看好)——要求详细依据。
  3. 历史上 MSTR 有过多少次 BTC 卖出事件?分别在什么时间、什么市场(宏观/美股/加密)背景下?分别产生了什么市场反应?
  4. MSTR 作为美股上市公司,其买卖 BTC 的决策与执行是否需完全符合公开披露流程?是否存在未披露的黑盒买卖可能?其加密资产财库地址是什么?能否公开监测和审计?
  5. MSTR 所需支付的永续优先股股息和可转债利息分别多少?支付周期(年/季/月)?目前现金储备多少?未来大额债务到期时间?推演未来债务与股息偿还压力下,MSTR 可能的卖币方案和时间点。

结构观察:这是最有价值的一簇。特征:(a) 跨资产条件级联(BTC 价格 → MSTR 资产负债表压力 → 被动卖币事件);(b) 要求量化触发价位 + 给依据;(c) 牵出可审计性 / 披露合规 / 链上财库等接地能力;(d) 债务到期时间线驱动的情景推演。一道题就能压测「多跳推理 + 接地 + 量化 + 时间线」。

D. 判断质询 + 用户自身 thesis(2 条)

  1. (承 C-9)质疑既有分价位判断、要求给出可证伪依据。
  2. 【模式,已抽象个人表态】 用户陈述一个个人长期持仓 thesis(对某资产长期持有的风险判断),请 agent:(a) 评价这个想法是否成立;(b) 定义在什么情况出现时,自己应该放弃这个想法

结构观察:D-14 是「请 agent 帮我给我自己的判断定失效条件」——判断生命周期里「失效条件作者」用例的真实出现,正好对上 FinBayes 校准账本要的「带失效条件的 standing judgment」。

E. 监测设置(多轮,最关键的一组交互)

  1. 把前面这几个问题涉及的 BTC / 利率变化 / USDCNY 变化的关键指标及触发位,加入监测提醒。
  2. 不用定时提醒,信号触发时告知即可。

结构观察:这是一道天然的多轮 case。用户先给监测意图(E-15),agent 第一反应是「先加定时监测」,用户立刻纠正(E-16)「不要定时、要信号触发」。它同时考三件事:(a) 能不能把自然语言意图落成可执行的监测规则;(b) 能不能区分「定时轮询 vs 事件触发」并按用户偏好切换;(c) 诚实性——系统没有事件触发引擎时,agent 是该如实说「我目前只能定时查」,还是不该假装能做到。实测里 agent 选了后者(承诺了做不到的事),这本身就是评测要扣分的点。

给 Case Library 重构的几条直接启示

  1. 真实题型分布偏「复合 / 多跳 / 跨资产」,远比单标的单问复杂。旧 30 题若以单标的单问为主,可能低估了真实难度。
  2. 「质疑既有判断、要依据」是高频真实模式(C-9、D-13),旧库若多是「从零问」,缺这一类。
  3. 监测意图 → 可执行规则是一个独立能力维度,且和诚实性强耦合(E 组)。建议作为一类 case。
  4. 跨资产条件级联推演(C 簇)适合做成压测「多跳推理 + 接地 + 量化」的旗舰 case。
  5. 这批真实问答里没有标准答案(gold answer)——和旧库同病。但它们有 agent 的真实作答存档可作「真实作答长什么样」的起点,gold answer 仍需人工补。

关联:FinBayes 工程侧据同一批样本,正在起一份多用户底座事件触发监测层设计稿(监测意图落地、信号触发、按用户分隔)。出题端(本文)和被测产品端(那份设计)共用这批真实样本,但分属两条线。