业务词典与值字典
业务词典把「成交额」「流水」「GMV」这类业务说法绑定到已治理的指标、维度与真实维度值,让同一份语义可以跨问题、跨 Agent 复用。

三类词条
| 类型 | 作用 | 示例 |
|---|---|---|
| 指标术语 | 说法 → 指标 | 「营收」「流水」「GMV」→ 销售金额 |
| 维度术语 | 说法 → 维度 | 「地区」「大区」→ 销售区域 |
| 维度值 | 说法 → 真实取值 | 「华东」→ East China;「完成」→ COMPLETED |
为什么词典优于「记忆」
v0.0.2 起已经移除了确认记忆机制。人工在澄清卡上做的选择只在当次查询内生效,长期修复一律走业务词典。
原因是明确的:
词典是可审核、可发布、对所有人生效的语义资源;记忆不是。
一条记忆只修复某个用户、某个会话里的某种问法;一条词典条目经过审核发布后,对所有入口(问数页、Agent、API)同时生效,并且随 Release 一起版本化和回滚。
值字典与采样
建模时可以对低基数维度采样真实取值,用于生成值字典和别名建议。
- 采样只读,不修改业务数据
- 可通过配置关闭采样
- 高基数列(如订单号、用户 ID)不适合建值字典
值字典的直接收益:当用户问「华东区卖了多少」,系统能确认「华东区」是 销售区域 的一个真实取值,而不是把它当成一个不认识的词。
取值不认识时的行为
如果过滤值不在该维度已发布的取值里,且查询返回 0 行,系统会指名道姓说出来,而不是显示一句「查询成功,但没有返回数据」:
- 编辑相似度 ≥ 0.6 才给近似建议(「卡布奇洛」→ 建议「卡布奇诺」)
- 相似度不足则不猜(「摩卡」「深圳」不给建议)
- 措辞是「不在已发布取值里」而不是「不存在」——数据库里可能有,只是没进语义模型
从词汇缺口回流补词典
不需要凭空想象用户会怎么说。词汇缺口收件箱会把真实发生过的「用户说了、系统没接住」的说法按短语聚合,支持一键补进业务词典。
这是推荐的迭代节奏:
上线 → 收集词汇缺口 → 按频次补词典 → 发布新 Release → 再收集