语义建模概览
语义建模是智能问数的核心工作。建模成本只付一次,治理结果可以被 Agent、问数页面、结构化 API 和评测长期复用。
语义目录包含什么
| 对象 | 说明 |
|---|---|
| Model | 一张业务实体表或 SQL Model,是指标和维度的载体 |
| Relation | 实体之间的 Join 关系,包含人工确认的基数 |
| Metric | 原子指标与派生指标,含公式、默认聚合、可加性、展示格式、时间轴 |
| Dimension | 分析维度,含业务名、别名、数据类型与时间粒度 |
| Term | 业务术语,把「成交额」「流水」「GMV」等说法绑定到已治理对象 |
| DimensionValue | 真实维度值字典,让「华东区」「已完成」这类取值可被识别 |
业务名称、别名、指标公式、默认聚合、可加性、时间轴和真实维度值都属于模型数据,而不是藏在 Prompt 里。
建模四步
① 数据源 连接业务库或上传 Excel,选择要进入语义层的表
② 语义建模 确认关系基数 → AI 生成草案 → 逐项审核指标/维度/词典
③ 问数验证 结构化 Playground + 自然语言 Playground 双重验证
④ 问数反馈 词汇缺口收件箱回流,补业务词典
建模工作台的常驻导航是实体与关系、业务词典、目录总览;查询作用域只在高级诊断中展示——用户维护语义目录,不需要再维护第二套「主题」配置。
核心原则
AI 提高效率,人工掌握发布
AI 可以生成实体名称、字段角色、指标、维度和别名草案,但结果不会直接发布。建议先进入 Candidate Revision,覆盖人工内容的建议默认不选中。
关系基数必须人工确认
模型可以根据外键猜测 Join 关系,但基数(一对一、一对多、多对多)决定了聚合会不会扇出、金额会不会翻倍。这件事必须人工确认,并在发布时冻结。
发布前用真实数据验证
结构校验只能检查模型自洽性。真实数据质量报告会用只读查询检查主标识唯一性、关系基数、扇出、指标样本和可达性——这些问题只有碰到真实数据才暴露。