常见问题
产品定位
智能问数和普通 Text-to-SQL 有什么不同?
普通 Text-to-SQL 让 LLM 直接生成物理 SQL;智能问数让 LLM 只生成业务名 S2SQL,物理 SQL 由确定性编译器根据已发布的语义模型生成。
结果是:更换模型不会改变业务口径,Join 路径不会临时推断,同一份 Release 服务所有入口。详见查询管线。
与 Cube、Wren AI 是什么关系?
Cube Core 把指标、维度、Join 和访问规则定义一次,再通过 SQL、REST、GraphQL 提供给 BI、应用和 AI Agent。Wren AI 通过 MDL 与 context layer 让业务定义、样例、记忆和治理信息被 Agent 复用。
KnowFlow 智能问数遵循相同的基本方向——语义模型是可复用的数据基础设施,不是某次 LLM 调用的附件——但有几个不同的产品选择:
- AI 辅助完成初始建模,但产出始终是可逐项审核的草案
- LLM 不生成最终物理 SQL
- 发布前同时检查模型结构和真实数据
- 自然语言有歧义时显式确认
- 每次查询都有固定阶段诊断,可导出脱敏 Markdown
它不是 Cube 或 Wren AI 的协议实现,也不要求引入它们的运行时。
和企业知识库是什么关系?
两条产品线解决两类问题:知识库处理非结构化文档,智能问数处理结构化业务库。两者共用企业账号体系、权限模型与部署方式。详见智能问数介绍。
数据源
支持哪些数据库?
PostgreSQL、MySQL 与上传表格(Excel)。MySQL 的五种时间粒度、同比自连接与占比窗口都在真库上与 PostgreSQL 逐行比对过;其它方言尚未支持。
不连数据库能用吗?
可以。直接上传 Excel,系统会把它落库成一个数据源,走与数据库表完全相同的建模与问数链路。
业务数据会被复制走吗?
不会。数据卷只保存语义资源、Revision、Release 和独立版设置,不复制业务库数据。查询在你自己的数据库上以只读事务执行。
准确性
准确率有多高?
我们用中文小型回归集跑完整产品链(原始数据库 → 导入 → 关系确认 → AI 建模 → 发布 → 加载隐藏问题 → 自然语言试问 → 与参考 SQL 结果逐行比较):
| 数据集 | 正确题数 | 准确率 | 静默错答 |
|---|---|---|---|
| 电商集 | 12 / 12 | 100% | 0 |
| 城市与图书馆集 | 11 / 12 | 91.7% | 0 |
| 音乐 Holdout 集 | 9 / 12 | 75% | 0 |
| 合计 | 32 / 36 | 88.9% | 0 |
这是一组数据集上的对照实验,不是通用 Text-to-SQL 基准结论。题集规模仍小。
我们公开它,是为了说明评测走的是用户实际经历的完整链路,而不是绕过建模与发布流程直接向组件灌入整理好的语义数据。
什么是「静默错答」?
拒答和澄清对用户可见;一个看起来正常的错误数字不可见。后者就是静默错答,也是我们最关注的失败模式。
已知的一个未修复案例:「平均每单销售金额」模型写成 AVG(销售金额),算出的是明细行均值而非按单均值,六道治理关全部放行——粒度曲解不在现有任何一道关的判据里,已记入待办。
答不出来怎么办?
先看一键诊断定位失败阶段:
- Mapper 失败 → 补业务词典
- Parser 失败 → 问题可能跨了事实根
- Translator 失败 → 检查模型结构与 Join 路径
然后用词汇缺口收件箱按频次批量补词典,而不是逐条改 Prompt。
部署与版本
开源版和商业版差在哪?
开源版提供建模能力和查询引擎;商业版提供面向业务用户的问数助手、报表和多用户数据权限。详见开源版与商业版。
支持多用户和数据权限吗?
开源版是单用户 + 可选共享口令,不提供多用户 RBAC 或行列权限。需要按人分配数据范围请使用商业版。
大型 Schema 导入很慢?
AI 建模在请求周期内同步执行。表特别多时建议分批导入,或调高服务超时。
已知边界
- 数据源目前仅支持 PostgreSQL、MySQL 与上传表格
- 同一实体存在两条等长最短 Join 路径时,该实体不会自动进入作用域
- 既无主标识也无业务度量的事件/桥接表不会成为事实根
- 确认记忆已在
v0.0.2移除,人工选择只在当次查询内生效 - 结果解读默认关闭,且只允许复述结果里出现过的数字