跳到主要内容

常见问题

产品定位

智能问数和普通 Text-to-SQL 有什么不同?

普通 Text-to-SQL 让 LLM 直接生成物理 SQL;智能问数让 LLM 只生成业务名 S2SQL,物理 SQL 由确定性编译器根据已发布的语义模型生成。

结果是:更换模型不会改变业务口径,Join 路径不会临时推断,同一份 Release 服务所有入口。详见查询管线

与 Cube、Wren AI 是什么关系?

Cube Core 把指标、维度、Join 和访问规则定义一次,再通过 SQL、REST、GraphQL 提供给 BI、应用和 AI Agent。Wren AI 通过 MDL 与 context layer 让业务定义、样例、记忆和治理信息被 Agent 复用。

KnowFlow 智能问数遵循相同的基本方向——语义模型是可复用的数据基础设施,不是某次 LLM 调用的附件——但有几个不同的产品选择:

  • AI 辅助完成初始建模,但产出始终是可逐项审核的草案
  • LLM 不生成最终物理 SQL
  • 发布前同时检查模型结构和真实数据
  • 自然语言有歧义时显式确认
  • 每次查询都有固定阶段诊断,可导出脱敏 Markdown

它不是 Cube 或 Wren AI 的协议实现,也不要求引入它们的运行时。

和企业知识库是什么关系?

两条产品线解决两类问题:知识库处理非结构化文档,智能问数处理结构化业务库。两者共用企业账号体系、权限模型与部署方式。详见智能问数介绍

数据源

支持哪些数据库?

PostgreSQL、MySQL 与上传表格(Excel)。MySQL 的五种时间粒度、同比自连接与占比窗口都在真库上与 PostgreSQL 逐行比对过;其它方言尚未支持。

不连数据库能用吗?

可以。直接上传 Excel,系统会把它落库成一个数据源,走与数据库表完全相同的建模与问数链路。

业务数据会被复制走吗?

不会。数据卷只保存语义资源、Revision、Release 和独立版设置,不复制业务库数据。查询在你自己的数据库上以只读事务执行。

准确性

准确率有多高?

我们用中文小型回归集跑完整产品链(原始数据库 → 导入 → 关系确认 → AI 建模 → 发布 → 加载隐藏问题 → 自然语言试问 → 与参考 SQL 结果逐行比较):

数据集正确题数准确率静默错答
电商集12 / 12100%0
城市与图书馆集11 / 1291.7%0
音乐 Holdout 集9 / 1275%0
合计32 / 3688.9%0
如何理解这个数字

这是一组数据集上的对照实验,不是通用 Text-to-SQL 基准结论。题集规模仍小。

我们公开它,是为了说明评测走的是用户实际经历的完整链路,而不是绕过建模与发布流程直接向组件灌入整理好的语义数据。

什么是「静默错答」?

拒答和澄清对用户可见;一个看起来正常的错误数字不可见。后者就是静默错答,也是我们最关注的失败模式。

已知的一个未修复案例:「平均每单销售金额」模型写成 AVG(销售金额),算出的是明细行均值而非按单均值,六道治理关全部放行——粒度曲解不在现有任何一道关的判据里,已记入待办。

答不出来怎么办?

先看一键诊断定位失败阶段:

  • Mapper 失败 → 补业务词典
  • Parser 失败 → 问题可能跨了事实根
  • Translator 失败 → 检查模型结构与 Join 路径

然后用词汇缺口收件箱按频次批量补词典,而不是逐条改 Prompt。

部署与版本

开源版和商业版差在哪?

开源版提供建模能力和查询引擎;商业版提供面向业务用户的问数助手、报表和多用户数据权限。详见开源版与商业版

支持多用户和数据权限吗?

开源版是单用户 + 可选共享口令,不提供多用户 RBAC 或行列权限。需要按人分配数据范围请使用商业版。

大型 Schema 导入很慢?

AI 建模在请求周期内同步执行。表特别多时建议分批导入,或调高服务超时。

已知边界

  • 数据源目前仅支持 PostgreSQL、MySQL 与上传表格
  • 同一实体存在两条等长最短 Join 路径时,该实体不会自动进入作用域
  • 既无主标识也无业务度量的事件/桥接表不会成为事实根
  • 确认记忆已在 v0.0.2 移除,人工选择只在当次查询内生效
  • 结果解读默认关闭,且只允许复述结果里出现过的数字