Lantide Data
返回博客
AI 分析洞察

自然语言都能查资料了,为什么 2026 年还需要 SQL?

自然语言能降低查询起点,却不能取代 SQL 对粒度、JOIN、筛选与聚合的可审阅证据;未来更合理的分工是 AI 起草、SQL 留证、人类审核。

自然语言查资料降低的是「开始写查询」的门槛,没有消除「验证取数逻辑」的需求。只要数字会进入周会、财务或产品决策,SQL 仍是检查粒度、JOIN、筛选、分母与时间边界的共同证据。

自然语言擅长表达意图,SQL 擅长固定逻辑

「列出上季高价值新客的留存」对人很自然,对资料库却不是完整规格。高价值依首购金额、累积营收还是毛利?新客依注册还是首次付款?留存是回访、活跃或再次购买?上季是日历季还是公司财务季?

Text-to-SQL 可以把这句话翻成查询草稿,但翻译必然包含选择。当 SQL 可见时,团队能具体讨论:

WITH new_customers AS (
  SELECT customer_id, MIN(paid_at) AS first_paid_at
  FROM orders
  WHERE status = 'paid'
  GROUP BY customer_id
)
SELECT ...

这里至少固定了「新客以首次 paid 订单定义」。若只保留自然语言问题与最后数字,这项选择就容易消失在执行过程中。

层次 最适合承载的内容 不该独自承担的内容
自然语言 目标、背景、例外、决策需求 精确列级取数证据
SQL grain、join、filter、aggregation、时间窗 业务优先顺序与因果解读
人类审阅 口径取舍、风险、结论是否可用 从零手写所有样板查询

这不是「自然语言 vs SQL」的竞赛,而是两种表示法各自做擅长的事。

真实企业 Text-to-SQL 难在 context,不只语法

早期 benchmark 常把任务简化成「给问题与 schema,产生一条 SQL」。Spider 2.0 则收录 632 个源自企业资料情境的工作流程题目,常涉及超过千个栏位、不同 SQL 方言、metadata、文件与专案程式。论文最新修订版摘要中的 o1-preview code agent framework 在该设定解出 21.3%,远低于同文报告的 Spider 1.0 91.2%;这些数字不能外推所有模型,但清楚显示 benchmark 一旦接近真实环境,难度会大幅上升。Spider 2.0 原始论文

2026 年的 EntSQL 进一步把企业私有知识纳入评估。资料集有 1,066 个中英对齐例子、涵盖五个业务领域,多数题目需要内部指标、报表惯例或组织规则;论文所评最佳系统在提供长文件的英文输入设定达 15.9%。同样地,这不是市场准确率,而是提醒团队:schema 相同,不代表模型知道你公司如何定义「有效订单」。EntSQL 原始论文

因此,导入自然语言查资料时,真正要准备的是:

  1. 可搜寻的 schema 与栏位说明。
  2. 指标、状态码、财务季等业务定义。
  3. 查询方言与可使用资料来源。
  4. 一条让人看得见、测得动、改得回去的 SQL 路径。

审 AI SQL,不只看能不能跑

一段成功执行的 SQL 只证明语法与物件名称大致成立。正式采用前,可用「GJFAT」五点快速检查:

  • G — Grain: 最终一列代表人、订单、事件还是日?
  • J — Join: key 是否唯一?一对多是否造成 fan-out?
  • F — Filter: 取消、测试帐号、NULL 与状态是否排除?
  • A — Aggregation: COUNT(*)COUNT(DISTINCT ...) 与分母是否吻合?
  • T — Time: 时区、含首含尾、资料截止日与 cohort window 是否明确?

再加一条最小测试查询,比较 JOIN 前后 row count 与 distinct key。这套检查不要求 PM 会重写 SQL,但能把「看起来能跑」提升为「知道它回答哪个问题」。

Lantide Data 的 SQL-first 分工

Lantide Data 让自然语言成为分析入口,但不把 SQL 藏起来。Agent 可探索 schema、草拟 Plan 与 SQL;正式 Project Analysis 由使用者审 Plan 后按 Execute,SQL 分页保留取数逻辑,Report 再承载结论与 limitations。完整心智可见SQL-first:口径写在分页里统一查询层

人类与 Agent 在 Lantide 共用 DuckDB 查询管线;持久 SQL 分页执行后可形成供下游引用的本机快取,必要时用 Source Run 重算上游。这适合需要 adhoc 探索、口径协作与重跑证据的工作,但 Lantide 不是 nightly ETL、多人共用数仓或固定 dashboard 的替代品;这些持久营运需求仍应交给相应平台。

结语

2026 年仍需要 SQL,不是因为每个人都该成为 SQL 专家,而是正式数字需要一种精确、可执行、可比较差异的证据格式。最实用的未来不是自然语言取代 SQL,而是自然语言描述意图、AI 起草查询、SQL 留下证据、人类审核口径。

参考资料