Lantide Data
返回部落格
AI 分析觀點

自然語言都能查資料了,為什麼 2026 年還需要 SQL?

自然語言能降低查詢起點,卻不能取代 SQL 對粒度、JOIN、篩選與聚合的可審閱證據;未來更合理的分工是 AI 起草、SQL 留證、人類審核。

自然語言查資料降低的是「開始寫查詢」的門檻,沒有消除「驗證取數邏輯」的需求。只要數字會進入週會、財務或產品決策,SQL 仍是檢查粒度、JOIN、篩選、分母與時間邊界的共同證據。

自然語言擅長表達意圖,SQL 擅長固定邏輯

「列出上季高價值新客的留存」對人很自然,對資料庫卻不是完整規格。高價值依首購金額、累積營收還是毛利?新客依註冊還是首次付款?留存是回訪、活躍或再次購買?上季是日曆季還是公司財務季?

Text-to-SQL 可以把這句話翻成查詢草稿,但翻譯必然包含選擇。當 SQL 可見時,團隊能具體討論:

WITH new_customers AS (
  SELECT customer_id, MIN(paid_at) AS first_paid_at
  FROM orders
  WHERE status = 'paid'
  GROUP BY customer_id
)
SELECT ...

這裡至少固定了「新客以首次 paid 訂單定義」。若只保留自然語言問題與最後數字,這項選擇就容易消失在執行過程中。

層次 最適合承載的內容 不該獨自承擔的內容
自然語言 目標、背景、例外、決策需求 精確列級取數證據
SQL grain、join、filter、aggregation、時間窗 業務優先順序與因果解讀
人類審閱 口徑取捨、風險、結論是否可用 從零手寫所有樣板查詢

這不是「自然語言 vs SQL」的競賽,而是兩種表示法各自做擅長的事。

真實企業 Text-to-SQL 難在 context,不只語法

早期 benchmark 常把任務簡化成「給問題與 schema,產生一條 SQL」。Spider 2.0 則收錄 632 個源自企業資料情境的工作流程題目,常涉及超過千個欄位、不同 SQL 方言、metadata、文件與專案程式。論文最新修訂版摘要中的 o1-preview code agent framework 在該設定解出 21.3%,遠低於同文報告的 Spider 1.0 91.2%;這些數字不能外推所有模型,但清楚顯示 benchmark 一旦接近真實環境,難度會大幅上升。Spider 2.0 原始論文

2026 年的 EntSQL 進一步把企業私有知識納入評估。資料集有 1,066 個中英對齊例子、涵蓋五個業務領域,多數題目需要內部指標、報表慣例或組織規則;論文所評最佳系統在提供長文件的英文輸入設定達 15.9%。同樣地,這不是市場準確率,而是提醒團隊:schema 相同,不代表模型知道你公司如何定義「有效訂單」。EntSQL 原始論文

因此,導入自然語言查資料時,真正要準備的是:

  1. 可搜尋的 schema 與欄位說明。
  2. 指標、狀態碼、財務季等業務定義。
  3. 查詢方言與可使用資料來源。
  4. 一條讓人看得見、測得動、改得回去的 SQL 路徑。

審 AI SQL,不只看能不能跑

一段成功執行的 SQL 只證明語法與物件名稱大致成立。正式採用前,可用「GJFAT」五點快速檢查:

  • G — Grain: 最終一列代表人、訂單、事件還是日?
  • J — Join: key 是否唯一?一對多是否造成 fan-out?
  • F — Filter: 取消、測試帳號、NULL 與狀態是否排除?
  • A — Aggregation: COUNT(*)COUNT(DISTINCT ...) 與分母是否吻合?
  • T — Time: 時區、含首含尾、資料截止日與 cohort window 是否明確?

再加一條最小測試查詢,比較 JOIN 前後 row count 與 distinct key。這套檢查不要求 PM 會重寫 SQL,但能把「看起來能跑」提升為「知道它回答哪個問題」。

Lantide Data 的 SQL-first 分工

Lantide Data 讓自然語言成為分析入口,但不把 SQL 藏起來。Agent 可探索 schema、草擬 Plan 與 SQL;正式 Project Analysis 由使用者審 Plan 後按 Execute,SQL 分頁保留取數邏輯,Report 再承載結論與 limitations。完整心智可見SQL-first:口徑寫在分頁裡統一查詢層

人類與 Agent 在 Lantide 共用 DuckDB 查詢管線;持久 SQL 分頁執行後可形成供下游引用的本機快取,必要時用 Source Run 重算上游。這適合需要 adhoc 探索、口徑協作與重跑證據的工作,但 Lantide 不是 nightly ETL、多人共用數倉或固定 dashboard 的替代品;這些持久營運需求仍應交給相應平台。

結語

2026 年仍需要 SQL,不是因為每個人都該成為 SQL 專家,而是正式數字需要一種精確、可執行、可比較差異的證據格式。最實用的未來不是自然語言取代 SQL,而是自然語言描述意圖、AI 起草查詢、SQL 留下證據、人類審核口徑。

參考資料