結論:企業部署建議模型越大,正確率越高」在資料庫實務中是絕對真理。
- 測試結果
測試模型 (依參數大小排序) | 核心定位與規格 | 平均生成時間 | 標籤格式正確率 | 資料庫實體執行成功率 | 關鍵執行成果 |
|---|---|---|---|---|---|
| Llama 3.2 (~3B) | 輕量化小模型 | 2.56 秒 | 100% | 33.3% | 3 題僅對 1 題,Medium 通過,Easy 與 Hard 語法皆出錯陣亡。 |
| Gemma 4 (~9B 規格) | 中型通用模型 | 7.34 秒 | 100% | 100% | 3 題全對, 但首題語法生成推論時間較長(12.29秒)。 |
| Qwen 2.5-Coder 14B | 大型代碼專門模型 | 4.47 秒 | 100% | 100% | 表現最完美。3 題全對, 且 Medium/Hard 題花不到 2.6 秒即完成。 |
- 正確率:模型越大,理解語意與 Schema 的能力越強
- 小模型(Llama 3.2)在 T-SQL 細節上嚴重翻車:
- Easy 題:把欄位名稱搞錯,生成了多餘空格的 [ 銷售金額],直接被 SQL Server 報錯拒絕。
- Hard 題:在子查詢裡亂加 ORDER BY,踩到微軟 SQL Server 的語法雷區(錯誤碼 1033)。
- 大模型(Qwen 14B / Gemma 4)表現無懈可擊:面對分組、加總、TOP 1 排序,大模型能精準寫出標準 T-SQL,並且自動加上 AS TotalSalesAmount 別名來優化 ORDER BY 語法,成功率達 100%。
- 小模型(Llama 3.2)在 T-SQL 細節上嚴重翻車:
- 執行速度:並非越小越快!代碼專門大模型展現「降維打擊」
- 通常我們認為小模型速度快,但這份報告點出了一個關鍵轉折:Gemma 4 的整體推論時間偏長(平均 7.34 秒),在處理 Easy 題時甚至卡了 12.29 秒才輸出。
- Qwen 2.5-Coder 14B雖然模型體積最大,但因為是專門為 Code 優化的架構,它在 Medium 與 Hard 題僅花費 1.84 秒 與 2.54 秒 領先全場,整體平均(4.47秒)比中型的 Gemma 還要快上將此近一倍!
- 結論與企業部署建議
- 模型越大,正確率越高」在資料庫實務中是絕對真理。
- 在企業 ERP 資料庫應用中,SQL 語法只要錯一個字,就是 0 分(甚至會造成連線逾時或錯誤核心佔用)。
- Llama 3.2 (3B) 速度雖快,但理解複雜多維度中文欄位的能力不足,不適合直接投入實體生產環境。
- Qwen 2.5-Coder (14B)在本輪測試中奪冠。它證明了當模型針對「代碼」深度優化後,即便參數較大,其生成速度與語法精準度依然能同時達到顛峰,是目前最適合做為您公司內部 Text-to-SQL 工具的 Local AI 首選
自我LV~