AI模型測試

  • 14
  • 0

結論:企業部署建議模型越大,正確率越高」在資料庫實務中是絕對真理。

 

  1. 測試結果

測試模型

(依參數大小排序)

核心定位與規格平均生成時間標籤格式正確率資料庫實體執行成功率關鍵執行成果
Llama 3.2 (~3B)輕量化小模型2.56  秒100%33.3%3 題僅對 1 題,Medium 通過,Easy 與 Hard 語法皆出錯陣亡。
Gemma 4 (~9B 規格)中型通用模型7.34  秒100%100%

3 題全對,

但首題語法生成推論時間較長(12.29秒)。

Qwen 2.5-Coder 14B大型代碼專門模型4.47  秒100%100%

表現最完美。3 題全對,

且 Medium/Hard 題花不到 2.6 秒即完成。

 

  1. 正確率:模型越大,理解語意與 Schema 的能力越強
    1. 小模型(Llama 3.2)在 T-SQL 細節上嚴重翻車
      1. Easy 題:把欄位名稱搞錯,生成了多餘空格的 [ 銷售金額],直接被 SQL Server 報錯拒絕。
      2. Hard 題:在子查詢裡亂加 ORDER BY,踩到微軟 SQL Server 的語法雷區(錯誤碼 1033)。
    2. 大模型(Qwen 14B / Gemma 4)表現無懈可擊:面對分組、加總、TOP 1 排序,大模型能精準寫出標準 T-SQL,並且自動加上 AS TotalSalesAmount 別名來優化 ORDER BY 語法,成功率達 100%
  2. 執行速度:並非越小越快!代碼專門大模型展現「降維打擊」
    1. 通常我們認為小模型速度快,但這份報告點出了一個關鍵轉折:Gemma 4 的整體推論時間偏長(平均 7.34 秒),在處理 Easy 題時甚至卡了 12.29 秒才輸出。
    2. Qwen 2.5-Coder 14B雖然模型體積最大,但因為是專門為 Code 優化的架構,它在 Medium 與 Hard 題僅花費 1.84 秒2.54 秒 領先全場,整體平均(4.47秒)比中型的 Gemma 還要快上將此近一倍!
  3. 結論與企業部署建議
    1. 模型越大,正確率越高」在資料庫實務中是絕對真理。
    2. 在企業 ERP 資料庫應用中,SQL 語法只要錯一個字,就是 0 分(甚至會造成連線逾時或錯誤核心佔用)。
    3. Llama 3.2 (3B) 速度雖快,但理解複雜多維度中文欄位的能力不足,不適合直接投入實體生產環境
    4. Qwen 2.5-Coder (14B)在本輪測試中奪冠。它證明了當模型針對「代碼」深度優化後,即便參數較大,其生成速度與語法精準度依然能同時達到顛峰,是目前最適合做為您公司內部 Text-to-SQL 工具的 Local AI 首選

 

 

自我LV~