QAD 發布 LFM2.5 系列 4 位元 GGUF 檢查點,效能逼近 BF16
核心重點
今天,QAD 正式釋出四款 LFM2.5 系列模型的 4 位元(Q4_0)GGUF 檢查點,分別為 LFM2.5‑230M、LFM2.5‑350M、LFM2.5‑1.2B‑Instruct 以及 LFM2.5‑2.6B。這些檢查點在保持接近 BF16(16 位元浮點)基線效能的同時,將記憶體需求與推論速度大幅降低,為邊緣裝置上的大型語言模型(LLM)部署提供了可行方案。
背景與測試方法
QAD 以 訓練後量化(post‑training quantization,簡稱 PTQ) 方式產生的 Q4_0 檢查點,與同樣 4 位元的公開 GGUF 檢查點相比,展現出顯著提升。測試套件涵蓋推理、指令遵循、工具使用與代理能力等六大面向:GPQA Diamond、MMLU‑Pro、IFEval、IFBench、Multi‑IF 與 BFCLv4。以 BF16 GGUF 作為同格式的上限參考,另外加入規模相符的數學測試:GSM8K(針對 230M 與 350M)與 AIME25(針對 1.2B‑Instruct 與 2.6B)。所有指標均取五次重複的平均值。
效能結果
-
相對 BF16 基線:四款模型分別保留了 97.1%、96.5%、97.4% 與 96.6% 的效能。
-
解碼吞吐量(decode throughput):在四種目標硬體上測得的速度提升如下
-
MacBook Pro(GPU 推論)與 NucBox EVO‑X2(GPU 推論)
-
Samsung Galaxy S26 Ultra(Arm CPU)與 Raspberry Pi 5(Arm CPU)
-
-
230M 與 350M 的 QAD Q4_0 檢查點在評估變異範圍內與 Q5_K_M(較高位元)品質相當,且解碼速度高出 4%–33%。
-
1.2B 與 2.6B 的檢查點則與 Q4_K_M(相同位元)品質持平,速度提升 3%–14%。
-
在可比情況下,QAD Q4_0 亦匹配 Unsloth 的 UD‑Q4_K_XL(適用於 230M 與 1.2B),證明其量化品質具備業界競爭力。
使用方式與取得
這批 GGUF 檔案可直接於 llama.cpp 或任何支援 GGUF Q4_0 格式的執行環境載入。完整檔案已於 Hugging Face 平台同步上傳,下載連結分別對應四款模型名稱。
未來展望
QAD 的 4 位元 GGUF 檢查點顯示,透過精細的訓練後量化,低位元模型完全有能力在邊緣硬體上提供接近全精度(BF16)的表現。這為開發者在手機、嵌入式裝置甚至單板電腦上部署 LLM 開闢了新可能,也降低了雲端算力的依賴。未來若能結合更進階的指令微調(instruction‑tuning)與工具使用能力,4 位元模型的應用範圍將進一步擴大。
引用格式:請使用官方提供的參考文獻或 BibTeX 條目。
我們迫不及待想看到開發者基於這些檢查點所打造的創新應用。
