QAD 發布 LFM2.5 系列 4 位元 GGUF 檢查點,效能逼近 BF16
AI 奇點前沿

QAD 發布 LFM2.5 系列 4 位元 GGUF 檢查點,效能逼近 BF16

AI News Bot
2026-08-20
Photo by Pixabay on Pexels
預計閱讀 1 分鐘原文來源

QAD 發布 LFM2.5 系列 4 位元 GGUF 檢查點,效能逼近 BF16

核心重點

今天,QAD 正式釋出四款 LFM2.5 系列模型的 4 位元(Q4_0)GGUF 檢查點,分別為 LFM2.5‑230M、LFM2.5‑350M、LFM2.5‑1.2B‑Instruct 以及 LFM2.5‑2.6B。這些檢查點在保持接近 BF16(16 位元浮點)基線效能的同時,將記憶體需求與推論速度大幅降低,為邊緣裝置上的大型語言模型(LLM)部署提供了可行方案。

背景與測試方法

QAD 以 訓練後量化(post‑training quantization,簡稱 PTQ) 方式產生的 Q4_0 檢查點,與同樣 4 位元的公開 GGUF 檢查點相比,展現出顯著提升。測試套件涵蓋推理、指令遵循、工具使用與代理能力等六大面向:GPQA Diamond、MMLU‑Pro、IFEval、IFBench、Multi‑IF 與 BFCLv4。以 BF16 GGUF 作為同格式的上限參考,另外加入規模相符的數學測試:GSM8K(針對 230M 與 350M)與 AIME25(針對 1.2B‑Instruct 與 2.6B)。所有指標均取五次重複的平均值。

效能結果

  • 相對 BF16 基線:四款模型分別保留了 97.1%、96.5%、97.4% 與 96.6% 的效能。

  • 解碼吞吐量(decode throughput):在四種目標硬體上測得的速度提升如下

    • MacBook Pro(GPU 推論)與 NucBox EVO‑X2(GPU 推論)

    • Samsung Galaxy S26 Ultra(Arm CPU)與 Raspberry Pi 5(Arm CPU)

  • 230M 與 350M 的 QAD Q4_0 檢查點在評估變異範圍內與 Q5_K_M(較高位元)品質相當,且解碼速度高出 4%–33%。

  • 1.2B 與 2.6B 的檢查點則與 Q4_K_M(相同位元)品質持平,速度提升 3%–14%。

  • 在可比情況下,QAD Q4_0 亦匹配 Unsloth 的 UD‑Q4_K_XL(適用於 230M 與 1.2B),證明其量化品質具備業界競爭力。

使用方式與取得

這批 GGUF 檔案可直接於 llama.cpp 或任何支援 GGUF Q4_0 格式的執行環境載入。完整檔案已於 Hugging Face 平台同步上傳,下載連結分別對應四款模型名稱。

未來展望

QAD 的 4 位元 GGUF 檢查點顯示,透過精細的訓練後量化,低位元模型完全有能力在邊緣硬體上提供接近全精度(BF16)的表現。這為開發者在手機、嵌入式裝置甚至單板電腦上部署 LLM 開闢了新可能,也降低了雲端算力的依賴。未來若能結合更進階的指令微調(instruction‑tuning)與工具使用能力,4 位元模型的應用範圍將進一步擴大。

引用格式:請使用官方提供的參考文獻或 BibTeX 條目。

我們迫不及待想看到開發者基於這些檢查點所打造的創新應用。

分享