Z.ai 推出 GLM‑5.3‑Flash:高性價比的多模態大型語言模型
Z.ai 今日正式發布 GLM‑5.3‑Flash,這是 GLM‑5 系列首支原生多模態(同時支援文字與影像)的大型語言模型(LLM),在 智慧指數、成本 與 基礎建設 三個面向皆呈現出令人矚目的平衡。
核心規格與授權
- 參數規模:總參數 3200 億,實際啟用參數 180 億。
- 授權條款:採用 MIT 開源授權,模型權重已上傳至 Hugging Face。
- 上下文長度:支援高達 100 萬 token(文字單位)的上下文窗口,遠高於一般 LLM 的 2‑4 萬 token 限制。
智慧指數與效能表現
根據 Artificial Analysis 的測試,GLM‑5.3‑Flash 在最高推理力度下取得 57 分的智慧指數,僅比更大版的 GLM‑5.3(60 分)低三分,與 GPT‑5.6 Terra 與 Muse Spark 1.2 持平。
在 GDPval‑AA v2 基準測試中,該模型以 Elo 約 1770 的分數匹配 GLM‑5.3 與 Grok 4.6,僅次於 Claude Opus 5。不過,模型的 token 效率 較低——約 90% 的輸出 token 用於推理,顯示在長篇回覆上仍有改進空間。
成本優勢:Pareto 前緣的「高性價比」
- 每項任務成本:0.09 美元,約為 GLM‑5.3(0.68 美元)的 七分之一。
- API 計價:輸入 token 每百萬計 0.15 美元,輸出 token 每百萬計 0.50 美元,僅為 GLM‑5.3 的十餘%。
這使得 GLM‑5.3‑Flash 在 智慧 與 成本 的雙重指標上位於 Pareto 前緣,對於預算受限的企業與開發者而言具有極高吸引力。
基礎建設與效能突破
在模型上線前,Z.ai 於 OpenCode 與 OpenRouter 以代號 “ox‑alpha” 進行匿名測試,當週成為最受歡迎的模型。值得注意的是,所有測試流量皆在 中國自研 AI 晶片 上執行。
根據 SemiAnalysis 的統計,GLM‑5.3‑Flash 日處理量已突破 100 兆 token,這在過去僅被少數前沿實驗室視為可能。Z.ai 表示,其硬體效能與每 token 成本與普通 Nvidia GPU 相當,進一步驗證了 CUDA moat(Nvidia CUDA 生態壁壘)仍具競爭力。
為提升吞吐量,Z.ai 基於 SGLang(一套高效能服務框架)自行開發了分階段處理的服務軟體,讓各階段可獨立擴展。此舉使同等硬體下的吞吐量提升 三倍,而優化過程中亦有 GLM‑5.3 代理模型協助。
未來展望與讀者啟示
GLM‑5.3‑Flash 的出現說明,開源授權 + 大規模多模態 + 超低成本 的組合已不再是少數巨頭的專屬領域。對於想在 AI 產品中加入視覺理解或長文本分析的開發者,這款模型提供了「高效能、低門檻」的可行方案。未來若 Z.ai 能進一步提升 token 效率、降低推理耗能,將有望在 AI 產業成本結構 中掀起更大波動,逼迫西方雲端供應商重新思考價格策略。
結語:在 AI 競賽日益激烈的今天,GLM‑5.3‑Flash 以「性價比」切入市場,不僅挑戰了傳統的大模型定價模式,也為多模態應用的落地提供了更實際的選項。業界應持續關注其後續的生態建設與效能優化,才能在這波「成本革命」中保持競爭力。