Z.ai 推出 GLM-5.3-Flash:高性價比的多模態大型語言模型
AI 奇點前沿

Z.ai 推出 GLM-5.3-Flash:高性價比的多模態大型語言模型

AI News Bot
2026-08-28
預計閱讀 1 分鐘原文來源

Z.ai 推出 GLM‑5.3‑Flash:高性價比的多模態大型語言模型

Z.ai 今日正式發布 GLM‑5.3‑Flash,這是 GLM‑5 系列首支原生多模態(同時支援文字與影像)的大型語言模型(LLM),在 智慧指數、成本 與 基礎建設 三個面向皆呈現出令人矚目的平衡。

核心規格與授權

  • 參數規模:總參數 3200 億,實際啟用參數 180 億。
  • 授權條款:採用 MIT 開源授權,模型權重已上傳至 Hugging Face。
  • 上下文長度:支援高達 100 萬 token(文字單位)的上下文窗口,遠高於一般 LLM 的 2‑4 萬 token 限制。

智慧指數與效能表現

根據 Artificial Analysis 的測試,GLM‑5.3‑Flash 在最高推理力度下取得 57 分的智慧指數,僅比更大版的 GLM‑5.3(60 分)低三分,與 GPT‑5.6 Terra 與 Muse Spark 1.2 持平。

在 GDPval‑AA v2 基準測試中,該模型以 Elo 約 1770 的分數匹配 GLM‑5.3 與 Grok 4.6,僅次於 Claude Opus 5。不過,模型的 token 效率 較低——約 90% 的輸出 token 用於推理,顯示在長篇回覆上仍有改進空間。

成本優勢:Pareto 前緣的「高性價比」

  • 每項任務成本:0.09 美元,約為 GLM‑5.3(0.68 美元)的 七分之一。
  • API 計價:輸入 token 每百萬計 0.15 美元,輸出 token 每百萬計 0.50 美元,僅為 GLM‑5.3 的十餘%。

這使得 GLM‑5.3‑Flash 在 智慧 與 成本 的雙重指標上位於 Pareto 前緣,對於預算受限的企業與開發者而言具有極高吸引力。

基礎建設與效能突破

在模型上線前,Z.ai 於 OpenCode 與 OpenRouter 以代號 “ox‑alpha” 進行匿名測試,當週成為最受歡迎的模型。值得注意的是,所有測試流量皆在 中國自研 AI 晶片 上執行。

根據 SemiAnalysis 的統計,GLM‑5.3‑Flash 日處理量已突破 100 兆 token,這在過去僅被少數前沿實驗室視為可能。Z.ai 表示,其硬體效能與每 token 成本與普通 Nvidia GPU 相當,進一步驗證了 CUDA moat(Nvidia CUDA 生態壁壘)仍具競爭力。

為提升吞吐量,Z.ai 基於 SGLang(一套高效能服務框架)自行開發了分階段處理的服務軟體,讓各階段可獨立擴展。此舉使同等硬體下的吞吐量提升 三倍,而優化過程中亦有 GLM‑5.3 代理模型協助。

未來展望與讀者啟示

GLM‑5.3‑Flash 的出現說明,開源授權 + 大規模多模態 + 超低成本 的組合已不再是少數巨頭的專屬領域。對於想在 AI 產品中加入視覺理解或長文本分析的開發者,這款模型提供了「高效能、低門檻」的可行方案。未來若 Z.ai 能進一步提升 token 效率、降低推理耗能,將有望在 AI 產業成本結構 中掀起更大波動,逼迫西方雲端供應商重新思考價格策略。

結語:在 AI 競賽日益激烈的今天,GLM‑5.3‑Flash 以「性價比」切入市場,不僅挑戰了傳統的大模型定價模式,也為多模態應用的落地提供了更實際的選項。業界應持續關注其後續的生態建設與效能優化,才能在這波「成本革命」中保持競爭力。

分享