阿里巴巴發布 Qwen3.8‑Flash‑Next:1250億參數 MoE 模型,以更低成本達到 Qwen4 水平
AI 奇點前沿

阿里巴巴發布 Qwen3.8‑Flash‑Next:1250億參數 MoE 模型,以更低成本達到 Qwen4 水平

AI News Bot
2026-08-27
Photo by Tara Winstead on Pexels
預計閱讀 1 分鐘原文來源

亮點概覽

阿里巴巴 Qwen 團隊於 8 月推出 Qwen3.8‑Flash‑Next,這是一款 多模態混合專家模型(Mixture‑of‑Experts, MoE),被定位為 Qwen4 的架構預覽。模型總參數高達 1250 億,但每個 token 只會激活 60 億,訓練成本僅為同等效能模型的約 1/9,在程式碼生成與辦公自動化等任務上表現尤為突出。

技術細節與創新

  • N‑gram 嵌入層:新加入 510 億 參數的 N‑gram(詞組)嵌入層,將常見詞組作為獨立條目儲存在類似「片語字典」的結構中,可放在普通系統 RAM 而非 GPU,成本相對低廉。
  • 上下文視窗:原生支援 262,144 token 的長上下文,透過 YaRN 技術可延伸至 100 萬 token,適合長文件或程式碼分析。
  • 開源與部署:技術報告已放於 GitHub,模型權重可於 Hugging Face 與 ModelScope 下載;商業版以 Qwen3.8‑Flash 形式在 QwenCloud 上提供,輸入 token 價格 0.16 美元/百萬,輸出 0.47 美元/百萬。

性能與成本比較

阿里巴巴的內部基準測試顯示,Flash‑Next 在多項指標上超越 DeepSeek‑V4‑Flash(2840 億參數、130 億激活) 以及 Anthropic Claude Opus 4.6(Max),尤其在以下領域:

| 任務 | Flash‑Next 分數 | 競品分數 | |------|----------------|----------| | DeepSWE(程式碼除錯) | 58.7 | 低於 DeepSeek‑V4‑Flash | | SWE‑bench Pro | 62.5 | 同上 | | CoWorkBench(辦公) | 73.9 | DeepSeek‑V4‑Flash 45.1 | | JobBench(專業工作流) | 55.7 | Qwen3.7‑Plus 27.6 | | GPQA Diamond(科學推理) | 91.7 | 與競爭模型相近 | | LiveCodeBench v6(競賽程式) | 91.9 | 與競爭模型相近 |

唯一在 Humanity's Last Exam(跨領域高難度測驗)上領先的是較舊的 Claude Opus 4.6。整體而言,Flash‑Next 以 約 1/12 的價格提供接近旗艦模型 Qwen3.8‑Max 的效能,顯示出「高效能 + 低成本」的明顯優勢。

市場與未來展望

Flash‑Next 的低成本高效能組合,對 OpenAI、Anthropic 以及 Google Gemini 等大型模型供應商形成明顯壓力。若能持續優化 MoE 路徑選擇與 N‑gram 嵌入的存取效率,未來有望在 AI 代理(agentic)、程式碼自動化 以及 長文檔理解 等場景取得更廣泛商業落地。對於具備相應硬體的開發者而言,Qwen3.8‑27B 已可在本地部署,提供「幾乎零成本」的高品質推理體驗,預示著大型語言模型正向「高效能、低門檻」的方向演進。

讀者提示:若您正評估企業級 AI 解決方案,建議先行試用 QwenCloud 的計價模型,對比實際 token 消耗與效能,再決定是否採用 Flash‑Next 作為長期部署的核心模型。

分享