阿里巴巴釋出 Qwen3.8‑Flash‑Next:1250 億參數 MoE 模型,支援 26 萬 Token 上下文
AI 奇點前沿

阿里巴巴釋出 Qwen3.8‑Flash‑Next:1250 億參數 MoE 模型,支援 26 萬 Token 上下文

AI News Bot
2026-08-27
Photo by YI REN on Pexels
預計閱讀 1 分鐘原文來源

阿里巴巴釋出 Qwen3.8‑Flash‑Next:1250 億參數 MoE 模型,支援 26 萬 Token 上下文

核心亮點

阿里巴巴近日公開了 Qwen3.8‑Flash‑Next 的模型權重,作為即將推出的 Qwen4 架構的預覽版,供開發者自行測試與評估。此模型是一款 多模態混合專家(Mixture‑of‑Experts, MoE) 變體,主體擁有 1250 億參數,另加 51 億 N‑gram 嵌入,每次推論時僅啟用 60 億參數(即每個 Token 觸發 6B 參數),支援原生 262,144 Token 的上下文窗口,透過 YaRN 技術可延伸至 100 萬 Token。


背景與技術突破

高容量上下文的瓶頸

在需要大量文字資訊的應用(如代理式程式碼生成、文件處理、工具驅動工作流)中,注意力計算與 KV 快取記憶體(Key‑Value Cache)往往成為效能瓶頸。Qwen3.8‑Flash‑Next 以 混合式架構 同時採用 Gated DeltaNet(GDN) 與 Qwen Sparse Attention(QSA) 兩種技術,緩解此問題。

  • GDN:在每四層中有三層使用 GDN,將歷史上下文持續壓縮成固定大小的遞迴狀態,避免 KV 快取隨序列長度膨脹。
  • QSA:其餘層則採用 QSA,將序列切割為微塊(micro‑block),在塊層面估算重要性,只檢索最相關的區段,降低注意力與索引成本。

相較於傳統的 token‑level 稀疏注意力,QSA 的 塊級選取 讓計算量與記憶體需求在長上下文下仍保持可接受。

效能驗證

阿里巴巴的基準測試顯示,QSA 在 1 百萬 Token 工作負載下,與完整注意力相比,預填(prefill) 階段提升最高 7.6 倍,解碼(decoding) 階段提升 4.9 倍。在 90% 前綴快取命中率的線上服務測試中,Qwen3.8‑Flash‑Next 的預填吞吐量是 Qwen3.7‑Plus 的 8.6 倍。

NVIDIA 生態系支援

NVIDIA 透過 SGLang、vLLM 以及 TensorRT LLM 提供 Day‑0 功能支援,並在 GB300 NVL72(整合 72 顆 Blackwell Ultra GPU 的機架級平台)上完成推論驗證。該平台的 NVLink 網路提供 130 TB/s 的全互連效能,使每顆 GPU 可達 16,000 Token/秒,每位使用者可獲得 200 Token/秒 的回應速度,足以支撐高吞吐量、低延遲的代理式編程應用。


部署彈性與未來展望

除了機架級部署,Qwen3.8‑Flash‑Next 亦可在本地 NVIDIA 硬體上運行,包括 DGX Station、DGX Spark 叢集,以及搭載四顆 RTX PRO 6000 Blackwell Max‑Q 工作站版 GPU 的工作站。開發者可先於本機原型測試代理式工作流程,再將相同模型遷移至 GB300 NVL72 進行大規模生產服務。

未來展望

隨著 Qwen4 正式推出,預計將進一步擴大參數規模與上下文長度,同時優化 GDN 與 QSA 的協同效應。對於需要處理海量文字資訊的企業與研究機構而言,這類高效能 MoE 模型將成為新一代 AI 應用的核心引擎。

讀者啟示:若您正規劃代理式程式碼生成或大型文件分析,Qwen3.8‑Flash‑Next 提供的長上下文與高效注意力機制,值得在本地環境先行驗證,再視需求升級至機架級平台,以達到最佳的成本效益平衡。

分享