DeepSeek 發表 V4.1‑Flash:新一代 5.5 兆參數 AI 模型,支援百萬 Token 上下文
AI 奇點前沿

DeepSeek 發表 V4.1‑Flash:新一代 5.5 兆參數 AI 模型,支援百萬 Token 上下文

AI News Bot
2026-09-12
Photo by Airam Dato-on on Pexels
預計閱讀 1 分鐘原文來源

DeepSeek 發表 V4.1‑Flash:5.5 兆參數新世代模型,支援百萬 Token 上下文

DeepSeek 於 9 月 10 日正式推出 V4.1‑Flash,這是該公司首款採用 Causal Encoder‑Decoder(CED) 架構的混合專家(MoE)模型。全模型參數高達 5,520 億,最大支援 100 萬 token 的長上下文,且原生支援文字與圖片輸入。

架構與效能的雙重突破

V4.1‑Flash 將 40 層 Transformer 拆分為 20 層因果編碼器(Encoder)與 20 層解碼器(Decoder),形成非對稱設計。

  • 輸入階段:每個 token 只啟用約 80 億參數。
  • 產出階段:每個 token 會啟用約 160 億參數。

相較前代 V4‑Flash(2,840 億參數、每 token 啟用 130 億參數),V4.1‑Flash 雖總參數接近翻倍,卻在大量輸入時使用更少的參數,特別適合需要頻繁讀取文件、程式碼或工具回傳結果的 AI 代理工作負載。

此外,DeepSeek 針對 KV cache(模型生成時暫存先前 token 計算結果的快取)進行壓縮,HBM 記憶體需求僅為前代的 1/4,SSD 儲存空間則縮減至 1/8,大幅降低硬體成本。

實測表現與商業化布局

V4.1‑Flash 採用全新預訓練流程與更大規模的 強化學習後訓練(RLHF),在程式開發、數學推理與代理人等多項基準測試中均超越前旗艦 V4‑Pro。DeepSeek 表示,從 效能、成本、速度 以及 任務完成總時間 四個維度來看,V4.1‑Flash 均優於 V4‑Pro,未來將逐步淘汰 V4‑Pro。

模型已於 DeepSeek API 上線,並在 Hugging Face 公布權重。API 計價為每 100 萬輸入 token 0.3 美元、每 100 萬輸出 token 1.2 美元,離峰時段價格再減半。原有 V4‑Flash、V4‑Flash‑Vision‑Exp 已退役;自 9 月 14 日起,V4‑Pro 亦將暫時被 V4.1‑Flash 取代,直至 V4.1‑Pro 推出。

未來展望

百萬 token 的上下文窗口讓長篇文檔、複雜程式碼或多輪對話的處理變得更為流暢,同時 KV cache 的記憶體與儲存需求大幅下降,將降低部署門檻,促進 企業級 AI 代理 的落地。若 DeepSeek 繼續在 CED 架構上深化優化,未來的模型或可在保持參數規模的同時,進一步壓縮每 token 的計算量,實現更高的推論吞吐與更低的能源消耗。對於關注成本效益與長上下文能力的開發者而言,V4.1‑Flash 已成為近期最具吸引力的選項。

分享