阿里巴巴發佈Qwen3.8-2.4T-A95B,革命性開放權重模型
阿里巴巴最近發佈了一個革命性的開放權重模型,名為Qwen3.8-2.4T-A95B(Qwen3.8-Max),這是一個具有2.4T參數的巨型模型,帶來了近乎前沿的能力到開放生態系統中。這個模型採用了一種精細的混合專家(MoE)架構,結合了全注意力和線性注意力的混合架構,具有高達一百萬個token的上下文窗口和高達128K的輸出長度,旨在處理嚴苛的推理和智能工作負載。
技術架構與優勢
Qwen3.8-2.4T-A95B的架構包括了一個混合的全注意力和線性注意力機制,當中每個token都會與其他token進行注意力交互作用,而在線性注意力層中,則使用了一個有界的循環狀態來替代不斷增長的KV緩存。這個架構使得模型在處理高達一百萬個token的上下文時,能夠保持計算和記憶的有界性。另外,模型還採用了一種精細的混合專家(MoE)機制,將容量分佈在一個較大的專家群體中,從而提高了專業化和路由效率。
部署與優化
部署一個2.4T參數的開放權重模型需要大規模的加速計算。英偉達(NVIDIA)正在與開源生態系統合作,通過優化的核心、推理運行時和分佈式服務配方,將模型部署到多節點上。根據測試,模型在NVIDIA GB300 NVL72上,使用FP8精度,能夠達到每秒4K個token的吞吐量,而在每用戶的基礎上,則能夠達到每秒350個token的吞吐量。未來,通過進一步的優化,例如使用NVFP4精度,預計能夠帶來更大的性能提升。
未來展望
Qwen3.8-2.4T-A95B的發佈,標誌著人工智能技術的一個重要里程碑。這個模型的開放,將使得更多的開發者和研究人員能夠使用和研究這個模型,從而推動人工智能技術的進一步發展。同時,隨著模型的不斷優化和應用,我們可以預期,人工智能技術將在更多的領域中發揮重要作用,例如智能助手、自動化工作流等。因此,Qwen3.8-2.4T-A95B的發佈,不僅是一個技術上的突破,同時也是一個對於未來科技發展的重要啟示。
