Mellum2:低延遲的文字與程式碼工作負載高效AI模型
今日,《華爾街日報》科技版推出了一個名為 Mellum2 的開放式 Mixture-of-Experts(MoE)模型,專注於低延遲的文字和程式碼工作負載。原本 Mellum 是一個編程完成模型,在 Mellum2 中,我們將其基礎拓展至更多自然語言和軟體工程任務,同時保持高效推理及部署的能力。
模型背景與設計理念
現代人工智能系統越來越依賴多個模型的呼叫,例如路由、回溯、總結、規劃、驗證和工具使用。許多這些操作對於延遲非常敏感,但並不需要最大的可用模型。Mellum2 正是為了這些工作負載而設計。
根據我們的技術報告,在程式代碼生成、推理、科學和數學等指標上,Mellum2 表現得與同規模的開放式模型相當,但在推論速度上的表現則快於兩倍以上。這使其適合高通過量生產應用。
模型架構
Mixture-of-Experts(MoE)架構
Mellum2 采用了 MoE 架構,這種結構能保持總體模型容量的高水平,並在每次計算中只激活一小部分參數。這樣可以提高推論效率,有助於減少實時工作負載的服務成本。
模型應用場景
輕量級路由與協調
Mellum2 作爲一個輕量級的路由和協調模型,在多模型系統中表現出色,包括提示分類、工具選擇以及中介控制流程步驟等。
靈敏度高的回溯管道
該模型適合用於對於延遲敏感的回溯管道,例如文獻壓縮、總結及回溯後處理等。
代理子任務
Mellum2 可以用於代理子任務,如規劃、驗證、轉換和文獻準備,減少在中間操作中調用較大模型的需求。
部署與應用場景
因為 Mellum2 是開放式的且服務效率高,所以它可以在涉及私有代碼或內部數據的自托管環境中部署。對於軟體工程領域的人工智能系統建設者來說,無論是在 IDE 環境、RAG 管道、代理工作流還是私有基礎設施中,Mellum2 都已經準備好可以使用。
未來展望
隨著人工智能系統的成熟,最有效的架構正在變得越來越不單一。一個前沿模型當然很強大,但生產環境往往需要多個專門化的組成部分共同工作:回溯器、路由器、程式碼感知模型、驗證器、工具調用者和更大的推理模型。
我們將 Mellum2 看作是「焦點」模型:一種快速、範圍精確的模型,針對大型人工智能系統中的高頻任務進行優化。目標不是替換堆疊中所有的模型,而是使整個堆疊更快、更便宜且更容易控制。
总結
如果你正在為軟體工程建立人工智能系統——在 IDE 中、RAG 管道中、代理工作流的一部分或私有基礎設施上——Mellum2 已經準備好可以使用。
