阿里巴巴的 Qwen3.8 Max AI 模型表現改善但成本更高
阿里巴巴的 Qwen3.8 Max AI 模型在 人工智慧分析指數 (Artificial Analysis Intelligence Index)中取得了 56 分的成績,比其前身 Qwen3.7 Max 的 46 分高出 10 分。根據 人工智慧分析 (Artificial Analysis)的資料,這使得 Qwen3.8 Max 的表現與 Claude Opus 4.8 不相上下,並超越了 GLM-5.2 (51 分)的成績,但仍落後於 Kimi K3 (57 分),而且 Kimi K3 的成本還低了 25%。
在 GDPval-AA 這一工作相關任務的基準測試中,Qwen3.8 Max 的成績躍升了 468 個 Elo 分 ,達到了 1,739 分,超越了 Kimi K3 (1,685 分)。然而,只有 Claude Opus 5 (1,852 分)取得了更高的成績。值得注意的是,Qwen3.8 Max 達到這一成績的方式是通過增加 每任務步數 (steps per task)從 14 個增加到 64 個,並且 輸入令牌 (input tokens)增長了 15 倍,因為測試在每個步驟都會將整個對話歷史重新發送給模型。
這意味著 Qwen3.8 Max 的運作方式更加徹底,但也運行得更慢,成本更高。儘管阿里巴巴降低了 每百萬令牌的價格 (從 2.50 美元降至 2.00 美元), 輸出價格 (從 7.50 美元降至 6.00 美元),以及 快取命中價格 (從 0.50 美元降至 0.25 美元),但阿里巴巴的 性價比 仍然受到影響。在 人工智慧分析指數 中,單一任務的成本現在是 1.14 美元,遠高於 Qwen3.7 Max 的 0.53 美元。相比之下,Kimi K3 每任務的成本只有 0.86 美元,而 GLM-5.2 的成本更低,僅為 0.57 美元。
除了成本的增加,Qwen3.8 Max 還出現了一些 回歸 (regressions)現象。例如,在 AA-LCR 測試中,它的成績下降了 2 分,這個測試是用來評估模型是否能夠正確地從非常長的文本中提取信息。同時,在 AA-Omniscience 測試中,它的成績下降了 10 分,這個測試是用來評估模型是否能夠正確地回答知識問題或誠實地承認它不知道。雖然 準確率 (accuracy rate)仍然保持在約 31%,但 幻覺率 (hallucination rate)從 23% 上升到了 40%。這意味著 Qwen3.8 Max 更常猜測答案,而不是說它不知道。
未來展望
阿里巴巴的 Qwen3.8 Max AI 模型的改善和成本的增加,對於人工智慧領域來說是一個重要的發展。雖然它的表現有所提升,但成本的增加和回歸現象的出現,可能會對其在市場上的競爭力產生影響。未來,阿里巴巴和其他人工智慧開發商需要繼續改進他們的模型,尋找更好的平衡點,在表現和成本之間,以滿足用戶的需求和市場的要求。同時,人工智慧領域的發展也需要更加關注 可解釋性 (explainability)和 透明度 (transparency),以確保人工智慧模型的決策過程是可理解和可靠的。
