Artificial Analysis 更新 Intelligence Index,GPT‑6 Astra 駕臨第二名
AI 奇點前沿

Artificial Analysis 更新 Intelligence Index,GPT‑6 Astra 駕臨第二名

AI News Bot
2026-09-06
Photo by Ann H on Pexels
預計閱讀 1 分鐘原文來源

Artificial Analysis 更新 Intelligence Index GPT‑6 Astra 駕臨第二名

Artificial Analysis 於本週釋出 Intelligence Index 4.2 版,回應外界指摘其先前基準測試未能完整呈現 GPT‑6 Astra 的真實進步。此番調整不僅加入新測項,亦重新校正多項評分規則,讓排行榜的變動更具說服力。

背景與最新排名

在 4.2 版更新前,Astra 的表現仍被 Artificial Analysis 歸為「與前代持平」。然而,其他機構的評測早已顯示其領先優勢:

  • Epoch AI 以 169 分、超過 50 項基準測試,將 Astra 排在 267 個模型中的第一名。
  • ARC‑AGI‑3 在不同測試環境下皆呈現「大幅」甚至「非常大」的躍升。

新版指數將 Astra 的分數提升 4 點,使其僅次於 Anthropic 的 Claude Fable 5.1,位居第二;Meta 緊隨其後排名第三。值得注意的是,Astra 在 每項任務使用的 token 數 方面最為節省,成為所有前沿模型中最省資源的選手。

在 成本‑效能比(cost‑to‑performance ratio)方面,Anthropic、OpenAI、Meta 與 智譜 AI(Zhipu AI)共同領先,顯示市場對於高效能且具經濟性的模型需求持續升溫。

基準測試的調整

本次更新加入兩項全新測試項目:

  • AA‑Briefcase:針對真實工作情境的知識任務,評估模型在商業文件、報告撰寫等實務應用的表現。
  • GDP.pdf(來源:Surge AI):專注 PDF 文件解析能力,測試模型對長篇技術文件的閱讀與摘要精準度。

同時,已完成的 GPQA‑Diamond 測試因所有模型皆已破解而被移除。為防止參賽者「刷榜」行為,私人測試資料的權重提升至 40%,使排行榜更難被操控。Artificial Analysis 亦修正了多項基準的計分錯誤,並微調評分機制,以提升結果的穩定性。

未來展望

Artificial Analysis 表示,過去為維持分數穩定性而延後更新,但排行榜變化過快,迫使其在重大模型發佈期間推出臨時調整。全新 Intelligence Index 5 已在研發八個月,將分階段陸續上線,預計引入更多實務工作場景與多語言測試,以更全面衡量大型語言模型的真實價值。

對於關注 AI 前沿發展的讀者而言,這次指數的刷新不僅提供了更精準的模型比較,也提醒產業必須持續關注 效能、資源消耗與成本 三者的平衡。未來,隨著測試項目的持續擴充與評分機制的精緻化,Intelligence Index 有望成為業界公認的「性能標竿」,協助企業與研究者在選型與投資決策上做出更明智的判斷。

分享