預計閱讀 1 分鐘原文來源
核心突破
英偉達最新的 Agentic Variation Operators (AVO) 代理系統,在完整的代理架構下,將 Claude Opus 5 的效能從原本的 30% 基線提升至 100%。此成果顯示,單純提升語言模型的參數或訓練資料並非唯一關鍵,系統設計(即代理的「harness」) 才是解鎖長程、多步驟任務表現的關鍵因素。
系統設計與實驗
AVO 以「通用程式碼代理」為核心,具備以下能力:
- 檢視與編輯程式碼:可即時讀取現有實作,提出修改建議。
- 執行指令與測試:在實體硬體上跑測試,取得真實回饋。
- 參考文件與驗證:自動查詢 API 文件或最佳化指南,確保改動合理。
在 GPU 核心最佳化 任務中,AVO 取代傳統演化搜尋的預設變異步驟,改由代理自行決定「檢查什麼、改什麼、測什麼、提交什麼」。實驗於 NVIDIA DGX B200 系統上持續 七天,探索逾 500 條最佳化方向,最終提交 40 版 穩定的多頭注意力(multi‑head attention)核心。
- 相較於 NVIDIA 官方的 cuDNN,最高提升 3.5%。
- 相較於 FlashAttention‑4,最高提升 10.5%。
同樣的 AVO 架構亦被接入 ARC‑AGI‑3 基準測試,只更換任務介面與評估工具,證實其 通用性:同一套代理即可在不同環境下維持高效運作。
未來展望
此研究證明,代理系統的設計 能將前沿語言模型的潛能完整釋放,特別是在需要長時間、迭代式調整的工程任務上。未來若將 AVO 與更多領域(如自動化測試、資料清理、甚至機器人控制)結合,預計能進一步縮短人類工程師的手動調校時間,同時提升系統的可靠度與可解釋性。對於關注 AI 代理可持續自主運作的研究者與產業應用者而言,英偉達的這項成果提供了可借鏡的架構藍圖,也提醒我們:模型本身固然重要,完整的代理生態才是實現真正「長程智慧」的關鍵。
分享
