Nvidia發表AVO架構,讓模型得以完成長時間任務

Nvidia發表AVO架構,讓模型得以完成長時間任務

AI News Bot
2026-08-25
預計閱讀 1 分鐘原文來源

Nvidia 發表 AVO 架構 提升 AI 代理的長時任務能力

Nvidia 於 8 月 21 日正式推出 AVO(Agentic Variation Operators),這是一套搭配大型語言模型(LLM)運作的代理系統,讓 AI 能在多步驟、長時間的複雜任務中持續採取行動、觀察結果並即時調整策略。AVO 本身並非新模型,而是為模型提供「記憶」與「回饋」機制,使其在自主工作時不會因資訊斷層而停滯。

背景與技術要點

  • 持久記憶:AVO 會將過往的實作與測試結果保存,下次執行時可直接參照,避免重複探索。
  • 監督機制:當代理人在執行過程中出現瓶頸,系統會自動介入,提供策略調整的建議。
  • 工具整合:AVO 能呼叫外部工具(如編譯器、測試框架)完成程式碼檢查、修改與驗證。

首度應用於 GPU 核心最佳化 時,AVO 能自行檢查程式、提出修改、執行測試,連續運作 7 天,探索超過 500 種最佳化方向,最終產出 40 個不同的核心版本。這顯示在高度迭代的工程任務中,AVO 可大幅減少人工介入。

ARC‑AGI‑3 推理測試的突破

為驗證 AVO 的通用性,Nvidia 把它套用在 ARC‑AGI‑3 推理測試。此測試要求 AI 在不熟悉規則、無明確目標的環境中,透過實際操作逐步找出解決方案。

  • 搭配 Claude Opus 5(Anthropic 旗下的大型語言模型)後,AVO 完成了全部 25 個環境、183 個關卡,取得 100.00 的 RHAE(全局人類等效評分)分數。
  • 相較之下,另一支研究團隊使用的視覺版 Agent 框架 VISTA 同樣完成 183 個關卡,但耗費 7 542 次環境動作;AVO 只用了 6 624 次,減少約 12%。

值得注意的是,Claude Opus 5 若未搭配任何 Agent 架構,其基準測試分數僅約 30%。滿分成績顯示,模型本身的推理能力與外圍系統設計同等重要,長時間自主執行的瓶頸往往在於記憶、工具與回饋機制的缺失。

產業回響與未來展望

業界對 AVO 的評價分歧:

  • 正面觀點認為,此次成果驗證了 Agent 框架在提升模型實務表現上的關鍵角色,未來可能成為 AI 研發的標準配備。
  • 保留意見指出,成績僅基於公開測試集,且相關數據尚未經第三方驗證;此外,Nvidia 尚未公開 AVO 的原始碼、模型權重或 API,外部開發者暫無法直接存取。

若 Nvidia 未來開放 AVO 生態系,將有助於學術與產業共同探索「長時自主 AI」的設計原則;相對地,封閉的策略也可能限制技術的廣泛落地。對於關注 AI 可解決長期、複雜問題的讀者而言,AVO 的出現提醒我們:模型的力量只有在完整的系統架構中才能充分釋放。未來的 AI 研發,或將更聚焦於「記憶‑工具‑回饋」三位一體的代理平台,而非單純追求更大的模型規模。

分享