預計閱讀 1 分鐘原文來源
GPT‑6 Astra 在機器人基準測試中大幅領先 —— 空間推理的突破
OpenAI 近期發布的 GPT‑6 Astra 在全新機器人基準 StationeryBench 中展現出顯著的空間推理能力。此測試以雙臂 YAM 機械手為平台,讓兩款模型分別執行五項桌面物件任務,包括拔掉筆蓋、倒出迴紋針、以及在兩隻機械手間傳遞尺子等。每個模型在相同的 200 次試驗中操作,同時接受相同的硬體條件。
成績對比
| 模型 | 完全成功任務數 | 中位進度分數(滿分 100) | |------|----------------|--------------------------| | GPT‑6 Astra | 7 / 100 | 46 | | MolmoAct2 (Ai2) | 0 / 100 | 12 |
Astra 能完整完成 7% 的任務,且在進度分數上遠高於 MolmoAct2。所有實驗影片與程式碼已於 GitHub 公開,供研究人員進一步驗證。
背景與技術要點
- StationeryBench:專為評估機器人在日常桌面環境中操作小物件的能力而設計,測試項目涵蓋抓取、旋轉、倒出等多種空間操作。
- 空間推理:指模型在三維環境中理解物體位置、姿態與相互關係的能力。Astra 在此領域的提升,被認為與其大量訓練於 3D 資料(如 Blender 場景) 有關。
- Yoav Artzi(Cornell & Google DeepMind)評價 Astra 為「空間推理的跨越式進步」,並指出即使如此,Astra 在其他情境下仍未達到人類水平。
在尚未公開的 REMAP 基準測試中,Astra 的準確率已接近人類表現,顯示其在更廣泛的 3D 任務上具備相當競爭力。
產業與未來展望
OpenAI 已表明長期目標是打造 消費者級機器人。若 Astra 的空間推理能力持續提升,未來的家用或辦公室機器人將能更自然地完成開瓶、整理文具等日常動作,降低使用門檻。另一方面,AI 研究社群亦可透過 StationeryBench 與 REMAP 等開放基準,持續追蹤模型在真實世界操作上的進步。
結語:GPT‑6 Astra 在 StationeryBench 的表現證明,結合大規模 3D 訓練資料的語言模型已開始突破傳統的文字理解範疇,向「看得見、摸得著」的智慧機器人邁出關鍵一步。未來,隨著基準測試的持續完善與硬體成本的下降,我們有望在不久的將來見到更具實用性的 AI 機器人走入日常生活。
分享
