英偉達 NVIDIA 的 Cosmos 3:改變物理人工智能系統
在物質世界中,一切都處於動態變化之中。物理人工智能系統(如機器人、自動駕駛車輛和智能場域)不僅需要理解它們所見之事物及其原因,還需預測接下來可能會發生什麼。例如,在倉庫中,機器人可能遇到前所未見的物件配置;在馬路上,自動駕駛車必須應對行人從停車車輛之間突然走出的情況;而在工廠中,安全系統需要預測叉車行進的方向,而不僅僅是檢測其存在。
然而,捕捉並重現這些場景在現實世界中往往緩慢、昂貴且難以大規模複製。NVIDIA 的 Cosmos 3 就是為了解決這樣的問題而生。此款新推出的基礎模型結合了視覺推理和多模態生成技術,能夠將文本、視頻、圖像、環境聲響及動作整合在同一個模型中,幫助開發人員創造具有物理背景的世界數據。
理解 Cosmos 3 的核心能力
Cosmos 3 具有混合的轉換器架構,首先藉由推理模塊解析場景中的發生事項,然後利用生成模塊根據情境產生具體的物理輸出,從合成視頻到機器人任務數據。這款通用基礎模型通過多樣化的數據訓練,使其能夠廣泛地理解場景、運動和機器人動作之間的關係。
精細化應用與實踐案例
為了讓機器人學會更多技能,僅靠圖像或視頻是不夠的。例如,在進行取放物件任務時,開發者需要提供行動信號以指導如何伸手、抓握、移動和放置物品。NVIDIA 的 GEAR 研究團隊正使用 Cosmos 3 發展視覺行動模型,幫助具體化代理學習如何在遊戲、模擬及現實場景中進行推理、移動和行動。
敏捷機器人公司(Agile Robots)正在利用 Cosmos 3 生成行動條件下的機器人數據,以便其策略開發能夠在大規模範疇內產生多樣化的任務軌跡。例如,當收到「將香蕉放在盤子上」的指令後,Cosmos 3 不僅能理解該動作的情境,還能生成具體的視頻內容或合成數據來指導機器人的行動。
跨場景推理與未來展望
Cosmos 3 可以在場景中進行推理,識別哪些物件正在移動、哪條路徑可能會交匯以及接下來可能出現什麼狀態。然後根據這些信息生成密集的數據,這對於提升物理人工智能系統的效能至關重要。隨著 Cosmos 3 的持續發展,我們可以預期其在自動駕駛車輛、機器人和智能場域等領域將帶來革命性的變革。
總結而言,NVIDIA 的 Cosmos 3 系統為物理人工智能系統提供了新的可能性,使其能夠更好地理解和應對複雜的現實世界。隨著技術不斷進步,這些先驅性的創新將推動整個產業向前發展。
