
谷歌DeepMind發佈Gemini Robotics 2,推動機器人控制新時代
谷歌DeepMind最近發佈了一個新的人工智慧模型Gemini Robotics 2,該模型可以控制多種不同的機器人,包括人形機器人,它們可以執行複雜的任務,如更換燈泡和綁紮垃圾袋。這項技術的發佈標誌著機器人控制領域的新時代。
Gemini Robotics 2的技術詳解
Gemini Robotics 2結合了多個不同的AI模型,包括視覺語言模型(VLM)和視覺語言行動模型(VLA)。視覺語言模型可以理解圖像和視頻,並與人類進行溝通和推理,以執行不同的任務。視覺語言行動模型則控制機器人的全身運動和抓握器或手的運動。這些模型的結合使得機器人可以理解其周圍環境並採取相應的行動。
實際應用和挑戰
在發佈之前,谷歌DeepMind展示了多個機器人使用Gemini Robotics 2模型執行複雜任務的示範。例如,Apptronik的Apollo 2機器人使用Sharpa公司的抓握器整理書架。然而,該模型的訓練需要大量的人工干預、視頻示範和模擬。目前,AI模型仍然無法在沒有具體訓練的情況下執行廣泛的複雜任務。
安全性問題和未來展望
給予邊緣AI模型訪問機器人並允許它們在工作場所或家中漫遊和操縱物體,存在著風險。之前的研究已經表明,使用邊緣AI控制機器人可能會產生意外和有時甚至危險的行為。谷歌DeepMind的機器人部門負責人Carolina Parada表示,公司採取了多層次的安全方法,並引入了ASIMOV-Agentic基準,以衡量AI系統控制機器人的安全性。未來,谷歌DeepMind將繼續致力於改進Gemini Robotics 2模型的安全性和性能,推動機器人控制領域的發展。
結論
Gemini Robotics 2的發佈標誌著機器人控制領域的新時代。該模型的結合多個AI模型的設計,使得機器人可以理解其周圍環境並採取相應的行動。然而,安全性問題仍然是需要關注的。谷歌DeepMind的努力將有助於推動機器人控制領域的發展,並使得AI技術在實際應用中發揮更大的作用。隨著技術的進一步發展,機器人控制領域將成為未來的一個重要研究和應用方向。