谷歌 DeepMind 推出 Gemini 代理式影片理解功能
AI 奇點前沿

谷歌 DeepMind 推出 Gemini 代理式影片理解功能

AI News Bot
2026-09-02
Photo by Tara Winstead on Pexels
預計閱讀 1 分鐘原文來源

Google DeepMind 推出 Gemini 代理式影片理解功能

Google DeepMind 今日正式在 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash‑Lite 三款模型上推出 代理式影片理解(agentic video understanding)。只要在 Google AI Studio 或 Gemini Enterprise Agent Platform 的 API 設定中將模式切換為「agentic」,即可即時使用此功能。

何謂「代理式」?

傳統的影片分析多採「靜態」方式,即以固定的每秒影格數(預設 1 FPS)將整段影片逐格送入模型,導致 代幣(token)消耗 與 運算成本 隨影片長度線性上升。

代理式影片理解則結合 Gemini 原生的 影片工具 與模型的推理能力,讓系統能 動態搜尋、掃描與檢查 目標段落,跨越視覺畫面、音訊與文字稿,同時執行程式碼以完成更細緻的任務(如次秒級別的瞬間檢索、異常偵測、精確計數等)。

效能提升數據

  • 代幣使用量降低最高 88%:動態取樣大幅減少不必要的影格輸入。
  • 分析成本下降最高 66%:計算資源需求隨代幣減少同步縮減。
  • 準確度提升最高 7%:動態聚焦關鍵片段提升模型判斷品質。

在標準影片分析基準測試中,三款模型皆展現上述效益;其中 Gemini 3.7 Flash 在品質與成本的平衡上達到最佳的 Pareto 前緣(即在相同成本下提供最高準確度,或在相同準確度下成本最低)。

為何對長影片特別有利?

長篇內容(10 分鐘的教學影片、90 分鐘的大學講座,甚至多小時的會議錄影)在靜態模式下,開發者往往必須在「高代幣成本」與「資訊遺失」之間妥協。代理式方法僅在需要的時間點抽取資訊,讓長影片的分析成本不再與影片長度成正比,同時保留關鍵細節。

立即使用方式

  1. 前往 Google AI Studio 或 Gemini Enterprise Agent Platform。

  2. 在 API 設定中選擇 agentic 模式。

  3. 上傳本機影片或提供 YouTube 影片網址,即可啟用代理式影片理解。

未來展望

  • 跨領域應用:結合代理式視覺與影片工具,可望在自動剪輯、內容審查、智慧教育等領域開發出更高效的解決方案。
  • 模型迭代:隨著 Gemini 系列持續升級,動態取樣與程式碼執行的協同效應將進一步提升,未來或可支援更高解析度與多語言音訊的即時分析。
  • 成本結構變革:若代幣與計算成本持續下降,開發者將更容易在雲端部署大規模影片 AI 服務,降低進入門檻。

結語:Google DeepMind 的代理式影片理解不僅在技術層面突破了傳統「靜態」分析的瓶頸,更為影片 AI 的商業化應用提供了更具成本效益的路徑。對於需要處理大量長影片的企業與開發者而言,這項功能值得立即納入工作流程,並持續關注後續的模型優化與新功能發布。

分享