谷歌為 Gemini Flash 系列加入代理式影片分析
AI 奇點前沿

谷歌為 Gemini Flash 系列加入代理式影片分析

AI News Bot
2026-09-03
預計閱讀 1 分鐘原文來源

Google 為 Gemini Flash 系列加入 代理式影片分析

Google 近日宣布,將 代理式(agent‑based)影片分析 功能納入 Gemini 3.7 Flash、3.6 Flash 以及 3.5 Flash‑Lite 三款模型。與以往固定頻率(預設每秒一格)逐格掃描的做法不同,模型現在能自行搜尋影片中與任務相關的片段,顯著降低 token 用量與計算成本。

為何需要「代理式」?

過去 Gemini 只採用 靜態處理:以固定的每秒一格(1 fps)速率抽取畫面,並配合音訊轉錄逐秒分析。雖然在 2025 年已支援原生影片分析,但長時間的教學影片或講座仍會產生 上億 token,導致成本高企且可能遺失關鍵細節。

代理式分析讓模型自行決定:

  • 檢視哪段時間(可聚焦於秒以下的瞬間)
  • 以何種速度(對可疑區段提升取樣頻率)
  • 使用哪種模態(畫格、音訊或文字稿)

如此只抓取「真正需要」的資訊,避免無謂的資料消耗。

具體技術亮點

  1. 次秒級偵測:新模型能捕捉不到一秒的變化,例如畫面切換或狀態變更,提升自動影片剪輯的精準度。

  2. 異常偵測與重抽樣:當系統偵測到可疑時間窗口時,會自動以更高幀率重新抽樣,並能精確計算重複動作與個別物件的出現次數。

  3. 內部影片擷取工具:模型直接呼叫內建工具,只下載影片中相關的片段,開發者過去只能手動實作的選擇性擷取,現在全程自動化。

  4. 延續「代理視覺」概念:自 1 月推出的 Gemini 3 Flash「代理視覺」已讓模型能以 Python 程式碼執行圖像縮放、裁切與標註,並在「思考‑行動‑觀察」迴圈中驗證結果。此次將此概念擴展至影片,使視覺與空間推理更完整。

成效與應用場景

根據 Google 內部基準(含 LongVideoBench),Gemini 3.7 Flash 以代理式分析取得 最高整體品質,同時在 準確度與成本效益 之間取得最佳平衡。尤其在以下情境中效益顯著:

  • 10 分鐘教學短片:可即時定位關鍵示範步驟,省去全片逐格分析的高額 token。
  • 90 分鐘大學講座:自動找出重點段落與異常(如投影切換),減少人工標記工作量。
  • 多小時錄製:在不耗盡 token 的前提下,快速定位特定場景或物件變化。

開發者只需在 Gemini API 設定 processing_mode: "agentic",即可使用此功能,且收費仍採用標準 Gemini token 價率,沒有額外費用。相關操作說明已寫入 Developer Guide,並於 Google AI Studio 及 Gemini Enterprise Agent Platform 開放影片上傳與 YouTube 影片分析。

未來展望

Google 表示,代理式影片分析將陸續內建於自家產品,未來將在所有支援 Flash 與 Flash‑Lite 的 Gemini 應用程式中推出。隨著模型在「何時、何處、以何種模態」上更具自主判斷能力,開發者將能以更低成本建構 高精度自動剪輯、異常偵測與內容搜尋 等創新服務。

對於內容創作者與教育平台而言,這意味著 更快的影片索引、更精細的剪輯工具,以及 降低運營成本 的可能。隨著代理式視覺技術持續成熟,未來或可期待模型在實時直播、影片摘要乃至 AR/VR 互動內容中的即時分析與回饋,為多媒體 AI 應用開啟新篇章。

分享