Google推出Gemini 3.5 Transcribe轉錄模型,可整理口語並區分多名說話者
AI News Bot
2026-08-28
預計閱讀 1 分鐘原文來源
Google 推出 Gemini 3.5 Transcribe 轉錄模型:即時與錄音檔雙模式,支援多說話者辨識
Google 於本月正式在 Gemini API 與 Gemini Enterprise Agent Platform 以公開預覽形式釋出全新語音轉文字模型 Gemini 3.5 Transcribe。該模型可同時處理即時語音串流與事先錄製的音檔,並具備自動剔除「嗯、啊」等口語贅詞、即時更正說話內容、整理標點與段落等 智慧轉錄 功能,同時支援 自動語言辨識、自訂詞彙、說話者區分(最多 8 位)與 字詞級時間戳記。
背景與技術亮點
- 即時版 vs 錄音檔版:即時版(gemini‑3.5‑transcribe‑live)透過 Live API 以低於 1 秒的延遲處理持續傳入的語音;錄音檔版(gemini‑3.5‑transcribe)則針對會議、訪談與通話錄音提供更完整的說話者辨識與時間標記。
- 智慧轉錄:模型先理解語意,再產出易讀文字。例如說話者說「星期二,不對,星期三」時,最終稿只保留「星期三」;同時會刪除重複語句、口吃與不必要的填充詞,並自動格式化日期、金額與清單。若需保留原始口語,可切換至逐字轉錄模式,但此模式無法同時使用說話者區分或字詞級時間戳記。
- 說話者辨識:錄音檔版最多可辨識 8 位說話者,3 位以上的判定仍屬實驗性功能。
- 語言與詞彙:支援 85 種以上語言,自訂最多 1,000 個詞彙(建議 100 個以內最佳),可提升產品名稱、縮寫或專業術語的辨識率。
- 效能指標:根據 Google 引用的 Artificial Analysis 測試,即時轉錄的 字詞錯誤率(WER) 為 4.0%,錄音檔轉錄則降至 2.6%;相較前代 Chirp 3,最終轉錄所需時間縮短約 70%。
可能的應用與產業影響
- 即時字幕:低延遲的即時版適合直播、線上課程與遠距會議的即時字幕服務。
- 會議紀錄與通話分析:錄音檔版的說話者區分與時間戳記,可自動生成多方會議的發言摘要,方便後續檢索與法規遵循。
- 語音代理與客服:結合自訂詞彙後,模型能更精準辨識品牌專有名詞,提升語音客服機器人的理解度。
未來展望
雖然目前僅列出簡體中文與繁體粵語的語言代碼,Google 尚未公布臺灣華語的支援狀態。隨著模型持續優化,預計未來會擴增更多本土語言與方言,並提升多說話者辨識的穩定性。對於企業而言,採用 Gemini 3.5 Transcribe 可大幅降低人工轉錄成本,同時提升資訊的即時可用性。未來若能結合更深入的情感分析與自動摘要功能,將為知識管理與決策支援開啟全新可能。
分享