
微軟新旗艦:MAI‑Transcribe‑2‑Streaming 低於 100 毫秒即時轉錄
微軟 AI 部門於 10 月 1 日正式發布 MAI‑Transcribe‑2‑Streaming,這是微軟首款自研的即時串流語音辨識模型。該模型支援 60 種語言,並具備持續自動語言偵測功能,音訊抵達後約 100 毫秒 即可輸出初步轉錄結果,使語音代理人能在使用者尚未說完時就開始推理或呼叫工具。
背景與技術亮點
即時串流語音辨識已廣泛應用於語音助理、即時字幕與語音輸入等場景。市場上已有 OpenAI、Google、Deepgram、ElevenLabs 等提供相關服務,競爭焦點主要落在 轉錄準確度 與 延遲表現 兩大指標。微軟先前的 MAI‑Transcribe‑2 已在批次轉錄上取得不錯成績,此次推出的 Streaming 版延伸至連續語音流,能在後續語音到來時即時修正先前的文字,提升交互效率。
根據 Artificial Analysis 的即時串流語音辨識評測,MAI‑Transcribe‑2‑Streaming 在 最終轉錄 與 部分轉錄 兩項指標上均排名第一,且在「準確度 + 延遲」的綜合評分中位居前段,證實其兼具高準確與低延遲的雙重優勢。
同步更新的文字轉語音模型
同一天,微軟亦更新了 MAI‑Voice 系列,推出 MAI‑Voice‑2.1 與低延遲版 MAI‑Voice‑2.1‑Flash。兩者支援 23 種語言、覆蓋 26 個地區,允許同一聲線跨語言輸出,同時保留說話者特徵。MAI‑Voice‑2.1 側重語音品質與自然度,適合內容製作與配音;Flash 版則針對語音助理、客服等大量即時應用,提供更快回應與較低價格。
價格與商業意義
MAI‑Transcribe‑2‑Streaming 在今年底前的優惠價為 每小時音訊 0.54 美元。MAI‑Voice‑2.1 與 Flash 版則以文字量計費,分別為每 100 萬字元 22 美元與 15 美元。這樣的定價策略有望降低企業導入即時語音服務的門檻,促進多語言客服與跨國會議的自動化。
未來展望
隨著延遲降至百毫秒以下,語音代理人將能在「說」與「聽」之間的時間差幾乎消失,實現更自然的對話流暢度。未來若結合微軟的雲端計算與大型語言模型(LLM),即時語音辨識與生成將形成閉環,為智慧助理、遠距教育與即時翻譯等領域帶來全新可能。對於關注 AI 語音技術的讀者而言,MAI‑Transcribe‑2‑Streaming 的出現標誌著即時語音服務已進入「低延遲 + 高準確」的成熟階段。