IBM 發佈 Granite 4.2 大型語言模型與 Granite Speech 5.0 Turbo CTC
AI 奇點前沿

IBM 發佈 Granite 4.2 大型語言模型與 Granite Speech 5.0 Turbo CTC

AI News Bot
2026-08-27
預計閱讀 1 分鐘原文來源

IBM 發佈 Granite 4.2 大型語言模型與 Granite Speech 5.0 Turbo CTC

IBM 近日正式釋出 Granite 4.2 系列大型語言模型(LLM),分別提供 3 億、8 億與 30 億參數(參數即模型內部可調整的權重)三種規模。這三款模型從頭訓練(scratch)使用約 15 兆個 token(文字單位),支援高達 512,000 個 token 的上下文視窗,遠超過傳統 2,048~4,096 token 限制,讓長篇文件、程式碼或多輪對話的處理更為流暢。

多模式運算:思考與非思考

Granite 4.2 引入「思考」與「非思考」兩種運算模式,使用者可依任務複雜度切換。

  • 思考模式:全功率運算,適合需要深度推理或產生長文的情境。
  • 非思考模式(低成本模式):在簡單查詢或單句回覆時自動降低算力,節省雲端資源與成本。

代理式強化學習(Agentic RL)

8 億與 30 億規模的模型額外接受了 IBM 所稱的「代理式強化學習」訓練。模型在受控的沙箱環境中學會 使用工具、編寫並執行程式碼、以及網路搜尋,相當於賦予模型「自助」解決問題的能力。所有模型皆支援 OpenAI 格式的工具呼叫(tool calling),可直接與外部 API 整合,並可在 vLLM 或 SGLang 等高效推理框架上部署。

Granite Speech 5.0 Turbo CTC:超高速語音辨識

在語音領域,IBM 同時推出 Granite Speech 5.0 Turbo CTC,模型僅有 4.7 億參數,卻在 Open ASR Leaderboard(自動語音辨識排行榜)上以兩倍速度領先前代。根據 IBM 數據,該模型能在 1 秒內完成 3 小時音訊的轉寫,相當於每秒處理 10,800 秒的語音,對即時字幕、客服錄音分析等應用具備顯著優勢。

開源與授權

Granite 4.2 與 Granite Speech 5.0 均以 Apache 2.0 授權釋出,已上傳至 Hugging Face、Ollama、GitHub 等平台,開發者可自由下載、修改與再商業化,促進生態系統的快速擴散。

產業影響與未來展望

  1. 成本效益:低成本模式與小參數語音模型降低了企業部署 AI 的門檻,特別是中小企業可在自有伺服器上運行而不必依賴昂貴的雲端服務。

  2. 長上下文應用:512k token 視窗為法律文件審查、長篇科研報告摘要等需求提供了技術基礎,未來有望推動「全篇理解」的商業解決方案。

  3. 工具化智能:代理式 RL 讓模型能自動呼叫外部工具,為自動化工作流、程式碼生成與資料搜尋帶來新可能,預計會加速 AI 助手在企業內部的落地。

  4. 語音即時化:Turbo CTC 的高速轉寫可支援直播字幕、車載語音指令等低延遲場景,未來若結合多語言模型,將進一步提升跨國溝通效率。

總結來說,IBM 以開源、可調節算力與長上下文三大特點重新定位大型語言模型與語音辨識的市場角色。對於關注成本、效率與資料隱私的企業而言,Granite 系列提供了值得關注的替代方案;同時,開放授權也為學術與創新社群提供了寶貴的實驗資源。未來,隨著更多工具化訓練與更長上下文的成熟,AI 將更深入日常工作與產業流程,值得業界持續觀察與投入。

分享