
核心重點
NVIDIA Nemotron 3.5 ASR 已完成針對沙烏地阿拉伯 Najdi 與 Hijazi 方言的微調(fine‑tuning),透過 NeMo 框架與特製的 ASR 微調流程,提升本地口音與錄音環境的辨識準確度,同時保留原有的 40 種語言‑地區(language‑locales)支援。
背景與技術流程
自動語音辨識(ASR)模型在預訓練階段往往以主流語言與標準口音為主,導致區域方言與特定錄音條件常被低估。即使 Nemotron 3.5 已具備 阿拉伯語(含標準阿拉伯語)的即時串流轉寫能力,對於 Najdi、Hijazi 等本土變體仍可能出現錯誤。
為解決此問題,團隊採取以下步驟:
-
語料挑選與清理
-
從原始 125,490 筆語音中剔除無法對齊或明顯錯誤的片段,保留 103,559 筆,有效時長 133.7 小時,佔原始資料的 82.5 %。
-
以 Unicode 轉義檢測「غيرواضح」與「غير واضح」等不清晰標記,並執行額外的品質檢查。
-
-
二次篩選(NeMo Curator)
-
使用 MonoConversionStage 轉為單聲道;UTMOSFilterStage 與 SIGMOSFilterStage 依感知品質與背景噪音打分。
-
先以「僅打分」模式觀察分布,再設定語料專屬門檻:UTMOS ≥ 1.25、SIGMOS 噪音 ≥ 1.5、SIGMOS 整體 ≥ 1.5,最終通過約 85 % 的有效時長樣本,保留了許多具挑戰性的本地方言語音。
-
-
加權重播混合(Weighted Replay Mix)
- 為避免微調過程中遺失原有多語言能力,將原始多語言資料以較低權重混入訓練,形成「重播」機制,只保護其已代表的語言範圍。
-
高效批次與部分解凍(Partial Unfreezing)
- 以效能最佳的批次大小進行訓練,僅解凍模型的部分層,減少參數調整量,提升收斂速度。若混合比例變動,仍需重新調整解凍層級。
-
獨立測試集評估
- 在未見過的測試語料上驗證轉寫品質,確保微調後的模型在目標方言上有顯著提升,同時不嚴重削弱其他語言的表現。
影響與未來展望
此微調流程證明,在資源有限但已有標記語音 的情境下,透過精心的資料清理、加權重播與局部解凍,可快速將大型多語言模型適配至特定方言或領域,避免從頭訓練的高昂成本。未來可將此方法擴展至其他阿拉伯語方言、甚至非阿拉伯語的低資源語言,並持續探索自動品質評分的門檻設定,以更精細地平衡「保留」與「專精」之間的取捨。對於需要同時支援多語言與本地口音的商業部署而言,這是一條兼顧效率與準確度的可行路徑。