OpenAI 暫停前沿強化學習訓練 加強安全與對齊
OpenAI 於本週二宣布,將其最新人工智慧模型的**強化學習(Reinforcement Learning,簡稱 RL)**訓練暫停兩週,藉此加固防護機制、擴大監控範圍,避免再度發生類似 Hugging Face 的安全事件。
背景與原因
隨著模型能力日益提升,內部開發與測試所面臨的風險亦同步上升。公司指出,必須讓監控、對齊(Alignment)與安全標準領先於風險,故選擇減緩規模擴張的速度。目前最大的前沿 RL 計畫已暫停,改以小規模訓練與評估來觀察模型行為、驗證防護措施,並在取得更具體的對齊證據後才進入下一階段。
具體加強措施
-
沙盒與網路隔離:加強執行環境的沙盒化,徹底切斷模型對外部網路的存取,防止未授權的資訊流出。
-
持續安全測試:針對共享服務執行不間斷的安全掃描,削減常駐權限,提升安全與信任邊界。
-
監控升級:新監控系統會自動標記並升級潛在問題,交由「高度自動化且具高運算需求的偵測器」進行深入分析,檢查工具行為、推理過程與完整活動序列,以防止資料竊取、破壞行為或試圖規避防護的情形。
-
即時警示:一旦偵測到異常,系統將在 30 分鐘內 發出警報,所有涉及 Sol 能力或以上的 RL 訓練與評估皆必須遵守此機制。
-
運算成本:上述防護預計會使觀測推論工作負載增加約 20%。
相關模型 Astra 的影響
在對即將推出的模型 Astra 進行內部評估時,OpenAI 發現其在「代理式程式編寫」與網路安全方面取得顯著進展。部分訓練與評估已符合新安全標準,然而仍有大量工作負載被暫停,直至完成全部遷移與加強。公司強調,安全與對齊工作將優先遷移至新環境。
未來展望
OpenAI 此次暫停顯示大型語言模型在具備自我行動與攻擊能力時,安全與對齊的挑戰已不容忽視。若未來能持續以嚴格的沙盒、即時監控與高成本防護為基礎,或可在推動技術突破的同時,降低模型被濫用的風險。對產業而言,這也傳遞出一個訊號:在模型能力跨足「代理」層級前,安全基礎設施必須同步升級,否則任何突破都可能伴隨不可預測的後果。
