預計閱讀 1 分鐘原文來源
微軟發布新 AI 行為守則 呼籲放緩人工智慧發展
微軟近日公布《人工智慧行為守則》(MAI Code of Conduct),正式將「人類控制優先」寫入公司自有模型的研發與運行規範。守則列出核心價值、行為限制與衝突目標的處理方式,未來將成為所有訓練、技術控管與評估的最高指引,僅次於操作人員與使用者的請求。
背景與主要內容
- 適用範圍:守則目前僅約束微軟自行開發的模型,未自動涵蓋在微軟平台上運行的第三方模型。
- 實施時程:在六週公開諮詢後,守則將於 2026 年底完成修訂,預計 2027 年起正式指導模型開發。
- 人類控制原則:微軟明言,若模型的安全性無法得到保證,便「不建造」;必要時願意犧牲模型的通用性、自主性或效能,以確保人類仍能隨時中斷、校正或關閉模型。
- 可讀性要求:模型不得使用「神經語言」或其他人類難以理解的溝通方式,無論是自我推理還是與其他 AI 系統互動,都必須產出可供人類監督的推理鏈(readable chain‑of‑thought)。
- 外部審計:微軟表示歡迎獨立審計機構驗證其是否真的放慢開發速度,顯示出對透明度的開放姿態。
與業界呼聲的呼應
本次守則的發布恰逢 Anthropic 執行長 Dario Amodei 呼籲整個產業放緩 AI 研發步伐。微軟執行長 Satya Nadella 於週末公開支持此呼聲,OpenAI、xAI 與 Meta 也陸續表態贊同。微軟的舉動可視為業界首家將「放緩」具體寫入內部治理文件的公司。
與 OpenAI GPT‑6 Astra 的對照
OpenAI 最近推出的 GPT‑6 Astra 在系統說明書中指出,模型的推理痕跡(reasoning traces)變得更難被監控,儘管其安全限制較前代 GPT‑5.6 Sol 更為可靠。OpenAI 首席科學家 Jakub Pachocki 早在 GPT‑6 發布前即警告,僅靠可讀的推理鏈仍不足以防止模型自行操縱這些訊息。微軟在守則中亦承認,模型給出的理由不一定能完整說明實際行為,僅靠「可讀」並非萬全之策。
未來展望與讀者啟示
微軟的 AI 行為守則標誌著大型科技公司在「安全」與「速度」之間開始明確劃線。雖然守則本身尚未直接限制開發速度,也未對第三方模型施加約束,但其「人類控制優先」的原則與接受外部審計的姿態,可能成為未來產業標準的雛形。對於關注人工智慧倫理與風險的讀者而言,這提醒我們:技術的突破必須伴隨透明、可監督的治理框架,否則即使最先進的模型也難以獲得社會的長期信任。
分享