Abliteration.ai 推出可繞過安全拒絕的開放模型服務
核心重點
美國新創公司 Abliteration.ai 於 8 月底推出「abliterated‑model‑large‑v2」,這是一款以 Z.AI 旗下 GLM‑5.3 為基礎,去除或削弱其內建安全拒絕機制(refusal mechanisms)的開放權重模型,並以 Model‑as‑a‑Service(MaaS) 形式對外販售。此舉為合法商機,同時也帶來嚴峻的安全權衡。
背景與技術說明
- 開放權重模型:指模型的參數(weights)公開可取得,使用者可自行下載、修改或再部署。
- 安全拒絕機制:模型在偵測到敏感或危險指令時,自動回絕回應的內建防護。
- Abliteration(去除化):Abliteration.ai 透過分析模型內部的激活模式(activation patterns),找出觸發拒絕的神經元組合,然後微調權重以抑制這些模式。此過程屬於「模型層面的改寫」,不同於僅透過提示(prompt)繞過的「jailbreak」。
Abliteration.ai 在自家測試中稱,改造後的 GLM‑5.3 在 CyberGym(網路安全測驗平台)取得 84.5% 的成功率,Terminal‑Bench 4.0 為 41.8%,兩小時內解決 105 題 ExploitGym(漏洞利用)任務。儘管如此,該公司亦坦承與 GPT‑5.5、GPT‑5.6 Sol、Fable‑5 等商業大模型的比較受限於測試環境與算力差異,無法直接等量比較。
市場與風險
GLM‑5.3 具備強大的程式編寫、代理(agent)與資安能力,同時採用開放授權允許衍生與商業化。Abliteration.ai 因此得以合法改造、託管並以 每百萬 token 五美元 的標準費率提供服務,免除客戶自行建置 GPU 基礎設施的門檻。這種「即插即用」的模式降低了惡意使用的技術門檻,可能被用於:
- 攻擊性資安測試(offensive cybersecurity)
- AI 紅隊演練(AI red teaming)
- 代理測試與信任安全(agent testing & trust‑and‑safety)
- 惡意程式分析、釣魚模擬 等情境
未來展望與讀者啟示
Abliteration.ai 的商業模式凸顯了 開放權重 與 安全防護 之間的矛盾:一方面促進創新與可商業化應用,另一方面卻可能削弱 AI 系統的內建防禦。對於政策制定者、平台供應商與資安從業者而言,需思考如何在保護知識產權與維護公共安全之間取得平衡,或是透過授權條款、監測機制等方式限制模型的「去除化」濫用。
未來,隨著更多模型採用開放授權,類似的 abliteration 服務可能成為常態。讀者在評估相關技術或服務時,應審慎檢視其安全影響,並考慮是否符合組織的風險管理政策。