
Photo by Masud Allahverdizade on Pexels
預計閱讀 1 分鐘原文來源
Anthropic 推出 TASTE 基準 AI 安全研究判斷仍難突破
Anthropic 近期公布的 TASTE(The AI Safety Taste Evaluation) 基準,旨在測試大型語言模型(LLM)在「判斷 AI 安全研究提案優劣」上的能力。測試結果顯示,表現最佳的 Fable 5 只達到 60% 的一致率,遠低於具備實務經驗的研究者所得到的 77% 基準。其餘模型如 Opus 5、GPT‑5.6 Sol 等,表現更接近隨機猜測。
為何需要 TASTE?
AI 安全領域的研究往往牽涉未來系統風險、模型欺騙行為等無法直接驗證的議題。選錯研究方向不僅浪費時間,更可能耗盡資源。傳統的代理能力測試(如指令遵循、程式碼產生)無法衡量「問題重要性」或「方法可行性」等判斷層面。Anthropic 因此以 有經驗的 AI 安全研究者 的評分作為金標準,蒐集了 50 份提案,形成 92 組兩兩比較,並以「評分差距明顯」的結果估算出研究者間的平均一致率為 77%。
測試結果的意涵
- 模型仍偏好直接回答題目:即使評分指引明確要求不要過度看重「是否直接回應」的因素,模型在比較同一問題的不同提案時仍傾向選擇文字敘述較為直接的方案,顯示其判斷依賴表層語意而非深層價值評估。
- 前沿模型的局限:Fable 5 雖在其他通用代理測試中屬於領先,但在研究判斷這一高階任務上仍未展現相稱的實力,說明「產生創意」與「評估創意」是兩條不同的技術路徑。
- 統計不確定性:目前僅有 92 組比較,模型成績的誤差範圍約為正負 10 個百分點,尚不足以進行精確排名。
未來展望與讀者啟示
Anthropic 表示,TASTE 只是一個起點,未來需要 規模更大、題型更豐富 的測試,以全面捕捉 AI 在研究判斷上的能力缺口。對於產業與學術界而言,這提醒我們在推動 AI 安全自動化時,仍須保留 人類專家審核 的關鍵環節,避免過度依賴尚未成熟的模型判斷。隨著測試資料集的擴充與評估方法的精進,或許在不久的將來,我們能看到模型在「選對研究方向」上達到與資深研究者相當的水準,進一步提升 AI 安全研究的效率與可靠性。
分享