AWS 評測 12 款頂尖 AI 模型的漏洞判斷 – 無模型同時達標 10% 以下誤報與漏報
網路安全

AWS 評測 12 款頂尖 AI 模型的漏洞判斷 – 無模型同時達標 10% 以下誤報與漏報

AI News Bot
2026-09-17
Photo by Ann H on Pexels
預計閱讀 1 分鐘原文來源

AWS 評測 12 款頂尖 AI 模型的漏洞判斷 – 無模型同時達標 10% 以下誤報與漏報

AWS 近期公布 Deception Benchmark,針對 5 家業者共 12 種通用 AI 模型進行漏洞判斷測試。測試結果顯示,儘管這些模型在找出真實漏洞方面表現不錯,但在 誤報率(FPR) 與 漏報率(FNR) 同時低於 10% 的門檻上,仍無一款模型能夠同時達標。

測試方法與主要發現

  • 提示方式:測試分為「直接判斷」與「Proof‑of‑Exploit(PoE)」兩種。

    • 直接判斷:模型僅需辨識程式碼中是否存在漏洞特徵。最高可找出約 95% 的真實漏洞,然而會把 41% 至 99% 的安全程式碼誤判為有漏洞,誤報率極高。

    • PoE:模型必須提供可利用的證據(如利用程式碼或攻擊路徑),可將誤報率降低 17 至 74 個百分點,但同時會遺漏 7% 至 44% 的真正漏洞,漏報率亦不容忽視。

  • 整體準確率:在所有測試組態中,Claude Opus 5 以 PoE 方式取得最高準確率 79.3%(誤報率 24.9%、漏報率 16.8%)。緊隨其後的是 GPT‑5.4,PoE 準確率 77.7%(誤報率 10.1%、漏報率 33.6%)。

  • 門檻未達:圖中綠色區域代表 FPR 與 FNR 同時低於 10% 的安全範圍,測試結果顯示 無任何模型組態落入此區,意味著目前的通用 AI 仍不足以直接取代資安人員的漏洞判斷。

背景意涵與產業影響

AI 在資安領域的應用近年快速擴散,許多企業期望透過自動化工具提升漏洞掃描效率。此次 AWS 的測試提醒業界,「找出漏洞」與「判斷漏洞是否可被實際利用」是兩個截然不同的挑戰。直接判斷雖能快速標示潛在問題,但高誤報率會增加資安團隊的噪音負擔;而 PoE 雖降低誤報,卻可能錯過部分可被利用的弱點,導致防禦盲點。

此外,測試僅涵蓋 單輪提示的通用模型,未納入多步驟驗證、威脅情報整合或專用掃描工具的情境。未來若將 AI 與傳統漏洞掃描、行為分析等技術結合,或許能在降低誤報與漏報之間取得更佳平衡。

未來展望與讀者啟示

  1. 多層防禦仍是關鍵:企業在導入 AI 輔助的漏洞判斷時,應將其視為「輔助資訊」而非唯一依據,並配合人工審核與傳統掃描工具。

  2. 模型訓練方向:供應商需加強「可利用性證明」的訓練資料,提升 PoE 模式下的召回率(Recall),同時降低誤報。

  3. 持續監測與更新:AI 模型的效能會隨新興漏洞與攻擊手法變化而衰退,定期重新評估與微調模型參數是必要的維護工作。

資安從業人員若想掌握最新的 AI 與漏洞判斷動態,建議訂閱 資安日報、資安週報 的免費電子報,獲取每日或每週的精選要聞,讓資訊安全決策更具前瞻性。

分享