SWE-Serve 揭露 AI 程式碼代理補丁缺口:實時服務測試通過率降至 46%
AI 奇點前沿

SWE-Serve 揭露 AI 程式碼代理補丁缺口:實時服務測試通過率降至 46%

AI News Bot
2026-09-25
Photo by Daniil Komov on Pexels
預計閱讀 1 分鐘原文來源

SWE‑Serve 揭露 AI 程式碼代理的服務缺口

SWE‑Serve 近期發表的測試結果顯示,AI 程式碼代理在「貼上」(patch)程式碼後,雖然能通過單元測試,卻在實際啟動模型服務時頻頻失敗。具體而言,19 項包含即時服務檢查的任務中,若不計入這些檢查,補丁的通過率為 69.4%;加入完整驗證後,通過率跌至 45.9%,約有三分之一的補丁在真實伺服器上會失效。

背景與測試設計

傳統的倉庫層級基準(benchmark)多聚焦於一般軟體工程任務,而推論(inference)基準則常只測試 kernel 產生或效能優化。SWE‑Serve 則突破此限制,針對 SGLang——一個開源的大型語言模型(LLM)服務框架——的 53 個實作任務,完整檢驗從模型啟用、解碼、快取、排程、服務 API 到執行時效能的全流程。

測試流程如下:

  1. 從 83 個已合併的 SGLang Pull Request(PR)中抽取變更,轉化為 53 個可執行任務,涵蓋六大推論工程領域。

  2. 每項任務提供指令與變更前的容器化 SGLang 程式碼,AI 代理必須產出符合 隱藏驗證器(hidden verifier)的補丁。

  3. 驗證器會在宣告的硬體(12 項 CPU、41 項單卡 NVIDIA H100)上執行,檢查新行為測試(約 7 項)與回歸測試(約 10 項)。

  4. 其中 19 項任務會啟動實際伺服器,另有 3 項任務在 H100 上設置校準的效能門檻。

值得注意的是,中位數參考解決方案 會修改 553 行 程式碼,跨 七個檔案;而最具挑戰性的任務之一,是讓代理在單卡 H100 上同時支援 dense(稠密)與 MoE(Mixture‑of‑Experts) 版的 Qwen3.5 模型,涵蓋模型註冊、權重載入、影像/影片輸入、OpenAI 相容請求、批次產生、機率輸出與 MoE 路由等多項功能。

影響與未來展望

測試結果顯示,僅靠單元測試或靜態分析,難以捕捉服務化階段的隱蔽錯誤。對於依賴 AI 代理自動化程式碼修改的開發團隊而言,完整的服務路徑驗證 成為不可或缺的品質保證。

未來,SWE‑Serve 計畫:

  • 擴展至多 GPU、跨節點(multi‑node)服務環境,以模擬更大規模的生產部署。
  • 引入其他推論引擎(如 TensorRT、vLLM)作為測試平台,提升跨框架的通用性。
  • 與更多開源專案合作,持續蒐集具挑戰性的 PR,豐富測試題庫。

對讀者而言,這份報告提醒我們:在 AI 生成程式碼的浪潮中,「測試即服務」 必須成為開發流程的核心,唯有如此才能在快速迭代的同時,維持系統的可靠與安全。

分享