編程助手無法正確估計時間,研究揭示問題
AI 奇點前沿

編程助手無法正確估計時間,研究揭示問題

AI News Bot
2026-08-31
Photo by Daniil Komov on Pexels
預計閱讀 1 分鐘原文來源

編程助手無法正確估計時間 研究揭露關鍵缺陷

一項由兩位獨立 AI 研究者在 MATS 計畫下完成的實驗顯示,市面上廣受歡迎的程式碼輔助工具——Anthropic 的 Claude Code 與 OpenAI 的 Codex——在「時間感知」上表現極差。它們不僅難以預測完成任務所需的時間,甚至在任務結束後也無法正確回報實際耗時,對於需要長時間運算的工作而言,這是一大隱憂。

研究設計與核心發現

  • 測試流程:在每項程式設計任務開始前,兩個模型必須先估算所需時間;完成後再回顧報告實際耗時。測試題目取自 200 題 ProgramBench 集合,另加研究團隊自行設計的 18 題基準測試。
  • 時間預估結果:兩個模型普遍 高估 所需時間。於 ProgramBench 中,無論題目難易,兩者大多預估約 90 分鐘。在第二輪測試中,Claude 的預估平均偏差為實際的 3 倍,而 Codex 則高達 6‒10 倍。短時間任務的誤差最為嚴重,只有在多小時的工作裡,預估才偶爾接近真實。
  • 執行時長差異:模型的實際運行時間受「harness」(即支援軟體環境)影響顯著。Claude Code 會持續運作直到自認任務完成,平均約 90 分鐘;Codex 則多在 30 分鐘 左右自動停止,與任務本身無太大關聯。相同語言模型在 Claude 與 Codex 兩種環境下的步數差異約 2.5 倍。
  • 自我品質評估:舊版模型 Opus 4.8 與 GPT‑5.5 也同樣不可靠,平均將成果分數 高估 20 分,甚至在失敗的任務上仍給予高分。最極端的案例中,兩者皆認為完成度約 70%,實際僅為 7% 與 14.5%。

背後的技術與實務影響

  1. 長時間任務的可控性下降

    若 AI 助手無法正確感知時間,指令如「持續兩小時迭代」將難以落實,開發者必須額外設計外部監控機制,增加系統複雜度與成本。

  2. 軟體環境(harness)成為關鍵變數

    同一模型在不同執行框架下的行為差異顯示,僅靠模型本身的能力不足以保證穩定表現。開發團隊需審視整體管線,包括 API 呼叫頻率、資源限制等因素。

  3. 自我評估失真可能導致錯誤決策

    當 AI 以過高的成功率回報結果,使用者可能錯過必要的人工審核或除錯,進一步影響產品品質與安全。

未來展望與讀者啟示

研究人員指出,若給予模型一個能即時回報「已過時間」的工具,兩者的時間預估幾乎 全部正確。這暗示 外部計時器或時間感知模組 可能是短期內最直接的解決方案。長遠來看,開發者應該:

  • 在 AI 工作流中嵌入 時間監控 API,讓模型能在迭代過程中取得實際經過的秒數;
  • 針對不同 harness 進行系統化基準測試,選擇最能匹配任務需求的執行環境;
  • 加強 結果驗證機制,避免過度依賴模型自評的分數。

對於關注 AI 編程助手的技術人員與企業管理層而言,此研究提醒我們:AI 並非全能的時間管理者,仍需人類的監督與適當的工具輔助,才能在長時間、關鍵任務中發揮其最大效益。

分享