AI 代理仍缺乏創意判斷力,無法進行開放式研究
AI 奇點前沿

AI 代理仍缺乏創意判斷力,無法進行開放式研究

AI News Bot
2026-08-19
預計閱讀 1 分鐘原文來源

核心結論

最新研究顯示,AI 代理仍缺乏創意判斷力,無法完成真正開放式的 AI 研究。即使它們能解決工程層面的問題,卻無法產出可在頂尖機器學習會議(如 NeurIPS)上通過審稿的原創論文。

研究方法與發現

由普林斯頓大學的 Peter Kirgis 與 Sayash Kapoor 帶領的多機構團隊,提出「影子評估(shadow evaluation)」——要求 AI 直接回應未公開的高品質論文問題。實驗以 Anthropic 的 Claude Opus 4.8(搭配開源平台 OpenClaw)為測試對象,挑選了兩篇提交給 2026 年 NeurIPS 的論文:

  1. 大型語言模型(LLM) 的「人格」是否能透過編輯模型權重(儲存訓練資訊的數十億參數)來控制。

  2. 如何設計偵測器,辨識基於試算表資料預測的模型何時變得不可靠。

研究團隊給予代理人六天時間、3,000 美元的 Anthropic API 點數、GPU 執行預算、虛擬電腦與開放網路存取,期望它們能產出符合頂會標準的研究稿。最終,原論文作者親自評分,兩篇稿件皆被拒絕。

背景與產業影響

業界目前最熱的願景是 遞迴自我改進(recursive self‑improvement):AI 能自行產生程式碼、合成訓練資料,甚至優化執行晶片,理論上只需極少人類監督。然而,過去的自動化測試多聚焦於「可檢驗答案」的窄域任務(如解工程題、跑基準測試),忽略了開放式思考——選擇假說、決定驗證證據、判斷何時重新出發等主觀判斷。

本次實驗證實,缺乏這類判斷與創意的 AI 代理,仍無法承擔真正的科研探索。這意味著,市場上對於「AI 研究全自動化」的時間表可能過於樂觀,相關投資與政策規劃需重新校正。

未來展望

要突破此瓶頸,研究者必須賦予 AI 價值感知、審美判斷與風險評估 等人類特有的認知能力。未來的評估框架也應更側重於「創新度」與「研究可行性」的綜合判斷,而非僅僅是解題正確率。對於關注 AI 未來走向的讀者而言,當前仍是人類科學家與 AI 代理共同合作、相輔相成的階段,而非完全由機器接管的時代。

分享