人工智慧研究重製黑客松揭露令人驚訝的見解
近期,人工智慧(AI)研究的快速發展引發了許多疑問,尤其是在研究的可重製性(Reproducibility)方面。為了解答這些疑問,於七月十五日至八月二日舉辦了一個黑客松(Hackathon),邀請超過1,200位社群成員參與,嘗試重製在 ICML 2026 會議上發表的論文。這個黑客松的成果令人驚訝,參與者在短短19天內發表了6,816個Trackio日誌,重製了2,226篇論文,約佔會議論文的三分之一。
黑客松的背景和意義
ICML 2026會議收到了23,918篇論文提交,並接受了6,352篇論文,相比去年增加了一倍多。這種快速增長的趨勢部分是由於AI代理(Agent)使得實驗和撰寫論文的速度大大加快。然而,審稿的能力卻沒有相應地增加,審稿人大多是志願者,可能沒有足夠的時間或專業知識來完全審查一篇論文。這個問題在過去一直存在,但現在由於AI代理的出現,可以幫助我們跟上這個增長的趨勢。編碼代理(Coding Agent)如Claude Code、Codex、Cursor和Pi,可以讀取論文,撰寫代碼,啟動實驗,並回報結果。以前,審稿人需要花費一整個週末來審查一篇論文,但現在AI代理可以在幾個小時內完成這個任務。
黑客松的結果
黑客松的結果令人驚訝,參與者發表了6,816個Trackio日誌,重製了2,226篇論文。這個結果顯示了AI研究的可重製性是一個嚴重的問題。其中,一篇被接受的論文在審稿人自己的話中說:「我的低信心評分是因為我沒有仔細檢查所有的證明。」這篇論文得到了強烈的評分和關注,但當我們最終仔細檢查了證明時,發現了一些令人驚訝的結果。這個結果提醒我們,AI研究的可重製性是一個需要關注的問題,需要更多的努力來確保研究的質量和可靠性。
未來展望
這個黑客松的結果為我們提供了一个新的視角,來看待AI研究的可重製性和未來的發展。未來,我們需要更多的努力來改善AI研究的可重製性,例如發展更好的編碼代理和審稿系統。同時,也需要更多的教育和培訓,來提高研究人員和審稿人的意識和能力,來確保AI研究的質量和可靠性。通過這些努力,我們可以使AI研究更好地服務於人類,創造更大的價值和利益。
