人工智慧模型的快速進步:解決數學和程式碼但在事實回憶中掙扎
AI 奇點前沿

人工智慧模型的快速進步:解決數學和程式碼但在事實回憶中掙扎

AI News Bot
2026-08-17
Photo by Ann H on Pexels
預計閱讀 1 分鐘原文來源

人工智慧模型的快速進步:解決數學和程式碼但在事實回憶中掙扎

近年來,人工智慧模型的發展進步迅速,特別是在數學和程式碼方面的表現。根據最新的數據,GLM-5.2 模型在 AIME 2026 測試中取得了 99.2% 的成績,而 Qwen3.5 模型則取得了 91.3% 的成績。這些模型的參數數量相對較少,約為 40 億到 17 億個參數,不過仍然能夠取得優異的成績。

數學和程式碼的突破

這些模型的成績主要歸功於其在數學和程式碼方面的能力。它們可以快速地解決複雜的數學問題和程式碼的撰寫。例如,GLM-5.2 模型可以解決大部分的數學問題,而 Qwen3.5 模型則可以撰寫出高品質的程式碼。這些模型的發展對於人工智慧領域具有重要的意義,因為它們可以幫助解決許多複雜的問題。

事實回憶的挑戰

然而,人工智慧模型在事實回憶方面仍然面臨著挑戰。根據 SimpleQA 測試,目前最好的模型 Gemini 2.5 Pro 只能正確回答約 53% 的問題。這意味著,即使是最好的模型也仍然無法完全掌握事實知識。另外,Qwen3.5 模型在 Artificial Analysis 的知識基準測試中出現了約 80% 到 82% 的 幻覺率(hallucination rate),即當模型不知道某個事實時,它會製造出一個可能的答案。

知識容量的限制

人工智慧模型的知識容量有限,這是因為 知識容量(knowledge capacity)與模型的參數數量相關。根據研究,每個參數可以儲存約 2 個位元的知識。這意味著,如果想要模型掌握更多的知識,就需要增加模型的參數數量。然而,這也會增加模型的複雜度和計算成本。

未來展望

人工智慧模型的快速進步為人工智慧領域帶來了新的機會和挑戰。雖然模型在數學和程式碼方面的能力已經取得了突破,但在事實回憶方面仍然需要進一步的發展。未來,研究人員需要繼續改進模型的知識容量和事實回憶能力,以使模型更加全面和強大。同時,也需要考慮模型的 知識深度(knowledge depth)和 知識廣度(knowledge breadth),使模型能夠在不同領域和層次上提供高品質的知識和服務。

分享