挑戰 AI 謎題:七項測試檢驗機器智慧
AI 與遊戲的關係
自 1959 年 IBM 科學家阿瑟·薩繆爾(Arthur Samuel)發表「機器學習」概念,並讓演算法學會玩西洋跳棋以來,謎題與棋類一直是測試人工智慧(AI)進步的核心舞台。象棋、圍棋(Go)等傳統棋盤遊戲,以及近年《紐約時報》推出的「Connections」連線題,都曾成為模型能力的試金石。
七項測試概覽
以下七項測試分別聚焦於 AI 與人類認知的不同切面,讓讀者一窺機器智慧的強項與盲點。
| 測試 | 重點 | 人類優勢 | |------|------|----------| | 1️⃣ 空間推理(心智旋轉) | 判斷同一物件在不同角度的投影 | 具備三維想像與旋轉能力 | | 2️⃣ 微調謎語 | 細微字句變化會使模型失誤 | 靈活的語境理解 | | 3️⃣ 視覺拼圖 | 複雜圖形的組合與拆解 | 高度的圖形辨識 | | 4️⃣ 記憶 Trivia | 大量事實回憶與快速檢索 | 概念串聯與推理 | | 5️⃣ 變體連線題 | 「Connections」題目細節變化 | 抽象關聯思考 | | 6️⃣ 多步推理 | 需要多層次邏輯的解題 | 系統化的步驟規劃 | | 7️⃣ 常識判斷 | 依賴日常生活常識的判斷 | 真實世界經驗 |
測試一:空間推理的挑戰
在 IQ 測驗中常見的「心智旋轉」題目,要求受測者判斷兩張圖是否為同一物體的不同視角。雖然現代大型語言模型(LLM)已能處理視覺輸入,但在此類三維旋轉任務上仍表現慘淡。即便模型聲稱具備「世界模型」——即對物理環境的內部模擬——實際上仍無法像建築師或機械工程師般自由操控 3D 物件。
測試二:記憶與 Trivia 的雙刃劍
LLM 受訓於海量文本,擁有驚人的事實記憶力,這使它在 trivia(問答競賽)上能輕易超過一般人。但正因如此,當謎題與模型訓練資料高度相似時,模型往往會「照本宣科」——直接回覆記憶中的答案,而忽略題目中微妙的差異。2024 年 Google 與伊利諾伊大學厄巴納‑香檳分校(University of Illinois Urbana‑Champaign)共同進行的研究就證實,模型在面對僅有細部變化的題目時,正是因為過度依賴記憶而失誤。
測試三:文字謎語的敏感度
文字謎語常以雙關、隱喻或語序變化設計。即便是最先進的模型,也會在這類微調題目上卡關。這顯示出 AI 在「語境靈活性」方面仍有顯著差距,與人類能即時捕捉語言細節的能力形成對比。
測試四:視覺拼圖的弱點
視覺拼圖要求將碎片重新組合成完整圖像,測試的是空間感與圖形辨識。實驗顯示,當拼圖的形狀或顏色稍作改動,模型的正確率會急劇下降,說明目前的視覺模型仍缺乏對「形狀概念」的深層理解。
測試五至七:連線題、推理與常識
《紐約時報》2024 年底的 Connections 題目,最先進的模型只能解出約 18% 的題目;到了 2025 年初,部分模型已能接近完美解答。然而,這種進步並非線性,仍受限於題目設計的微小變化。多步推理與常識判斷則測試模型在長程邏輯與日常經驗上的表現,結果顯示 AI 在需要跨領域聯想時仍易出錯。
未來展望
七項測試不僅是對 AI 能力的量化指標,更是指引研究者改進模型的指南。隨著「多模態」學習(同時處理文字、圖像、聲音)與「世界模型」的深化,我們有望看到機器在空間推理與視覺拼圖上的突破。同時,如何在保持龐大記憶庫的同時,提升模型的「語境靈活度」與「常識推理」能力,將是未來研究的關鍵。
結語
如果你在上述七項測試中能夠超過 AI,說明人類在抽象思考、靈活推理與真實世界感知上仍具優勢。這不僅是對機器智慧的挑戰,更提醒我們:AI 的進步永遠需要人類的洞察與指引。讓我們持續以謎題為鏡,觀測、思考、並共同塑造更具智慧的未來。
