預計閱讀 1 分鐘原文來源
探索大型語言模型內部的推理步驟
近期,韓國 KAIST 與 Naver AI Lab 的研究團隊針對大型語言模型(LLM)是否在內部表徵中保留推理步驟的痕跡展開實驗。研究核心在於驗證,模型在文字輸出時所呈現的「讀取資料、問題分解、公式回憶、演繹推理、計算」等不同階段,是否能在其神經層的向量表示中被清晰分離。
方法與主要發現
研究者先定義了八種常見的推理操作,涵蓋 抽取、分解、公式回憶、演繹、計算 等。接著,讓三款模型(Qwen2.5‑7B、Qwen3‑8B、Gemma‑4‑31B)解答數學題目,將完整解題過程切割成多段,並使用 GPT‑5 為每段標註對應的操作類別。
在此基礎上,團隊訓練分類器以辨識模型內部的向量表示是否能區分不同推理操作。結果顯示:
- 所有三款模型均能可靠分辨 各種推理步驟,且可分離程度在 中間層(mid‑layers)最為顯著。
- 只依賴詞彙本身的分類器表現較差,說明內部表徵攜帶的資訊超越了表層文字。
- 常見功能詞(如「a」、「is」、「the」)在早期層仍混雜,但在中後層會根據所屬的推理步驟產生不同的向量,證實同一詞在不同語境下的內部表示會改變。
- 若阻斷模型對前 30 個 token 的注意力,對應步驟的訊號會削弱,說明推理步驟是 在前文上下文的累積下形成,而非獨立產生。
- 即使模型最終解答錯誤,仍能從內部表徵辨識出當時執行的是「計算」或「公式回憶」等步驟,錯誤的計算步驟仍保持其「計算」的特徵。
此外,實驗在 Llama‑3‑8B 上亦得到相同結果,且 Qwen3‑8B 的分類器可成功遷移至 GPQA‑Diamond 與 MATH‑500 兩套測試集,顯示此現象具有一定的通用性。
影響與未來展望
此發現對 AI 安全與可解釋性 具有重要意涵。若模型的內部狀態能夠被即時辨識其所處的推理階段,未來或可開發出在生成過程中即時監控、捕捉錯誤的機制,或在特定步驟介入以引導模型走向正確答案。OpenAI 已將「思考鏈」視為少數可用的監督手段,而本研究證實,模型本身的向量表徵同樣蘊含可供監控的訊號。
然而,研究仍受限於數學任務與少數模型,是否能擴展至語言理解、程式生成等更廣泛的應用,仍需後續探索。未來工作可著重於:
-
在多樣化任務上驗證推理步驟的可分離性。
-
開發基於內部表徵的錯誤偵測與修正演算法。
-
探索如何利用這些訊號在生成過程中實施即時干預,提升模型的可靠性與安全性。
總結而言,這項研究首次以實證方式證明,大型語言模型的中間層確實保留了可辨識的推理步驟訊號,為未來打造更透明、可控的 AI 系統奠定了基礎。
分享
