人工智慧的隱藏思維:風險與突破
近期,電腦科學家發現了一種方法,可以提取前沿人工智慧模型在解決複雜問題時所進行的隱藏「思考」過程。這項發現提供了一些證據,雖然尚未有最終的證明,表明某些中國模型可能是通過「蒸餾」美國模型的推理信息而訓練的,因為這些模型的思考或推理模式相當相似。研究人員也展示了這種方法可以用來從模型的內部推理中恢復個人信息,例如密碼和 API 金鑰,儘管這個漏洞已經被修復。
風險與漏洞
根據德國圖賓根大學的電腦科學家 Alexander Panfilov 的說法,所有主要的前沿模型提供者都存在這個漏洞。這個漏洞可能導致個人信息洩露,並使得大規模的推理蒸餾攻擊成為可能。Panfilov 和他的同事從圖賓根大學、馬克斯·普朗克研究所、人工智慧安全研究所 MATS Research 和安全公司 Snyk 發現,來自 OpenAI、Anthropic 和 Google 的前沿模型都存在這個問題,尤其是當這些模型通過應用程式介面(API)存取時。
蒸餾技術的爭議
蒸餾是一種廣泛使用的技術,用于高效地複製現有模型的能力到新的模型中,特別是在開放權重或可下載模型的開發中。然而,近期這種技術已經成為了一個爭議話題,因為有人聲稱中國的人工智慧公司使用這種技術來複製美國最好的模型。例如,二月份,OpenAI 告訴美國國會,中國的 DeepSeek 似乎複製了一個其模型來建立一個名為 R1 的推理模型。六月份,Anthropic 告訴國會,阿里巴巴系統性地蒸餾了其模型來建立其自己的模型,稱為 Qwen。
未來展望
雖然沒有證據表明中國的人工智慧公司使用這種具體技術來蒸餾美國基礎的人工智慧模型,但是 Panfilov 和他的同事認為,使用他們的方法可以比以前認為的更容易地從封閉模型中蒸餾出更多的信息。這項發現對於人工智慧的安全性和知識產權保護具有重要的意義。隨著人工智慧技術的不斷發展,如何確保模型的安全性和保護知識產權將成為一個越來越重要的課題。同時,研究人員也需要繼續探索人工智慧的隱藏思維,揭示其背後的工作機制,從而更好地理解和控制這種強大的技術。
