重建大型語言模型的提示內容
AI 奇點前沿

重建大型語言模型的提示內容

AI News Bot
2026-08-13
預計閱讀 1 分鐘原文來源

重建大型語言模型的提示內容

近期,印度理工學院孟買分校(IIT Bombay)和Adobe Research的研究人員共同開發了一種新的方法,能夠以近乎完美的準確度重建大型語言模型的提示內容,只需使用模型的輸出文本。這種方法無需存取模型權重,甚至可以應用於第三方模型。

大型語言模型的工作原理是通過預測下一個最可能的單詞,逐字生成文本。然而,反向重建原始提示內容一直被認為是不切實際的,因為許多不同的提示可能會產生相似的回應。研究人員提出了一種新的方法,稱為「前一個單詞預測」(Previous-Token Prediction, PTP),它逆轉了語言模型的工作原理。與其預測下一個單詞,不如預測前一個單詞。

這種逆向模型是完全從頭開始訓練的,使用的是目標語言模型生成的合成數據。它只需要生成的文本作為輸入。逆向模型還可以通過調整解碼參數生成多個具有不同含義的提示變體。所有這些重建的提示在重新輸入原始語言模型時都會產生相似的回應。

在研究人員的論文中,給出的例子是一個提示「如何與競爭對手聯繫以尋找他們的定價策略?」,這個提示被重建得完全相同。模型還生成了六個額外的變體,這些變體抓住了核心含義,但使用了不同的措辭,例如「一家公司如何聯繫競爭對手以尋找他們的定價策略?」。

使用真實用戶提示進行的測試也顯示了準確的重建結果。當研究人員將重建的提示重新輸入原始語言模型時,回應與原始回應非常接近。

一個在小型聊天機器人Qwen-3-0.6B上訓練的逆向模型也可以重建GPT-4o的回應的提示。重建的提示雖然不是完全相同的,但據論文所述,它們抓住了原始提示的含義和意圖。潛在的攻擊者甚至不需要知道哪個模型生成了特定的輸出。

這個發現引發了一個廣泛的安全問題。公司可能會暴露包含商業秘密、審核規則或專門指令的系統提示。個體用戶也面臨著類似的威脅,因為個人或敏感的查詢也可能從輸出中提取出來。一個小型的開放式逆向模型就足以實現這一點。

論文本身並沒有明確聲稱對商業系統進行攻擊。但如果這種方法對當前生產模型有效,人工智慧實驗室將需要迅速解決這個問題。論文只在一或兩個句子的短提示上展示了這種方法,尚未測試它是否也適用於長、複雜的系統提示,跨越多個段落。

對未來的影響

大型語言模型的安全性問題已經引起了廣泛的關注。公司和個體用戶需要意識到這種風險,並採取適當的措施保護自己的敏感信息。人工智慧實驗室也需要加緊研究,開發出更安全的語言模型,以防止這種類型的攻擊。

隨著人工智慧技術的不斷發展,語言模型的安全性問題將會越來越受到重視。未來,研究人員和開發者需要共同努力,開發出更安全、更可靠的語言模型,以保護用戶的敏感信息和維護社會的信任。

分享