AI 購物助理在微小情境變化下偏好大幅波動
核心發現
賓夕法尼亞大學沃頓商學院的研究團隊發現,當搜尋情境僅有極細微的變化時,AI 購物助理的產品推薦會出現 大幅度的偏好波動。即使只改變一則外部資訊的呈現順序,或是將資訊一次性或逐步提供,模型的選擇結果都可能相差數十個百分點。
背景與實驗設計
研究人員選取六款目前市面上常見的語言模型(包括小型變種與最前緣的大型模型),讓它們在 ACES 模擬器(Agentic e‑Commerce Simulator)中扮演個人購物助理,從固定的健身手錶商品格中挑選一款。模型僅看到商品頁面的螢幕截圖,必要時可自行抓取外部推薦來源,再給出最終選擇。
1. 單一外部來源的衝擊
- Reddit 推薦 Garmin Forerunner 55
- Wirecutter(知名產品評測網站)推介 Fitbit Inspire 3
- Strategist 文章介紹 WHOOP 5.0
結果顯示,Wirecutter 的影響力最為顯著。Claude Opus 4.8 在加入 Wirecutter 文章後,選擇 Fitbit Inspire 3 的機率提升 90 個百分點;Gemini 3.5 Flash 則上升 99 個百分點。
2. 多來源組合的效應
即使同時提供兩至三則來源,模型仍傾向於 Wirecutter 的推薦,且來源數量增加反而使結果更不穩定。不同模型對於多來源的敏感度各異,並未出現「相互抵消」的平衡效應。
3. 資訊呈現順序的影響
在第三組實驗中,研究者把三則來源以不同順序同時送入模型。若決策過程真正穩定,結果應保持不變;然而事實並非如此。
- Gemini 3.1 Flash Lite 的選擇機率在不同順序間波動 2% 至 56%。
- Claude Haiku 4.5 則相對穩定,僅在 41%–42% 之間變化。
這證明 資訊呈現順序本身即是產品選擇的驅動因素。
4. 資訊傳遞方式的差異
GPT‑5.5 在一次性(bundled)傳遞三則來源時,選擇 Fitbit Inspire 3 的機率提升 53 個百分點;若改為逐一(sequential)傳遞,提升幅度僅 6 個百分點。說明模型對「一次性」與「逐步」資訊的感知差異極大。
5. 客觀優勢商品仍被忽視
研究者在第四組實驗中,將商品格改為一款明顯優於其他選項的智慧手錶(內建 Alexa、售價 29.99 美元、評分 5.0、430 則評論),其餘商品價格均在 359 美元以上。加入簡短的使用者記憶敘述(如「我熱愛登山!」)後,部分模型竟偏向較貴的商品。
- Claude Opus 4.8 的 Garmin Vivoactive 5 選擇率上升 75 個百分點。
- GPT‑5.5 上升 37 個百分點,Gemini 3.1 Flash Lite 上升 36 個百分點。
此現象顯示,即使存在客觀上「最佳」的商品,AI 助理仍可能因上下文暗示而做出非理性選擇。
影響與未來展望
這系列實驗揭露了當前 AI 購物助理在 情境依賴性 與 資訊呈現策略 上的脆弱性。對電商平台而言,若未對模型的偏好波動進行校正,可能會出現:
-
消費者信任危機:同一商品在不同訪問時得到截然不同的推薦,會削弱使用者對 AI 助理的信任。
-
不公平的曝光機會:某些品牌或媒體來源因順序或打包方式獲得過度曝光,影響市場競爭。
-
決策透明度需求:業者需向使用者說明模型如何整合外部資訊,避免「黑箱」決策。
未來的研究與實務應聚焦於:
- 穩定化提示工程(prompt engineering),確保模型在相同內容下產出一致結果。
- 多模態驗證機制,結合使用者行為與產品客觀指標,降低情境偏差。
- 法規與標準制定,針對 AI 推薦的資訊來源與呈現方式設立透明度要求。
總之,AI 購物助理的推薦能力已相當強大,但其 對微小情境變化的敏感度 仍是不可忽視的風險。業者與研究者必須共同打造更可預測、公平且透明的 AI 購物體驗,才能真正讓技術為消費者帶來價值。
