預計閱讀 1 分鐘原文來源
AWS 強調生成式 AI 真實成本:超越每百萬代幣價格
在生成式 AI 產業中,企業習慣以「每百萬代幣多少美元」作為模型選擇的唯一指標。AWS 近日指出,這種 標價貼紙 並未反映實際營運成本,因為生產環境購買的不是代幣,而是 具體成果——例如解決一張客服工單、完成一份研究簡報,或產出正確的財務摘要。
AWS 以開源基準測試工具 openai‑on‑aws/benchmarks‑openai,對五款模型進行了可重現的比較:
- 於 Amazon Bedrock 上的三款新模型:gpt‑5.6‑luna、gpt‑5.6‑terra、gpt‑5.6‑sol(推理功能關閉)
- 兩款在 OpenAI API 上的低成本基線:gpt‑5.4‑mini、gpt‑5.4‑nano(使用預設設定)
測試同時涵蓋三個維度:
-
單次呼叫的正確率與成本(AIME 數學競賽、GPQA 鑽石級科學、MMLU‑Pro)
-
多輪代理任務:在即時網路搜尋情境下的回合數與代幣消耗
-
專業交付品質:以固定提示與 LLM 評審(gpt‑5.5)給予的等級評分
結果顯示,僅看每百萬代幣的價格會忽略兩個關鍵乘數:模型的正確率以及完成同一任務所需的代幣與回合數。即使 Bedrock 模型的標價較高,若其正確率顯著提升或回合數減少,最終 每項成果的實際花費 仍可能低於成本較低的 mini/nano 基線。
背景與影響
此研究提醒企業在規劃生成式 AI 工作負載時,必須以 結果導向 的成本模型取代傳統代幣計價。對於需要大量多輪對話或高精度輸出的應用(如客服自動化、科研輔助),選擇具備較高單次正確率的模型,即使單價較高,也能降低整體代幣消耗與運算時間,進而減少總體支出。
未來展望
AWS 建議使用者自行執行相同的基準測試,依自家工作負載調校模型與基礎建設。隨著模型推理功能的持續優化與成本結構的透明化,未來 以成果為單位的計費 可能成為雲端 AI 服務的主流,幫助企業在控制預算的同時,最大化 AI 帶來的商業價值。
分享
