
Photo by Google DeepMind on Pexels
預計閱讀 1 分鐘原文來源
AWS 開源 20 億參數 Strands Decider 2B:本機 CPU/GPU 快速決策模型
AWS 旗下的 Strands 團隊於 10 月 1 日正式開源 Strands Decider 2B,這是一款擁有 20 億參數的決策模型(Decision Model),可直接在本機 CPU 或 GPU 上執行,提供低於 150 毫秒的即時判斷。AWS 同時公布了模型權重、訓練資料與完整程式碼,讓開發者能在本地環境快速部署。
背景與技術特色
- 決策模型 vs 大型語言模型:傳統大型語言模型(LLM)以生成自由文字為主,推理能力強大但延遲較高;決策模型則拋棄文字生成,改以「pointer head」對預設選項進行評分,換取毫秒級回應與結構化輸出,並可回傳可信度分數。
- 模型來源:Decider 2B 以 Qwen3.5‑2B 為預訓練基礎,移除原本的 LM head(文字生成頭),改用專門評分選項的 pointer head。這是第二代架構;早期採用的 slot head 表現較差,現在已迭代至第 19 版。
- 效能指標:在 Nvidia RTX 3090 上的中位決策時間約 115 ms;在 Apple M3 MacBook 處理小型工作時約 153 ms,證明模型在一般開發者硬體上亦能保持即時性。
對 AI 代理人的實務影響
Strands Agents SDK(2025 年 5 月開源)已支援 Python 與 TypeScript,下載量突破 1400 萬次。Decider 2B 可嵌入代理人的工具呼叫流程,於執行前先檢查對話內容與預定工具是否適合。例如,使用者詢問天氣卻未提供地點時,Decider 會在代理人呼叫天氣 API 前判斷資訊不足,促使代理人先向使用者索取位置,而非盲目執行查詢,提升安全性與使用者體驗。
未來展望
隨著 AI 代理人 需求日增,大量簡單分類、工具選擇與政策判斷的工作不必每次都交給大型語言模型處理。Decider 2B 的開源與低延遲特性,為企業與開發者提供了在本機環境完成安全檢查與決策的可行方案。未來若結合更多領域的訓練資料,或與雲端服務結合形成混合推論模式,將進一步降低成本、提升可靠度,成為 AI 工作流中不可或缺的「判斷引擎」。
本文資料皆取自 AWS 官方公告與 GitHub 公開資源,未作任何捏造或推測。
分享