
Cloudflare 將決策模型導入 Workers AI:Clef 與 Clef‑flash 正式上線
Cloudflare 於本月正式釋出自行訓練的決策模型 Clef 與 Clef‑flash,兩者已整合至 Workers AI 平台,並以 Apache 2.0 授權公開模型權重。相容 Jev 介面的程式介面讓既有使用者可快速遷移,同時提供 微調服務,讓客戶依特定工作需求自行調校模型。
背景與技術細節
-
決策模型 vs. 大型語言模型
大型語言模型(LLM)擅長生成文字、進行推理或操作工具;而決策模型則聚焦於「範圍明確」的判斷與分類。開發者先定義可接受的答案選項,模型在讀取輸入後直接回傳符合格式的答案與每個選項的機率,省去逐字生成的步驟。
-
模型架構
-
Clef 以 Qwen 3.8‑27B 為基礎,針對決策任務進行再訓練。
-
Clef‑flash 則採用較輕量的 Qwen 3.5‑9B,強調極速回應。
兩者皆支援文字與圖像輸入,且 上下文長度 可達 64 K,足以處理長篇文件或大量影像資訊。
-
-
推論機制
與傳統生成式 AI 必須一步步產出文字不同,Clef 系列先讀取全部輸入資料,然後直接計算預設答案的分數。此「一次性」推論方式使延遲大幅降低。根據 Cloudflare 公布的 43 項測試結果,Clef 的中位延遲為 209.3 ms,Clef‑flash 為 38.8 ms,相較之下 Jev 為 524.1 ms。
-
開放與微調
模型權重已同步上傳至 Hugging Face,開發者可自行部署。Cloudflare 另行提供 模型微調服務,由工程團隊協助客戶針對特定工作調整模型,未來將推出自助式平台,讓使用者自行準備資料、微調並重新部署。
產業影響與應用場景
以客服系統為例,當使用者訊息送達後,Clef 可即時判斷案件是否緊急、應交由業務、帳務或技術團隊處理,以及問題的嚴重程度。應用程式取得結果後即可自動分派工單、啟動後續流程,或在模型信心不足時交由人工介入。此類「即時分類」與「決策支援」的需求在金融、醫療、電商等領域同樣適用,能顯著降低人工成本與回應時間。
此外,Clef‑flash 的毫秒級延遲使其適合嵌入邊緣運算(Edge Computing)環境,配合 Cloudflare 全球分散的邊緣節點,可在使用者所在地即時完成決策,提升使用者體驗。
未來展望
Clef 系列的開放與微調策略為開發者提供了「可控」的 AI 方案,既保留了大型模型的語意理解能力,又避免了不必要的文字生成開銷。隨著自助式微調平台的上線,預計會有更多中小企業自行打造專屬決策模型,進一步推動 AI 在垂直產業的深耕。
對於關注 AI 成本效益與資料隱私的企業而言,Cloudflare 的這波布局提供了一條兼具速度、可定制性與開源透明度的路徑。未來,隨著模型效能持續提升與微調工具的成熟,決策模型有望在更多即時決策場景中取代傳統的 LLM 流程,成為 AI 代理(AI Agent)不可或缺的核心元件。