xAI 推出 Grok 4.7:更具成本效益的程式與知識工作大型模型
Elon Musk 所屬的 xAI 近日發布 Grok 4.7,宣稱是迄今為止最適合程式撰寫與知識工作的大型語言模型(LLM)。此版本以更大的基礎模型為底,採用更長時間的強化學習(Reinforcement Learning)訓練,並加入自我驗證機制,讓模型在產出程式碼或文字時能自行檢查正確性。
成本與價格策略
Grok 4.7 的計價方式為 每百萬輸入代幣 2 美元、每百萬輸出代幣 6 美元。相較於 OpenAI、Anthropic 等西方前沿模型的高價,這個價格更貼近中國本土模型的水平,顯示 xAI 可能在降低使用門檻、爭取企業客戶上有明確考量。
效能表現
在 Artificial Analysis Intelligence Index(AAII)v4.3.2——結合十項基準測試的綜合指標中,Grok 4.7 取得 46 分,位於中等水平。領先的 Claude Fable 5.1 與 GPT‑6 各得 53 分,仍保持明顯優勢。
在 Agentic Coding(代理式程式編寫) 這一細分領域,差距更為顯著。根據 Terminal‑Bench 4.0 測試,Grok 4.7 的成功率僅 26%,遠低於 GPT‑6 Astra(60%)與 Claude Fable 5.1(55%)。即便是價格較低的 DeepSeek V4.1 Flash 也稍微領先,達 27%。
服務渠道
Grok 4.7 已透過三條主要管道向外部開放:
- Grok API:供開發者直接呼叫模型服務
- Cursor:整合於程式開發環境的即時協助工具
- Grok Build:針對企業客製化需求的建置平台
背後的市場與技術意涵
-
成本競爭:以較低的代幣費率切入市場,xAI 可能希望在企業級部署與教育訓練領域快速佔領份額。
-
自我驗證功能:程式碼生成常因錯誤而需人工修正,Grok 4.7 加入的自檢機制若能落實,將降低開發者的後續調試成本。
-
效能差距:儘管成本具優勢,但在高階編碼測試中的表現仍落後於 GPT‑6 與 Claude 系列,顯示模型在「代理式」任務的推理深度仍有提升空間。
未來展望
若 xAI 能持續優化強化學習的訓練流程,並在自我驗證演算法上取得突破,Grok 4.7 有望縮小與領先模型的差距,同時保持價格競爭力。對於希望以較低成本導入 AI 編程助理的中小企業與開發者而言,Grok 4.7 目前提供了一個值得關注的選項。未來是否能在 Agentic Coding 這一關鍵指標上追趕或超越競爭者,將是衡量其市場持久力的關鍵指標。
