
核心亮點
Meta 於本月正式推出 Muse Spark 1.3,這是自四月以來在短短五個月內的第四代模型。雖然在多項代理任務(agentic tasks)上取得顯著提升,仍與目前最高分模型保持一定差距;然而 低廉的使用成本 成為其最具競爭力的賣點。
背景與測試結果
Muse Spark 系列自 4 月首次亮相,7 月推出 1.1 版,8 月緊接 1.2 版,今次的 1.3 版分為 xhigh 與 max 兩個等級。xhigh 已開放使用,max 仍在安全測試階段,僅限合作夥伴預覽。
在 Intelligence Index(智慧指數)上,max 版取得 62 分、xhigh 版 61 分,較 8 月的 57 分與 7 月的 53 分均有明顯提升。指數的加權測試包括:
| 測試項目 | 加權比例 | 1.3 版表現 | |----------|----------|-----------| | GDPval‑AA v2(模擬 220 項專業任務) | 20% | 1,709(xhigh)/ 1,754(max) | | Terminal‑Bench 2.1(終端程式碼測試) | 16% | 85%(xhigh)/ 86%(max) | | τ³‑Bench Banking(工具操作模擬) | 14% | 47%(xhigh)/ 52%(max) |
其中 τ³‑Bench Banking 為唯一取得絕對領先的項目,max 版以 52 % 位居榜首;xhigh 版則與 Claude Fable 5.1(max) 及 GLM‑5.3‑Flash 齊名。
在 GPQA Diamond(高階科學問答)測試中,Muse Spark 從 90 %提升至 94 %,雖屬頂尖群組,仍稍遜於 Gemini 3.8 Flash(high) 的 95.3 %與 Grok 4.6(high) 的 94.9 %。
唯一下降的指標為 AA‑LCR(語言一致性)由 83 %降至 79 %,以及 AA‑Omniscience 的事實正確率下降約三個百分點,主要因模型在不確定時更傾向拒答。
價格與市場競爭
Muse Spark 1.3 的計價維持不變:輸入代幣每百萬 $1.25,輸出代幣每百萬 $4.25,單次指數任務成本 $0.55。以 59 分以上 的指數分數來看,沒有任何模型的價格低於此水平;同等指數的競爭對手價格介於 $0.94‑$1.23 之間。相較之下,1.2 版的成本為 $0.40,1.3 版略有上升,但仍遠低於市場主流大模型。
未來展望
Meta 尚未公布 max 版的最終價格,且已透露將推出更大規模模型與開放權重(open‑weights)版本。若能在保持低成本的同時持續縮小與領先模型的性能差距,Muse Spark 系列有望在企業應用與開發者社群中取得更大份額。對於關注成本效益的 AI 使用者而言,Muse Spark 1.3 已展現出「性能提升 + 價格友善」的雙重優勢,未來的功能擴充與安全測試結果值得持續關注。