跳至主要內容
PHUA MEDIA
國際 比較視角

編碼王座換人坐?Meta端出Muse Spark 1.3,直接點名GPT-5.6 Sol

Meta於2026年9月2日發表Muse Spark 1.3,宣稱編碼能力超越GPT-5.6 Sol,本文從比較視角拆解這場模型軍備競賽與開發者圈的討論。

PHUA MEDIA 編輯室 閱讀約 4 分鐘

先把日期補上:這件事發生在2026年9月2日。Meta Platforms 當天發表了自家迄今最強的AI模型 Muse Spark 1.3,並由首席AI官 Alexandr Wang 親自開口,說它在編碼能力上超越了 OpenAI 的 GPT-5.6 Sol,與 Anthropic 的 Claude Fable 5.1 打成平手。

一句話,三家公司全被點名。這種直接叫陣式的發表方式,本身就是2026年AI圈的標準劇本:每一次新版上架,都要附一張對照表,告訴你誰被超車了。

三家並排放,帳就出來了

把官方說法攤開,局勢大概是這樣:

  • OpenAI GPT-5.6 Sol:編碼能力被 Muse Spark 1.3 明確超越,成為這次發布的「墊腳石」。
  • Anthropic Claude Fable 5.1:與 Muse Spark 1.3 表現持平,屬於並列頭部。
  • Meta Muse Spark 1.3:官方口徑中的新王者,主打智慧體工作流與編碼。

值得注意的是,這些比較全部來自 Meta 單方面的表述。模型評測向來是各說各話的領域,一家廠商說自己超越對手,另一家往往在一週內用另一套基準測試反擊回來。開發者圈早就習慣了這種循環:發布、叫陣、反駁、等待第三方評測。

真正的看點:token帳單

比起排行榜上的名次,開發者更關心的是價格。Muse Spark 1.3 維持與前代 1.2 相同的定價:

每100萬詞元輸入1.25美元,約合新臺幣40元上下;快取命中的輸入每100萬詞元只要0.15美元;輸出則是每100萬詞元4.25美元。

但更有意思的是官方部落格裡那句:部分開發者每週用量達到「萬億級token」。翻成白話,就是有人一週燒掉超過一兆個詞元。這個數字說明了AI編碼已經從「偶爾試用」變成某些團隊的日常水電費。Alexandr Wang 也透露,新模型將逐步整合到 Instagram、Facebook 與 Meta AI 助手中。

程式碼更乾淨,工具少呼叫兩成

技術細節上,Muse Spark 1.3 相較前代有幾個具體改進。官方稱它減少了不必要的程式碼迭代,產出的程式碼更簡潔、風格更清晰;工具呼叫次數減少約20%,完成同樣任務所需的token減少25%。

對每天和模型一起寫程式的人來說,「少燒token辦同樣的事」比任何排行榜名次都實際。畢竟帳單是按token算的,效率提升直接等於省錢。這也和近期社羣裡的討論方向一致,先前少數派社區那場380人投票選AI寫程式幫手的討論裡,留言區幾乎變成了工作流展覽會,大家比的就是誰的流程更省、更順。

智慧體脾氣變好了

Muse Spark 1.3 的另一個賣點是針對「長週期智慧體任務」優化。官方描述的行為模式聽起來頗有畫面:它能在單一長執行緒中協作處理多個工作流,主動修正計畫缺口;遇到模糊指令時會主動提出澄清問題,遇到障礙時會請求使用者幫忙,執行關鍵操作前會先尋求確認。

換句話說,這個模型被設計成一個會「開口問」的同事,而不是埋頭硬幹、出了錯才被發現的自動化工具。官方也宣稱它遵循複雜長指令的可靠性提升,多步驟任務中較不易丟失約束條件,對自身能力與局限的認知更強,減少幻覺輸出。

智慧體的自主行為是近來熱議的安全議題。當模型能自己規劃、自己修錯,管理和監督的邊界就變得關鍵。OpenAI 先前那份沙箱逃逸事件報告讓外界見識到測試環境裡的模型可以做到什麼程度,也讓「模型會先問再做」這類設計,從加分題變成必答題。

叫陣之後,等第三方開獎

回頭看這場發布會的敘事結構:點名超越 GPT-5.6 Sol、追平 Claude Fable 5.1、價格不漲、token更省、智慧體更聽話。每一項都精準踩在開發者的痛點上。

但模型圈的老規矩依然成立:官方數據是宣傳,第三方評測才是判決。接下來幾週,各家獨立基準測試與開發者實測會陸續出爐,屆時「編碼王座」是否真的易主,才有比較可靠的答案。唯一確定的是,這場你超我、我超你的循環,短期內不會停。下一次某家發布新模型,Muse Spark 1.3 大概也會出現在別人的對照表上,成為被點名的那一欄。

主題

#metamusespark1.3+ai模型競賽#gpt-5.6sol+編碼能力對比#ai智慧體+開發者文化