跳至主要內容
PHUA MEDIA
生活 現象觀察

72小時換三次榜首:前端AI編程那一週,開發者的心情坐了三趟雲霄飛車

2026年9月第一週,Qwen登頂CodeArena、GPT-6 Astra發布、Fable 5.1入場,前端AI編程榜單在72小時內被改寫三次,本文以時間軸回顧這場三強混戰。

PHUA MEDIA 編輯室 閱讀約 6 分鐘

先把日期標清楚:這場連環改寫發生在2026年9月的第一週,源頭是掘金上一篇題為「一週之內,前端AI編程的格局被徹底改寫了三次」的文章,9月4日發出後在技術社羣裡被反覆轉發。嚴格來說它已經是上週的事,但這幾天工程師羣組裡的餘震還沒停,因為它濃縮的東西太多了:中國模型第一次站上前端編程榜首、OpenAI丟出一個被自家總裁稱為「AGI時代」的模型、Anthropic同週卡位。三件事各自都是頭條,擠在同一週,社羣的情緒曲線就變得非常立體。

先看這72小時發生了什麼

9月2日,阿裏Qwen3.8-Max更新,登上CodeArena前端編程榜第一。 這份聚焦前端能力的榜單上,新版Qwen3.8-Max(版本號0902)拿到1691分,以3分之差壓過Claude Opus 5的1688分,Kimi K3的1674分排在第三。3分聽起來不多,但榜單頂端的分差本來就是寸土必爭。更讓開發者議論的是價格:每百萬tokens綜合平均5美元,低於這個價的對手,榜上沒有幾個。模型總參數2.4萬億,支援100萬上下文,官方強調的是智慧體編程能力,也就是長週期、多步驟的真實任務。

9月3日,OpenAI發布GPT-6 Astra。 Astra在拉丁語裡是「星辰」的意思,發布前ChatGPT官方預告「星星幾乎排列好了」。OpenAI總裁Greg Brockman的配文更直接:「歡迎進入AGI時代。」數據面確實嚇人:ARC-AGI-3拿到99.9%,而上一代GPT-5.6 Sol只有7.8%;FrontierMath Tier 4拿下97.6%;OSWorld 2.0得分72.6%,完成任務的平均時間從約75分鐘縮到40分鐘。

同一週,Anthropic的Fable 5.1入場。 官方說法是前端能力超越Kimi,正好把三家湊成一桌。

前端為什麼總是AI的死穴

要理解開發者為什麼對「前端編程榜」這麼在意,得先知道一個圈內共識:大模型寫後端邏輯早就很穩,一碰UI就露餡。CSS腫成一團、配色慘烈、生成三個按鈕能排出三種人生觀,這類吐槽在技術社羣流傳已久。前端難的地方在於它考的不只是代碼正確,還有視覺語言、空間關係、頁面層級,這些東西沒有標準答案,卻一眼就能看出好壞。

所以CodeArena這種聚焦前端能力的榜單,在某種意義上是各家模型的「顏值考場」。Qwen登頂之所以引發中文社羣的集體興奮,正是因為這是中國模型第一次在這個考場拿到第一。掘金原文的用詞是「花落中國模型」,留言區裡有人貼出Qwen生成的頁面截圖對比舊版,也有人冷靜提醒3分差距在誤差範圍邊緣,榜首易主隨時可能再發生。

Astra讓前端圈震動的,是「交卷前先檢查」

Astra那場發布裡,最打動前端工程師的並非數學分數,而是一個細節:模型在吐出代碼之前,會先在自己內部把頁面渲染一遍,發現錯位就自己改。用原文的話說,「它交卷之前,已經偷偷檢查過好幾遍了」。

泄露的演示裡,Astra零樣本生成了一個帶物理引擎與導航功能的互動式3D遊戲世界,開發者Chetaslua的配文只有一句:「前端已被攻克。」這句話隨後在各種轉發中被引用、被質疑、被改成梗圖。有人認為確實如此,也有人翻出歷史上每一次「前端已死」的預言,指出工程師的工作從來就是跟著工具一起搬家,而不是被工具終結。這種「工具一進步,身份焦慮就發作一次」的循環,其實和我們先前觀察過的同一個問題丟給五個AI交叉比對現象是同一個心理結構:開發者面對新模型的第一反應,永遠是先拿它照一照自己。

三家同框,比的不只是分數

把三件事並排放著看,各有各的打法。

Qwen的路數是榜單加性價比。登頂之外,5美元的價格直接把所有更貴的對手逼到牆角,對預算敏感的團隊來說,這比3分的領先更有說服力。

Astra的路數是敘事。從「星辰」的命名、發布前的星象預告,到總裁口中的AGI時代,OpenAI這次的包裝明顯衝著「歷史時刻」而去。任務展示也選得聰明:填報稅表、更新客戶管理系統、搭網站、建3D遊戲、跑前端測試,全是普通人聽得懂、又正好戳中白領日常的場景。

Fable 5.1的路數則是卡位。沒有搶在同一天發布,但卡在同一週,主打前端能力,目標明確。原文裡那個流傳很廣的對比畫面是:同一道「畫一張女子自畫像SVG」的題目,左邊Astra、右邊Fable,兩家隔空比劃,社羣自己當評審。

這種「同一道題丟給多個模型」的圍觀方式,已經成了技術社羣的固定節目。誰強誰弱,官方說了不算,羣友截圖說了才算。

一週三次改寫之後,留下了什麼

熱鬧過後,社羣裡比較有沉澱價值的討論大概有兩條線。

一條是節奏問題。榜單榜首在72小時內換手、又被新發布蓋過,這種更新速度意味著「選哪個模型」正在從一個決策變成一個習慣動作。有開發者在討論串裡說,現在選模型跟點外賣差不多,本週用誰取決於誰剛更新。這對工具鏈的影響是實在的:模型切換成本越低,綁定單一廠商的理由就越少。這也讓人想到先前校招圈那篇瘋傳的美團筆試AI輔助做題攻略,它走的正是同一個方向:與其糾結用哪個模型,不如把「跟AI協作」本身整理成固定流程。

另一條線是焦慮問題。「前端已被攻克」這句話能不能當真,每個人的答案取決於他自己每天在寫什麼。寫重複性頁面的人感受最直接,做複雜互動與設計決策的人則普遍覺得工具變好了、但離取代還遠。兩種感受都真實,爭論大概也不會有結論,只會等下一次發布會再重演一遍。

可以確定的是,9月第一週那三次改寫,短期內不會是最後三次。榜單還會再換手,「已攻克」和「還早得很」的拉扯也還會繼續。對圍觀的開發者來說,比較健康的姿勢或許是把每次發布都當成一次免費的能力體檢:模型會做的事變多了,那就看看自己手邊那份工作,哪些部分正在變便宜,哪些部分正在變值錢。這個問題,比誰在榜上第一,更值得每週都想一遍。

主題

#qwen3.8-max+ai編程榜單現象#gpt-6astra+前端能力突破#codearena+開發者社羣話題