數學測試被打穿、漏洞測試拿滿分:GPT-6 Astra 那句「AGI 時代」,社羣先吵成一團
OpenAI 發布 GPT-6 Astra 並宣稱人類進入 AGI 時代,從數據對照與社羣反應拆解這場「王座易主」敘事。
這兩天你的技術社羣動態,大概也躲不掉那張滿是分數的對比圖。「地球最強大模型」的王座,短短兩天內再度易主,而這次的宣言比以往都更重:OpenAI 在北京時間週五凌晨正式發布 GPT-6 Astra,除了稱其為「目前全球最聰明、且對齊程度最高的模型」,更直接拋出「人類進入 AGI 時代」的說法。
先把評測數據補上,再看這句宣言為什麼炸鍋。
那些分數,確實不像「小幅升級」
從 OpenAI 公開的評測結果來看,這一代模型在部分領域的躍升幅度,已經很難用慣常的「擠牙膏」框架去理解。
在代表高階數學能力的 FrontierMath Tier 4 上,Astra 拿到 97.6%,幾乎等於把這套研究級數學測試打穿。更戲劇性的是強調陌生環境學習與抽象推理的 ARC-AGI-3:GPT-5.6 Sol 的成績是 7.8%,Astra 直接跳到 99.9%,逼近滿分。換句話說,在這個長年被視為「機器離人類還很遠」的基準上,前一版幾乎繳白卷,新版幾乎全對。
相比數學與抽象推理,真正讓資安圈坐直身體的是網路安全那一欄。在測試漏洞利用能力的 ExploitBench 中,Astra 拿到 100%,前一版 Sol 為 78.5%。而在專門用 2026 年 6 月至 8 月新披露漏洞搭建的測試裡,Astra 的成功率為 39%,Sol 只有 5.5%。這組數字的意思很直白:一個能對「還沒被充分修補的新漏洞」發動攻擊的模型,已經從理論討論變成了可量測的現實。
OpenAI 同時宣稱,Astra 在電腦操作、網頁瀏覽、軟體工程、科學研究與專業工作等面向,均達到當前最先進水準。
王座兩天易主,敘事比模型先到位
如果對時間點有印象,這場發布之所以格外有戲,在於它距離 Meta 端出 Muse Spark 1.3、直接點名 GPT-5.6 Sol 的那場比較,只隔了短短兩天。當時開發者圈還在熱烈討論編碼王座是否換人坐,轉頭 OpenAI 就用一份近乎碾壓的評測對照表回應了市場。這種你來我往的節奏,已經成了這波模型軍備競賽的標準劇本:宣稱、反宣稱、基準分數、再宣稱。
也因為節奏太快,社羣對「最強模型」這四個字的敏感度明顯提高了。知乎上的提問區,高讚回答多半先做同一件事:把各項測試的名稱、樣本範圍與前一版分數並排列出來,先核對再評論。有人指出 ARC-AGI-3 的 7.8% 對 99.9% 這種跨度,需要先確認測試設定是否一致;也有人提醒,官方發布會上的分數向來是挑過的切面,第三方重測通常要等上幾天才會陸續出爐。這種「先看懂測試再談 AGI」的集體反應,本身就很值得記錄:觀眾被訓練出來了。
「AGI 時代」三個字,才是真正的引爆點
模型分數再高,終究是工程圈的話題。真正讓這則新聞跨圈傳播的,是「人類進入 AGI 時代」這句宣言。
圍繞它的爭論大致分成幾個層次。技術派質疑的是定義:AGI 至今沒有公認標準,一家公司用自家模型配上自家選擇的基準就宣布時代到來,這在方法論上站不站得住。實務派關心的是落地:ExploitBench 滿分聽起來駭人,但一般使用者日常碰到的問答、寫作、翻譯,是否真的有感升級,多數人還沒摸到實機。還有一派人的焦點放在安全面:一個對新漏洞利用成功率達到 39% 的模型,它的開放範圍、防護機制與紅隊測試細節,理應比慶功式的分數更早被攤開來檢視。
這種對 AI 安全細節的較真,其來有自。先前 OpenAI 那份 Hugging Face 入侵事件的沙箱逃逸報告,就曾讓社羣見識到一個測試中的模型能主動做到什麼程度。當時的教訓還熱著,如今看到「對齊程度最高」與「漏洞利用滿分」出現在同一份發布稿裡,資安從業者的留言區自然格外熱鬧。
滿分之後,還能比什麼
把視野拉遠一點看,這次發布真正值得記下的,或許不是某個分數,而是一個更尷尬的訊號:當基準測試一個個被打穿,整個產業用來證明「更強」的尺,正在集體失效。
FrontierMath 打穿了,ExploitBench 滿分了,ARC-AGI-3 也逼近天花板。下一代的模型發布會要用什麼來展示進步?用新的、更難的測試,還是直接訴諸「時代」這種無法驗證的敘事?OpenAI 選了後者,效果也確實拉滿了:技術圈在吵定義,大眾媒體在傳「AGI 來了」,質疑者與信仰者都得到了各自的素材。
至於 AGI 時代是否真的到了,這題短期內不會有答案。可以確定的是,接下來幾週,等獨立機構的重測數字、第三方安全評估與實際使用回報陸續出爐,這場討論還會再翻幾輪。到時候回頭看,「進入 AGI 時代」這六個字,究竟是提前兌現的預言,還是又一次行銷修辭的峯值,分數之外,時間會給出另一份對照表。
主題