跳到主要內容

GPT-6 Astra 是 AGI 嗎?OpenAI 自評與獨立跑分落差(2026)

最後更新: ·
由星群構成數字 6 的 OpenAI GPT-6 Astra 官方發布圖

美國太平洋時間 2026 年 9 月 3 日(台北時間 9 月 4 日),OpenAI 在官網發布〈GPT-6 Astra: A new generation of intelligence〉,正式推出 GPT-6 Astra。但「推出」不等於同日全面開放:首波只提供少數組織,ChatGPT Plus、Pro、Business、Enterprise 與 API 存取採分階段 rollout。

熱度幾乎立刻爆開。截至台北時間 9 月 4 日 06:14,Hacker News 的模型發表討論送出約 3 小時 33 分後已達 983 分、703 則回覆;Axios 同日報導 OpenAI 共同創辦人 Greg Brockman 以「Welcome to the AGI era」形容這次發布。可是,最值得問的並不是這句話夠不夠震撼,而是公開證據到底量到了什麼。本文先還原 OpenAI 的核心主張,再對照獨立 benchmark,最後給出該怎麼驗收 GPT-6 Astra 的判斷框架。

OpenAI GPT-6 Astra 官方發布頁的瀏覽器畫面
OpenAI〈GPT-6 Astra: A new generation of intelligence〉原文頁面;點圖可開啟原文。圖/OpenAI

OpenAI 真正發表了什麼?

We’re introducing GPT‑6 Astra, the world’s most intelligent and aligned model.

中文:「我們推出 GPT‑6 Astra,這是全球最聰明、也最對齊的模型。」

OpenAI

這是整篇發布文的總論,也是需要最謹慎拆開的一句話。「最聰明」與「最對齊」都是 OpenAI 對自家模型的最高級宣稱,不是跨實驗室共同認證。官方發布文沒有正式宣布「已達 AGI」;Axios 報導則指出,OpenAI 總裁 Greg Brockman 在記者簡報中表示他個人相信 OpenAI 已達 AGI,同時把 Astra 是否符合各自定義留給使用者判斷,並以「Welcome to the AGI era」收尾。兩者放在一起會形成強烈行銷印象,證據標準卻不能跟著混在一起。

產品層面倒是很具體。官方 API 文件列出模型 ID gpt-6-astra、1,050,000 token 的 input 加 output context window,以及 128,000 token 最大輸出。Standard 的基礎價格是每百萬 input/output token 10/50 美元;但 input 超過 272K 時,整筆請求的 input 與 cache 費率變為 2 倍、output 變為 1.5 倍。這代表 API 可接受約百萬 token 的總上下文,不代表每個 ChatGPT 介面都立刻取得相同容量,也不等於整段上下文都有等品質的有效記憶

72.6% 與 100%:先看分母,再看標題

OpenAI 最強的產品訊號在 computer use。它自報 GPT-6 Astra 在 OSWorld 2.0 得到 72.6%,高於 GPT-5.6 Sol 的 65.7%,模擬執行時間則從每題約 75 分鐘降到 40 分鐘。問題是,72.6% 並非整套 benchmark 的嚴格完成率,而是 v2026.08.08 離線子集的 partial score;時間差也來自 OpenAI 的 latency simulation。最準確的讀法是:OpenAI 在自家研究/API harness 中觀察到明顯的電腦操作進步,而不是外部已重現 72.6% 的通用成功率。

資安方面的 100% 也有類似問題。OpenAI 自報 Astra 在關閉 production safeguards 的 ExploitBench 評測中得到 100% Cap Percent;每個漏洞可嘗試五次,只要其中一次達到任意程式碼執行,就能取得該題完整 capability credit。System Card 另註明,Astra 使用了稍微更新的計分方式與內部執行基礎設施,整體分數會因此略升;OpenAI 也提醒歷史漏洞可能帶來資料污染。因此這份 100% 目前只能寫成 OpenAI 自評,不能從發布頁還原逐題成功率,更不能和舊版結果當成只改模型的乾淨 A/B。這是很強的能力警報,卻不是單次 exploit 成功率。Astra 的 Critical 定級、零日漏洞與受控存取細節,AlphaLab 已在〈OpenAI Astra 自評 Critical〉完整拆解,本文不重複資安篇的證據鏈。

獨立跑分說的是:升級很真,但不是全面代差

Artificial Analysis 比較 GPT-6 Astra 與其他模型的 Intelligence Index 和 Coding Agent Index 長條圖
Artificial Analysis 的兩張總榜呈現不同故事:Astra 在 Intelligence Index 為 61,在 Coding Agent Index 為 67。圖/Artificial Analysis

Artificial Analysis(AA)的 Intelligence Index v4.1.1 給 GPT-6 Astra 與 GPT-5.6 Sol 的公開整數分數都是 61,低於 Claude Fable 5.1 的 66 分;OpenAI 引用的同一評測表則列為 61.2 對 60.9。這表示 Astra 並非毫無進步,但也不足以支撐「所有智力面向都換代」的敘事。還要注意,Fable 5.1 的 66 分是「max with default fallback」,約 4% output token 因安全過濾被 Anthropic 路由到 Claude Opus 4.8 或 Opus 5,並非純 Fable 5.1 成績。

換到 Coding Agent Index v1.4,Astra(max/Codex)為 67,Sol(max/Codex)為 65,Fable 5.1(max/Claude Code)為 70。這個指數把 DeepSWE、Terminal-Bench v2.1 與 SWE-Atlas-QnA 共 326 題、每題三次嘗試彙總成 pass@1;跨 agent harness 的名次是系統級比較,不是純模型權重比較。AA 估計,在 max effort 的 Codex harness 中,Astra 使用的 token 約為 Sol 的三分之一,每題成本卻大致相同;相反地,在 Intelligence Index,它雖少用約 10% output token,2.5 倍 token 單價仍讓每題成本比 Sol 高約 75%。同一個模型,在「寫程式的工作效率」與「綜合智力的價格效率」上,可以同時是進步與退步。

細項也不是單向上升。AA 觀察到 Humanity’s Last Exam 與 AA-Briefcase 改善,GDPval-AA v2 約倒退 80 Elo,τ³-Banking、SciCode、AA-LCR 也各退 2 至 3 分。這不表示 GPT-6 Astra 變弱,而是說「整體平均分」會掩蓋能力曲線:你的任務剛好落在哪一段,比模型世代名稱更重要。

99.9% 為何同時也可以是 62.7%?

ARC Prize 圖表顯示 GPT-6 Astra 在標準 harness 與 Provider Adapter harness 的 ARC-AGI-3 分數差距
ARC Prize 兩種 harness 的最佳觀察值是 62.7%(Standard/max)與 99.9%(Provider Adapter/high);固定 max effort 時則是 62.7% 與 98.6%。圖/ARC Prize

最能說明「分數屬於整套系統」的,是 ARC Prize 的外部驗證。Standard harness 在 max effort 的 Semi-Private 成績為 62.7%(成本 26,098 美元);Provider Adapter 的最佳觀察值則是 high effort 的 99.9%(18,817 美元)。因為這兩個榜首值連 reasoning effort 也不同,不能把 37.2 個百分點全歸因於 harness;若固定在 max effort,較乾淨的比較是 62.7% 對 98.6%(17,332 美元)。前者測同一個最小、供應商中立介面,後者測加入供應商專屬上下文管理後的系統表現。

Saturating the benchmark would not represent “proof of achieving AGI.”

中文:「把這項 benchmark 做到飽和,並不代表『已證明達成 AGI』。」

ARC Prize

ARC Prize 同時肯定 Astra 是 frontier capability 的明顯階躍,也拒絕把高分直接命名為 AGI。原因很簡單:ARC-AGI-3 雖測探索、建模、目標設定與規劃,仍是規則確定、目標封閉的環境;真實世界還包含模糊目標、不可逆後果、跨領域責任與持續變動。99.9% 顯示 Astra 在 Provider Adapter/high 的封閉 ARC-AGI-3 環境中幾乎飽和;它不能單獨證明 Astra 已取得人類可學會的一切技能,也不能外推到開放世界任務。

AGI 標籤遮住了真正重要的三件事

一、computer use 正從展示變成可計價的工作能力

GPT-6 Astra 最值得追蹤的不是單一總分,而是它能否更快、更少 token 地完成瀏覽器、終端機與專業軟體的多步驟流程。OpenAI 的 OSWorld 數據仍待外部重現,AA 也沒有重跑 OSWorld;它提供的是相鄰但不同的外部訊號:在 Coding Agent Index 的 coding/terminal 任務與 Codex harness 下,Astra 的 token 效率改善。這支持「agentic coding 效率上升」,還不能當成一般電腦操作成功率已獨立確認。

二、harness 已經成為模型能力的一部分

固定 max effort 後,ARC-AGI-3 仍從 62.7% 升到 98.6%;這個配對比較主要改變的是能否保留供應商設計的 opaque reasoning state,並用 compaction 管理長對話。未來比較模型,不能只寫型號;還要寫清楚工具、上下文保存、推理強度、重試次數、權限與安全層。離開這些條件,分數就失去可比性。

三、能力變強不會自動讓監控更容易

OpenAI 在同一篇發布文承認,要求模型刻意規避監控的測試中,Astra 的 written reasoning 比 Sol 更難監看;公司推測原因之一是它能用更少書面步驟解題。這項結果同樣是 OpenAI 的內部、刻意誘發規避監控的評測。它顯示 Astra 在這些條件下留下較少 written-reasoning token 時,僅讀取文字推理的監控會失去能見度;這提醒部署還要結合行為監控、權限限制與可停止機制。

我的判斷:這是強力 agentic 升級,不是 AGI 驗收書

我會把 GPT-6 Astra 定義為一次真實、顯著、但不均勻的 agentic 升級。computer use、coding agent、ARC-AGI-3 的 system-level 表現都足以讓使用者與競爭者重新評估工作流;AA 的綜合指數、成本曲線與細項回退,則否定了「所有面向都形成一代差距」的簡單故事。

  • 我同意:Astra 在長流程電腦操作與 coding agent 上有多個方向一致的進步訊號,不能只因 AGI 話術過熱就把能力提升一併否定。
  • 我不同意:把 99.9%、100% 或「全球最聰明」串成 AGI 已完成的證明。這些數字分屬不同 harness、分母與公開程度。
  • 我最在意:一般使用者拿到的 production configuration,能否在真實任務中維持成功率、成本、速度與可控性;首日的分階段 rollout 還無法回答這題。

拿到 GPT-6 Astra 後,這樣驗收才有意義

  1. 固定同一批真實任務:選 20 至 30 個你原本就要做的瀏覽器、程式或文件任務,同時跑 Astra 與現用模型,不臨時挑對某一方有利的題目。
  2. 同時記錄四個分母:一次完成率、人工接手時間、端到端成本,以及錯誤後能否自行恢復;不要只記成功案例或 token 單價。
  3. 把 harness 寫進結果:列出 reasoning effort、工具、權限、context 保存、重試次數與安全設定,否則你的 90% 無法和別人的 60% 比較。
  4. 一百萬 token 要實際抽查:把關鍵條件埋在長文件的不同位置,測引用是否正確、跨段約束是否保留,而不是只確認檔案能上傳。

截至台北時間 2026 年 9 月 4 日 06:30,官方文件仍把 GPT-6 Astra 描述為先向 Trusted Access 組織開放,API 與 Plus、Pro、Business、Enterprise 在未來數日陸續提供;文件出現 model ID 不等於一般帳戶當下已有權限。AlphaLab 沒有把網路上的 benchmark 改寫成「我們實測」。真正有價值的下一份證據,會是一般帳戶與 API 在相同任務、相同 harness 下的可重複結果。

接著閱讀

左右滑動查看更多推薦

等 Astra 出現在你的帳戶裡,先帶著同一批任務與同一張計分表去驗收;如果結果只在特定 harness 成立,那個 harness 就是產品的一部分,而不是可以省略的腳註。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。