跳到主要內容

Fable 5.1 vs GPT-6 Astra:兩張 AI 榜單為何不能直接比?(2026)

最後更新: ·
Fable 5.1 vs GPT-6 Astra 評測比較,Artificial Analysis v4.3 同分但強項不同

2026 年 9 月 7 日,Artificial Analysis 在官網發布〈Announcing the Artificial Analysis Intelligence Index v4.3〉;這讓 Fable 5.1 vs GPT-6 Astra 看起來像一場 53 比 53 的平手。相隔兩天,Agent Arena 的 9 月 5 日快照又把 Claude Fable 5.1(Max)的點估計放在榜首。把兩張榜排在一起很吸睛,但真正值得理解的是:它們測的不是同一場比賽,連「分數」的單位也不同。

下面先忠實還原 AA v4.3,再用 Agent Arena 的公開方法與快照交叉檢查樣本、設定、信賴區間與成本,最後把榜單轉成一套能落地的模型選擇方法。

Artificial Analysis Intelligence Index v4.3 原文首頁畫面
Artificial Analysis 於 2026 年 9 月 7 日發布 v4.3;點圖可開啟原文。圖/Artificial Analysis

Fable 5.1 vs GPT-6 Astra:53 對 53 到底算了什麼?

Both Claude Fable 5.1 (max with fallback) and GPT-6 Astra (max) score 53 […]

中文:Claude Fable 5.1(max、含 fallback)與 GPT-6 Astra(max)的分數都顯示為 53。

Artificial Analysis,Intelligence Index v4.3

這句話是真的,但只能讀到它字面上的精度。AA 的即時 v4.3 總榜把 Fable 5.1 max(含 default fallback)、Fable 5.1 xhigh(含 default fallback)與 Astra max 都顯示為 53;因此更精確的說法是:兩個模型家族、三種配置在整數顯示值上並列。在 2026 年 9 月 8 日查核到的方法頁中,AA 公開的是整體方法級的不確定性估計,並未為這三種配置列出可用來判斷彼此差異的逐模型綜合分數信賴區間與配對檢定。結論應停在「顯示同分」,而不是「精確相等」或「統計平手」。

Artificial Analysis v4.3 模型綜合指數圖,Fable 5.1 max 與 GPT-6 Astra max 都顯示 53
v4.3 的整數顯示值把 Fable 5.1 max(含 fallback)與 Astra max 都列為 53;這不是 53% 正確率。圖/Artificial Analysis;原文發布 2026-09-07,畫面擷取 2026-09-08

Intelligence Index v4.3 不是一份單項考卷,而是十項 eval 的加權合成:Agents 30%、Coding 20%、General 30%、Scientific Reasoning 20%;其中 45% 權重使用私有題目或答案。AA 的方法文件也列出各 eval 各自的題數、評分方式、工具使用與執行次數;這些設定並不一致。最後的 53 是不同量尺正規化後的指數點數,不是模型完成 53% 任務。

v4.3 的核心更新也在這裡:AA 把 Terminal-Bench v2.1 升到 v4.0,以 AutomationBench-AA 取代 τ³-Banking,並把使用私有題目或答案的權重由 40% 提高到 45%;四大類的 30/20/30/20 權重則維持不變。AA 把這次改版定位成 Intelligence Index v5 rollout 的延續。也就是說,v4.3 不只增加新模型,連題集與 harness 都換了;跨版本的分數不能當成同一把尺上的進退。

同分,能力輪廓卻不同

AA 自己的拆分結果沒有畫出「一樣強」:Fable 在 AA-Briefcase 與 SciCode 較高;Astra 則在 Terminal-Bench v4.0 與 AutomationBench-AA 較高。Terminal-Bench v4.0 中,Astra 是 59.1%、Fable 是 52.0%;AutomationBench-AA 的完整工作流程完成率則是 41.6% 對 32.1%。兩者的綜合點估計並不精確相等;只是四捨五入後都顯示為 53,代表各自強弱在這組指定權重下落進同一個整數顯示值。

配置也不能省略。AA 測的是 Claude Fable 5.1 的 max effort 加 default safety fallback,而非只有一個裸模型。AA 在 9 月 1 日的較早一輪 Fable 分析中估計,fallback 約占該次 Index 輸出 token 的 4%,會把安全分類器標記的請求交給 Opus 4.8 或 Opus 5;這個 4% 不是任務比例,也不是 v4.3 專屬統計。這正好提醒我們:排行榜上的受測物其實是模型 × effort × fallback × harness

成本差異是真的,但分母很窄

在 AA 自己的 Index 成本口徑下,Astra max 每個加權任務約 US$3.26,Fable max(含 fallback)約 US$7.63,前者低約 57%。這個數字由各 eval 的 token 用量、當下 token 價格,以及 AA 即時量測的典型 cache hit rate 加權計算,可以拿來比較同一張 AA 圖上的配置,卻不能直接等同你的客服、研究或 coding agent 在正式環境中的單次任務成本。

Artificial Analysis v4.3 模型指數與每題成本散點圖
Astra 與 Fable 的綜合顯示值相近,但在 AA 定義的 cost per task 上位置不同。圖/Artificial Analysis;原文發布 2026-09-07,畫面擷取 2026-09-08

15.87%:Agent Arena 量的不是同一件事

Every score on the leaderboard is a treatment effect.

中文:排行榜上的每一個分數,都是一個處置效果。

Arena Agent Mode 說明

這一句是讀懂 15.87% 的鑰匙。Agent Arena 的方法會把真實 Agent Mode session 隨機分派給不同 orchestrator,再估計它相對「平均 orchestrator」基線的因果效果;目前把 Confirmed Success、Praise vs Complaint、Steerability、Bash Recovery、Tool Hallucination 五個方向一致化後等權平均。因此 Fable 的 +15.87% 是淨改善的百分點估計,不是 15.87% 的絕對成功率。

截至 2026 年 9 月 8 日查核,官方最新可取得資料為 9 月 5 日快照:Fable 5.1(Max)共有 6,796 個 session,overall 點估計為 +15.87 個百分點,95% 信賴區間約 +13.04 至 +18.71;Confirmed Success 欄位的 +22.45 個百分點,則來自 2,529 個符合該 signal 定義的觀測。頁面上 2,285,256 是 59 個模型合計的 session 數,不能搬成 Fable 的樣本數。

這些估計另有 inverse-probability weighting(IPS)與時間衰減權重;6,796 是原始 session 數,不是公開的 effective sample size。比較基線也會隨參賽模型組合改變,所以即使某個模型的行為不變,榜上的相對效果仍可能移動。

Agent Arena Labs 排行榜畫面,Anthropic 由 Claude Fable 5.1 Max 代表居首
Labs 視圖以各組織點估計最高的模型作代表;畫面日期為 2026-09-06,底層已發布快照截止 2026-09-05 UTC。圖/LMArena

這張截圖使用 Labs 視圖:它先取每個組織點估計最高的模型作代表,再排列組織。因此第一列表示「由 Fable 代表的 Anthropic」,不是 Anthropic 全部模型的平均分,也不是另外估計的一個組織層級效果。

「第一名」也要加限定詞。在模型視圖中,Fable 的 overall 點估計第 1,但由信賴區間推得的名次範圍是 1–3,且它與 Claude Opus 5 High 的區間部分重疊;公開資料沒有提供兩者的 pairwise difference test。安全結論是「Fable 在該快照的 Agent Arena overall 點估計居首」,不是「顯著擊敗所有 agent 模型」。

最容易漏掉的事:Astra 當時不在這場 Agent Arena 對決

LMArena 的 9 月 5 日變更紀錄分別寫的是:GPT-6 Astra Max 加入 Code Arena: WebDev,Claude Fable 5.1 Max 加入 Agent Arena。官方 9 月 5 日 Agent Arena 的 59 模型資料列中沒有 Astra。換句話說,這份快照提供的是 Fable 對當時 Agent Arena 參賽者的證據,不是 Fable 與 Astra 的同場 agent head-to-head

配置層面也不能強行對齊。本文在 9 月 8 日查核的 LMArena leaderboard、dataset 與 methodology 只足以確認顯示名稱「Claude Fable 5.1(Max)」及共同評測框架;公開欄位不足以鎖定數值化 Max 設定、精確 revision、system prompt,或是否啟用 Anthropic default fallback。因此它不能被假設成 AA 的同一個 Fable 配置。

兩張榜放在一起,能說什麼?

比較面向Artificial Analysis v4.3Agent Arena 2026-09-05 快照
核心問題十項固定 eval 加權後,配置的能力組合如何?在 Arena Agent Mode 的真實 session 中,替換 orchestrator 帶來多少效果?
受測物模型+effort+各 eval harness;Fable 含 default fallback模型 orchestrator+Arena 共同工具與互動環境
Headline 數字53 個指數點;整數顯示值+15.87 個百分點;相對基線的 treatment effect
樣本十項 eval,各自題數、重複次數與裁判不同Fable 6,796 sessions;各 signal 有各自的 observation count
不確定性方法級估計;未公開三配置的配對檢定逐列顯示 95% 信賴區間;點估計名次仍須看重疊
成本固定 eval 組合的加權 cost per task真實 session 切分 task 的榜內口徑
兩邊都在測「配置於環境中的結果」,但任務分布、工具、裁判與分數單位不同。

所以兩張榜能共同支持的,不是誰「宇宙最強」,而是一個更實用的命題:frontier model 的相對表現高度依賴工作負載與系統設定。在 2026 年 9 月 5 日快照的 Agent Arena overall 指標中,Fable 點估計居首;在 AA v4.3,Astra 在 Terminal-Bench、AutomationBench 與該指數成本口徑更有優勢。兩者可以同時為真。

AlphaLab 判讀:排行榜排的是特定測試設計下的模型配置

一個總分,是對價值觀的壓縮

把十項 eval 壓成 53,等於先決定 Agents、Coding、General、Scientific Reasoning 各值多少;把五個 live signal 等權平均,也等於先決定完成、稱讚、可修正性、錯誤恢復與工具幻覺各值多少。權重不是錯誤,它只是編輯選擇。你的產品若把 guardrail violation 視為零分,或把人工修正一輪視為可接受,自己的排序就可能完全不同。

Harness 不是包裝,而是產品的一部分

搜尋工具、sandbox、system prompt、timeout、fallback 與使用者能否追問,都會改變可觀察結果。這也是為什麼不能把 AA 的 Fable 配置,直接視為 Agent Arena 的同一受測系統。讀榜時若只抄模型名稱,等於把真正執行工作的半套系統刪掉。

成本必須與成功一起算

便宜的失敗仍然昂貴,昂貴的一次完成也可能更省人力。真正有用的分母不是 token 或抽象的 task,而是每次可接受成果的總成本:API 花費、工具費、重試、人工修正時間與延遲要放在同一張表上。AA 的 57% 差距值得當成假設,接著應由你的任務驗證,而不是直接當採購答案。

我同意什麼:AA 的固定題集能拆出能力輪廓,Agent Arena 的真實 session 能補上工具編排與互動效用;兩者交叉閱讀,比只信單一發布會跑分健康得多。

我存疑什麼:任何把「Fable Agent Arena 點估計第一」與「AA 顯示 53」拼成「Fable 在 agent 上勝過 Astra、整體又打平」的說法,都跨過了證據邊界。前半句缺少 Astra 的同場資料,後半句則抹平了配置、子項與成本差異。

Fable 5.1 vs GPT-6 Astra 的真正選型方式

排行榜最好的用途是縮小候選名單。真正決定預設模型前,抽 20–50 個自己的高價值任務,鎖定相同的 prompt、工具、context、effort、fallback 與預算,至少記錄下面五項:

  • 一次完成率:不靠重跑就達標的比例。
  • 人工修正時間:人要花多久把輸出推到可用。
  • 端到端延遲:看 p50,也看 p95,而不只 token 速度。
  • 每次成功成本:模型、工具、重試與人工時間一起算。
  • 失敗形狀:幻覺、違規、漏步驟與不可恢復錯誤分開記。

如果 Fable 在研究與複雜編排穩定領先,而 Astra 在終端自動化與成本更好,答案不必是一個全域預設:可以用任務路由,把不同工作交給不同配置。想先理解各榜的量尺,可讀AI 模型排行榜交叉判讀;要把這套想法落成測試,則可接著做AI Evals 七步流程

接著閱讀

左右滑動查看更多推薦

下一次看到「第一名」,先問四件事:誰被測、在哪個 harness、分數相對什麼基線、你的任務像不像它。能回答這四題,排行榜才會從行銷數字變成決策工具。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。