2026 年 8 月 7 日,Reddit 使用者 Infinite-Local5435 在 r/LocalLLaMA 發布〈My issue with Artificial Analysis’s “intelligence index”〉,質疑 Artificial Analysis 更新方法後,Qwen3.8 Max 與 Claude Opus 的相對位置為何改變。研究期間的嵌入頁快照顯示 146 個 upvotes 與 82 則留言;票數之後仍會浮動。這場爭論正好暴露 AI 模型排行榜最常見的讀法錯誤:把不同量尺的第一名,當成同一個答案。
LMArena 第一、Artificial Analysis 第一與 OpenRouter 熱門第一,可能是三個完全不同的模型,而且不矛盾。前者觀察人類偏好,中者把指定評測加權成能力指數,後者呈現 OpenRouter 平台內的使用量。它們可以幫你縮小候選名單,卻沒有一個能替你決定哪個模型最適合自己的工作。
先把原始質疑放在桌上。點擊下面的瀏覽器截圖可開啟 Reddit 原文;接下來會先核對指控,再逐一拆解三種榜,最後用三個當期候選做交叉判讀,並把結果收斂成十題自建 eval。

這篇質疑問對了問題,卻下了沒有證據的結論
“they just adjusted the weights of the gdpval and t3 banking so that it would be lower than opus”
中文:「他們只是調整 GDPval 與 τ³-Banking 的權重,好讓它低於 Opus。」
— Infinite-Local5435,r/LocalLLaMA
這裡要先拆開兩個容易混淆的指標。總 Intelligence Index 裡,GDPval-AA v2 占 20%、τ³-Banking 占 14%,兩者合成 Agents 類別的 34%;另一張Agentic capability index 方法文件則把這兩個 components 寫成各占 50%。原帖質疑的是後者。8 月 6 日的v4.1.1 變更紀錄列出 τ³-Banking 上游 v1.0.1 的資料與評分器(grader)更新,以及 HLE、AA-LCR、AA-Omniscience 的評分器升級,沒有列出兩者權重調整;因此公開資料沒有支持「這個 patch 改了權重」的具體說法。
原帖進一步猜測榜單受到商業介入,卻沒有提出付款、合約或內部決策等可驗證證據,不能當作事實。不過,較窄的質疑仍然成立:即使模型本身沒更新,資料、評分器、正規化或權重一變,分數與名次就可能移動。更值得追問的是,方法文件雖把 Agentic Index 寫成 GDPval 與 τ³ 各占 50%,研究日頁面可見的分項數字卻無法直接重算出顯示值;公開資料沒有完整交代兩個分項如何轉成顯示分數。這不能推論操榜,卻是一個值得平台補充的可重現性缺口。
所以正確回應不是「這張榜可信」或「這張榜不可信」二選一,而是先問:它收集什麼證據、如何聚合、版本是否相同,以及這些條件是否接近你的任務。
AI 模型排行榜的三種「第一名」,先拆開
| 平台 | 「第一名」實際代表 | 先看哪個欄位 | 不能直接推出 |
|---|---|---|---|
| LMArena | 在當時 Arena 使用者、prompt、模型配置與計分模式下,回覆較常被偏好 | 任務分類、Style Control/None、分數、95% 信賴區間、可能名次、日期 | 最正確、最安全、最便宜,或最適合你的實際工作 |
| Artificial Analysis | 在指定英文文字評測、執行流程、推理設定與權重下,綜合分數較高 | 方法版本、分項、權重、推理強度、每題成本、速度口徑 | 所有語言與任務都最強,或真實工作總成本最低 |
| OpenRouter | 在選定時間窗內,模型於 OpenRouter 承接較多 token 工作量 | 日/週/月、tokens、免費版本、供應商與時間窗 | 全球最多人用、品質最好,或每個 token 都是等量工作 |
LMArena:匿名偏好很有用,但表面名次不是判決書
LMArena 的 Battle mode會先隱藏模型名稱,讓使用者比較兩個回答,投票後才揭露身份。榜單用 Bradley–Terry 模型估計相對偏好強度;分數的絕對值沒有「能力單位」,有意義的是同一套評測執行流程下的相對差距。匿名能降低明示品牌影響,卻不能保證使用者無法從語氣、格式或功能猜出模型。
“This leaderboard averages over many users and prompts, only providing a coarse understanding of performance.”
中文:「這張榜把許多使用者與 prompt 平均在一起,只能粗略理解表現。」
— LMArena,Prompt-to-Leaderboard 研究
2026 年 8 月 14 日擷取的 Text Arena 頁面,資料標示更新至 8 月 13 日。預設的 Style Control 榜上,claude-fable-5 的表面名次(raw rank)為 1、1506±5,可能名次區間(rank spread)是 1~4;claude-opus-4-6-high 的表面名次為 2、1505±4,可能名次區間同樣是 1~4。也就是說,表格必須排出 1、2,但依 Arena 自己的 rank-spread 規則,兩者沒有被統計上清楚分開。只抄第一名,會把「點估計領先」誇大成「已證明勝出」。

Style Control會把回覆長度、標題、粗體與清單等可觀察特徵加入 Bradley–Terry 回歸,降低這些特徵對模型係數的影響;這不代表風格偏誤已被完全消除。官方也明說分析仍屬 observational analysis,未觀察到的風格與內容品質無法完全拆開。實務上至少要記錄:
- 哪一個 modality 與 category,而不是只寫「Arena 榜」。
- Style Control、None 還是 Factuality;AutoEval 也不能冒充真人票。
- 日期、score、95% CI 與 rank spread,而不是只抄 raw rank。
- 模型實際提供的 endpoint、system prompt、thinking budget 與 provisional 狀態。
Artificial Analysis:標準化能力、價格與速度要分三條軸
Artificial Analysis Intelligence Index v4.1.1 是九項英文、純文字評測的加權組合。整體權重為 Agents 34%、Coding 24%、Scientific Reasoning 24%、General 18%;分項又包含 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、HLE、GPQA Diamond、CritPt、AA-LCR 與 AA-Omniscience。它回答的是「在這套權重下誰較強」,不是自然界唯一的智慧定義。

研究日的模型比較頁把 Claude Opus 5 (max) 列為 Intelligence 約 63 分、Claude Fable 5(with fallback)約 62 分;但同一頁的 speed、latency、price 與 cost per task 各有不同領先者。這是它比單一總榜有價值的地方,也是一個警告:品質冠軍、吐字速度冠軍與每題成本冠軍本來就可能不同。
讀價格與速度還要補口徑。Cost per Task 是把各 evaluation 的 input、cache、reasoning 與 answer token 成本依 Index 權重折算成每題平均美元成本,不是你的完整總持有成本;output speed 是收到第一個 token 後的輸出速度,也不是完整等待時間。依AA 效能方法,數字代表第一方 API;沒有第一方 API 時取多個供應商的中位數,並以過去 72 小時的 P50 呈現。若實際產品在意尾端延遲,仍要另外測 P90/P99,並記錄供應商、區域、推理強度與日期。
AA 證據 = 方法版本 × 模型設定 × 供應商 × 日期
× 分項與權重 × score/不確定性
× 每題成本 × 首 token 等待/輸出速度
有趣的是,Artificial Analysis 自己在Optima 公告也把解法指向自建工作負載 benchmark:
“Build benchmarks from your own data and workflows.”
中文:「用自己的資料與工作流程建立 benchmark。」
— Artificial Analysis,Optima
OpenRouter:熱門榜是平台使用量,不是能力榜
OpenRouter Rankings 的 Top Models 預設呈現平台內的 weekly usage。每日排名資料集文件把 total tokens 定義為 prompt tokens 加 completion tokens。2026 年 8 月 14 日的頁面快照中,週榜前三為 DeepSeek V4 Flash 0731(10.7T tokens)、Hy3(10.6T)與 GPT-5.6 Luna(5.2T)。這證明它們在 OpenRouter 承接大量工作,不證明誰回答得最好。

token 更不能直接當人數或等量任務。長 context、agent loop、reasoning 與批次處理,可能由少量客戶產生極大量 token;不同模型又使用不同的上游 tokenizer,OpenRouter 文件明確警告跨列 token 並非完全可比。免費 variant、折扣、provider 容量、某個大型 app,以及模型 fallback,都可能影響平台內流量。local inference、直接向模型商購買與企業內部部署則完全不在這張圖裡。
OpenRouter 的 provider performance 是另一種證據:TTFT 是首 token 等待時間,throughput 是輸出速度,uptime 是成功請求除以排除 user errors 後的總請求,quantization 則提示同模型可能以不同精度服務。429 rate limit 與 403 地區限制另行追蹤,因此 99.9% uptime 也不代表不會碰到這兩者。比較時應寫清楚模型版本、供應商、區域、量化、百分位數、時間窗與擷取日期。
“Use leaderboards to shortlist, then verify on your own prompts.”
中文:「用榜單建立候選名單,再用自己的 prompt 驗證。」
— OpenRouter,Provider Performance Guide
三榜交叉判讀:三個領先者,三種下一步
讀 AI 模型排行榜時,現在把研究日三個醒目的候選放回同一張跨榜矩陣。這不是要硬算一個總分,而是用每張榜找出「下一個最值得驗證的假設」。模型名稱後的 high、max、fallback 與 provider 都是配置的一部分;找不到同名同配置資料時應明寫「未取得」,不能填成 0,也不能拿近似型號代替。
| 候選 | LMArena | Artificial Analysis | OpenRouter | 下一個驗證假設 |
|---|---|---|---|---|
| Claude Fable 5 | claude-fable-5:Style Control 表面第 1,1506±5,可能名次 1~4 | 約 62 分,但頁面是「with fallback」配置,不能視為 Arena 同配置 | 同日擷取的週榜前 10 名未列;未取得同配置 token 數 | 固定答案格式後盲評;記錄 fallback 次數與每個成功任務成本 |
| Claude Opus 5 | claude-opus-5-high:表面第 7,1493±5,可能名次 3~16 | max 約 63 分、研究日 Intelligence 第一;與 Arena high 推理強度不同 | 同日擷取的週榜前 10 名未列;未取得同配置 token 數 | 最困難三題的通過率、人工修正、P95 完成時間與成本上限 |
| DeepSeek V4 Flash 0731 | 頁面列有 deepseek-v4-flash 1435±4、可能名次 75~102,但名稱未明示 0731,版本映射待確認 | DeepSeek V4 Flash 0731(Reasoning, Max Effort)約 52 分;仍須核對 OpenRouter 實際 provider/endpoint 是否與 AA 配置一致 | 週榜約 10.7T tokens,平台內工作量第 1 | 先核對 checkpoint;再測品質、價格、輸出長度與主要供應商的 P95 首 token/輸出速度 |
這張表也解釋了常見的「榜單互相打臉」。能力榜高、使用量低,可能是模型太新、太貴、provider 少或整合麻煩;使用量高、偏好榜普通,可能是便宜、免費、長 context 或被大型 app 採用;人類偏好高、標準化分數普通,可能是表達、格式與互動體驗做得更好。這些都是待驗假設,不是可以直接寫成因果的結論。
榜單改版或名次跳動時,先問是哪一層變了
- 模型層:模型版本、推理強度或上下文容量是否更新?
- 服務層:服務端點、system prompt、評測執行流程、供應商、量化或路由是否改變?
- 題目層:題庫、prompt 分類器、抽樣族群與真實流量組成是否漂移?
- 判分層:評分器、風格/事實性校正、正規化、權重與信賴區間方法是否改版?
- 呈現層:時間窗、篩選條件、表面名次、可能名次區間、四捨五入與隱藏模型是否不同?
只要其中一層變了,模型沒更新也可能升降。版本號不是旁註,而是分數的一部分。截圖也不是永久證據;它只能回答「在這個日期、這個篩選條件、這個方法版本下,頁面顯示什麼」。
外部榜單只是先驗線索:用十題 eval 完成模型選型
8 月 10 日另一篇 LocalLLaMA 模型選擇串在 8 月 14 日研究時顯示 127 個 upvotes,發文者把難題濃縮成三件事:benchmark 不可靠、工具還不成熟、模型輸出又有隨機性。因此他要求回覆者交代實際用途、硬體、使用量、工具、框架與 prompt。這個要求比再找一張總榜更接近真正的選型。
可直接沿用 AlphaLab 的十題模型路由評測流程,但在候選階段先用三榜提供先驗線索:
- 寫清楚工作:一句話定義輸入、允許工具、交付物與失敗代價。
- 建立 3~5 個候選:從偏好、標準化能力、成本/速度與真實採用訊號各取有理由的模型,不必每榜都拿第一。
- 抽十題真實任務:5 題日常、3 題困難、2 題曾造成昂貴失敗;不要臨時發明漂亮 demo。
- 先寫驗收規則:正確性、格式、引用品質、工具完成與不可接受錯誤,都在看答案前固定。
- 固定比較條件:所有候選使用同一組十題、system prompt、工具、timeout 與驗收規則;若目標是比較完整產品,才允許各自最佳配置並明確標示。
- 處理隨機性:順序隨機、模型名稱遮蔽,每題至少跑 3 次;預算只夠單次時,結果只能當初篩。
- 同時記錄品質與經濟性:首次通過率、最終成功率、重試、總 token、工具費、人工修正、P50/P95 完成時間。
- 按任務路由:保留每類任務的勝者,不必強迫一個模型統治所有工作。
| # | 題型 | 貼入一個真實任務 | 看答案前先寫驗收 Gate |
|---|---|---|---|
| 1 | 日常 | ______ | ______ |
| 2 | 日常 | ______ | ______ |
| 3 | 日常 | ______ | ______ |
| 4 | 日常 | ______ | ______ |
| 5 | 日常 | ______ | ______ |
| 6 | 困難 | ______ | ______ |
| 7 | 困難 | ______ | ______ |
| 8 | 困難 | ______ | ______ |
| 9 | 昂貴失敗 | ______ | ______ |
| 10 | 昂貴失敗 | ______ | ______ |
| Eval 欄位 | 填寫方式 |
|---|---|
| 任務與驗收 Gate | 真實輸入、必備條件、不可接受錯誤、人工是否可修 |
| 模型配置 | 完整 model ID、推理強度、供應商、system prompt、工具與 timeout |
| 結果 | 首次通過/重試後通過/失敗;另記評分器與人工原因 |
| 成本 | 所有嘗試的 token、API、工具與人工時間,除以成功任務數 |
| 速度與穩定 | P50/P95 完成時間、429/5xx、fallback 與超時 |
| 決策 | 保留、備援、淘汰;寫下會讓你改變決定的新證據 |
若還在判斷前沿能力差距,可搭配 AlphaLab 的Grok 4.6 深度解析,看同一個 61 分如何因分項、價格與評測執行流程得出不同結論;若要實際透過聚合 API 測多模型,則可接著看OpenRouter 多模型 API 與 coding agent 教學。榜單的工作到「生成可驗證假設」就結束,最後決定要由自己的任務更新。
AlphaLab 的判讀:別問誰第一,先問它贏的是哪一題
我同意原帖的部分:綜合指數的權重、grader 與版本值得被持續檢查;小幅領先不該包裝成全面勝出。當平台修改方法,最好的做法是公布版本、變更紀錄、分項與可重現資料,而不是只更新一個名次。
我不同意原帖的部分:現有公開變更紀錄沒有支持「v4.1.1 調整 GDPval/τ³ 權重」這個具體說法;商業介入的猜測也沒有提出可驗證證據。公開紀錄未列變更是重要反證,但不是對未公開後端的絕對證明;同樣地,也不能從「我無法重算」直接跳到「榜單被收買」。
三榜真正的價值:LMArena 提供人類偏好的先驗線索,Artificial Analysis 提供標準化能力與任務經濟性的先驗線索,OpenRouter 提供平台採用與服務路徑的先驗線索。三者方向一致時,代表候選值得優先測;方向分歧時,則告訴你下一個該排除的是風格、權重、價格、供應或採用偏誤。
最後決策規則:每一次看見 AI 模型排行榜的「第一名」,都把它改寫成完整句子——「在某日期、某版本、某篩選條件、某證據單位下排名第一」。如果這句話仍無法對應你的失敗代價,就不要遷移;先跑十題。
接著閱讀
左右滑動查看更多推薦
今天就從最常見、最困難與最昂貴失敗的工作各抽幾題,保存完整配置與驗收規則。下一次榜單換冠軍時,你需要更新的是候選名單,而不是整套判斷能力。






