跳到主要內容

Grok 4.7 深度解析:Agent 系統多 9 分,為何綜合指數只多 2 分?(2026)

最後更新: ·
Grok 4.7 Agent 系統分數提升 9 分、Token 使用超過兩倍的資料型主視覺

Grok 4.7 在 2026 年 9 月 21 日登場後,最醒目的訊號不是所有能力同步飛躍,而是 Coding Agent 系統的分數從 47 升到 56;同一套獨立評測裡,更廣泛的綜合指數卻只從 44 升到 46。這篇會先忠實拆解 xAI 的發表,再對照 Artificial Analysis 與 benchmark 原始資料,最後回答一個更實際的問題:這 9 分進步,有多少來自模型、有多少來自 Agent 系統,又用了多少額外推理預算?

xAI 官方網站的 Introducing Grok 4.7 發表頁
xAI 在 2026 年 9 月 21 日發布 Grok 4.7;點圖可回到原始發表頁。圖/xAI

先說結論:這是 Agent 系統升級,不是全面能力跳級

  • 可量化的進步集中在 Agent:Artificial Analysis(AA)的 Coding Agent Index v1.5 顯示,Grok 4.7 xhigh 搭配新版 Grok Build 的整體系統由 46.97 升至 56.27,約多 9.30 分。
  • 更廣泛的能力只小幅上升:同一版 Intelligence Index v4.3.2 是 46.45 對 44.31,約多 2.14 分;長上下文、科學與自動化等子項也有升有跌。
  • 分數不是免費增加:同為 xhigh,AA 量到 Grok 4.7 每題平均輸出約 81k token,Grok 4.6 約 38k,超過 2.1 倍。
  • 最重要的限制:比較同時換了模型與 Grok Build 版本,因此 +9 應歸因於「模型+harness」系統,不能全部算在底層模型頭上。

如果你想先建立判讀基準,可以搭配AI 模型排行榜交叉判讀教學;若要回看前一代的產品脈絡,則可先讀Grok 4.6 與 Grok Bot 分析。要特別注意:舊文章的 61 分來自不同版本的 AA 指標,不能直接拿來和這次的 46 分相減。

xAI 說 Grok 4.7 改了什麼?

xAI 在 〈Introducing Grok 4.7〉中表示,這次換用比 Grok 4.6 更大的新基礎模型,接受更長時間的強化學習後訓練,題目也更偏向需要數小時完成的工作。官方還宣稱模型更會自我檢查、管理長上下文,並理解 Grok Build 的 Agent harness。

“Grok 4.7 uses a new, larger base model compared to Grok 4.6.”

中文:Grok 4.7 使用一個比 Grok 4.6 更大的新基礎模型。

xAI,〈Introducing Grok 4.7〉

這句話能確認的是更新方向,不是模型規模。xAI 的發表頁沒有給出參數量、訓練運算量或拆解各項改動的 ablation,因此「更大的模型」「更長的 RL」都應保留為公司披露,而不能進一步推成某個百分比或單一因果。比較合理的理解是:xAI 同時動了基礎模型、後訓練與 Agent 配合方式,目標是讓系統在長任務中持續規劃、操作工具與驗證結果。

xAI 發表頁的 CursorBench 4.0 分數與平均任務成本圖
xAI 發表頁把 CursorBench 4.0 分數與平均任務成本放在同一張圖;Grok 4.7 位於高分、但非最高分的位置。圖/xAI

獨立測試真正支持什麼?46 對 44,56 對 47

Artificial Analysis 的獨立評測把兩種問題分開:Intelligence Index 看較廣泛的知識、推理、科學與 Agent 任務;Coding Agent Index 則讓各模型使用原生 coding harness,實際讀檔、修改、執行與驗證。

“Grok Build with Grok 4.7 (xhigh) scores 56 on the Artificial Analysis Coding Agent Index, up from 47 with Grok 4.6 (xhigh).”

中文:Grok 4.7 xhigh 搭配 Grok Build 的 Coding Agent Index 得到 56 分,高於 Grok 4.6 xhigh 的 47 分。

Artificial Analysis,2026 年 9 月 21 日
Artificial Analysis 的 Intelligence Index 46 分與 Coding Agent Index 56 分排行榜
同一天、同一模型,在較廣泛的 Intelligence Index 得 46 分,在原生 harness 的 Coding Agent Index 得 56 分;兩張榜回答的是不同問題。圖/Artificial Analysis

精確數字更能看出差異。Intelligence Index v4.3.2 中,Grok 4.7 xhigh 是 46.4466,Grok 4.6 high 是 44.3113,增加 2.1353 分。Coding Agent Index v1.5 中,Grok 4.7 xhigh+Grok Build 是 56.2676,前代組合是 46.9690,增加 9.2987 分。這支持「coding-agent 能力有明顯進步」,卻不支持「所有能力全面躍升」。

三個 coding 子測試也全數上升:DeepSWE 約 64.90%→72.57%、Terminal-Bench 17.68%→33.33%、SWE-Atlas-QnA 58.33%→62.90%。但這仍是特定 benchmark、特定努力等級與特定 Agent 組合下的結果,不等於在每個程式庫、語言或工作流程都能複製同樣幅度。類似的系統級判讀,也可參考SWE-2 成本主張與實測落差分析

為什麼 +9 不能全部算給模型?Harness 也換版了

Coding Agent 不是單次問答。最終分數同時受到提示、工具、檔案探索、context 管理、重試、測試執行與停止條件影響。AA 的執行規格顯示,Grok 4.7 使用 Grok Build 1.0.40,Grok 4.6 使用 1.0.13;也就是說,模型與 harness 版本一起改了。

同一個 Terminal-Bench 4.0 就能看到設定敏感度:Grok 4.7 在 AA 標準化 mini-swe-agent harness 是 25.76%,在 AA 的原生 Grok Build 執行是 33.33%,xAI 自家發表表格則是 38.0%。這三個數字不一定互相矛盾,它們測的是不同系統配置。閱讀 Agent 榜單時,至少要同時問四件事:模型版本、reasoning effort、harness 版本,以及工具/網路權限。

xAI 的發表表格還混用了 Grok 4.7 xhigh、Grok 4.6 high 與競品 max 等不同 effort;DeepSWE 的 Grok 4.7 列另有 high 註記。它適合看產品定位,不適合作為乾淨的模型消融實驗。若想看另一個「榜單分數、價格與速度不能只選一項」的案例,可延伸讀Step 5 Preview 的 Pareto Frontier 分析

更高分的代價:同為 xhigh,輸出 Token 超過 2 倍

Artificial Analysis 顯示 Grok 4.7 每題約輸出 81k token,高於 Grok 4.6 xhigh 的 38k
AA 的 Intelligence Index 每題平均輸出量:Grok 4.7 xhigh 約 81k token,Grok 4.6 xhigh 約 38k。圖/Artificial Analysis

Grok 4.7 與 4.6 的標準 API 每 token 單價相同,但每 token 同價不代表每項任務同成本。AA 在同為 xhigh 的 Intelligence Index 量到,4.7 每題約輸出 81k token,4.6 約 38k,約為 2.13 倍。AA 的完整測試成本估算也從每題 2.32 美元增至 3.74 美元。

在 Coding Agent Index,差距更大:4.7 系統每題估計 8.82 美元、39.2 分鐘、14.3M token;4.6 系統是 3.57 美元、19.5 分鐘、5.5M token。這些是 AA 特定 harness 與計價模型下的估算,不是每位使用者的帳單;它們仍揭示一件重要事:這次進步有一部分來自更多 test-time compute。真正該比較的是「每個被接受成果的成本」,而不是只有百萬 token 標價。

Benchmark 仍有硬限制:DeepSWE 至少 23 題可能誤判

DeepSWE 占 Coding Agent Index 三分之一,卻不是沒有瑕疵。Epoch AI 在 2026 年 9 月 7 日的獨立審核把 DeepSWE v1.1 評為「Flawed」,指出至少 23/113 題存在可能造成 false negative 的評分問題;常見情況是模型新增的測試和隱藏 verifier 衝突。

Epoch 的審核只檢查 DeepSWE 題目與 verifier,不能用來推論 Grok 4.7 是否作弊;它能支持的結論是:絕對分數與小幅排名差需要保守解讀。更可靠的訊號是三個 coding 子測試方向一致向上,而且其他獨立資料也看到長任務改善;不可靠的說法則是把單一榜單名次擴大成「世界最強 coding 模型」。若要深入理解不同榜單為何會給出不同答案,可再看Fable 5.1 與 GPT-6 Astra 雙榜比較

API 與 Copilot:現在能在哪裡使用?

xAI 官方文件,公開 API 模型 ID 是 grok-4.7,支援 Responses API 與 Chat Completions,context window 為 500k,reasoning effort 可選 low、medium、high 與 xhigh。它能接收文字與圖片、輸出文字,也能配合 function calling、網頁搜尋、X 搜尋與程式執行。

  • Prompt 不超過 200k token:每百萬 token 為輸入 2 美元、快取輸入 0.50 美元、輸出 6 美元。
  • Prompt 超過 200k token:費率提高為輸入 4 美元、快取輸入 1 美元、輸出 12 美元。
  • Fast 版本:官方把它描述為同一模型的較快服務,token 單價為標準版兩倍,使用範圍是 Cursor 與 Grok Build。

GitHub 在 9 月 21 日的官方 changelog也確認 Grok 4.7 已列為 GA,並在 Copilot 分批推出;實際是否出現在選單,仍取決於方案、客戶端版本與組織模型政策。想了解前代 API 與 Coding Agent 的實際接法,可搭配Grok 4.6 API 與 Coding Agent 實戰,但價格與型號仍應以 4.7 最新文件為準。

安全聲明:先當公司自評,不當獨立結論

xAI 另外宣稱 Grok 4.7 採用全新的 safeguard stack,並在自家發表頁列出 LatchBio 與 HackerBench v0.3 成績。但發表頁沒有提供足以重建 HackerBench 結果的完整方法、任務數與公開 artifact;因此本文只把這一段視為 xAI 的系統安全自評,不用它推導「Grok 4.7 已被獨立證明更安全」。對企業使用者而言,更可操作的問題是:實際部署是否保留相同的過濾、工具權限、稽核與人工覆核。

AlphaLab 判讀:值得測,但要測「成果成本」

我同意 xAI 的地方是:Grok 4.7 把改進集中在真正會消耗工程時間的長任務,而 AA 的三個 coding 子測試與知識工作測試提供了外部支持。這不是只有改名或微小波動;在特定 Agent 系統裡,完成率確實跨了一個可感知的幅度。

我保留的地方是:更廣泛的綜合能力只增加約 2 分,harness 也同時換版,而且同 effort 的輸出 token 超過兩倍。最合理的結論不是「Grok 4.7 全面領先」,而是「Grok 4.7+新版 Grok Build 在長時間 coding-agent 任務上變得更有競爭力,代價是更多推理預算」。

實際評估 Grok 4.7,請固定這 6 個條件

  1. 挑 10~30 個真實工作,不用只問短題;至少包含跨檔案修改、測試、文件整理與失敗修復。
  2. 固定同一個 harness、工具權限、提示與版本,只更換模型;再另做一次「連 harness 一起換」的系統比較。
  3. 讓 high 對 high、xhigh 對 xhigh,不把不同推理預算混成模型差距。
  4. 記錄成功率、總 token、牆鐘時間、重跑次數與人工修正時間。
  5. 同一任務重複多次,避免把一次幸運解題當成穩定能力。
  6. 最後計算「每個被接受成果的成本」;若多用 token 能減少重跑與人工修正,它才真的更划算。

Agent 評測的核心不是找一個永遠正確的總分,而是先定義你允許系統做什麼、成功條件是什麼,再把模型與 harness 的貢獻拆開。若團隊正在建立自己的驗收流程,這也是建立 AI Agent Harness時最應先固定的基線。

Grok 4.7 常見問題

Grok 4.7 是目前最強的 coding 模型嗎?

現有證據只支持它在特定模型、effort 與原生 harness 組合中進入前列。AA 的 Coding Agent Index 仍有其他系統得分更高,而不同 harness 也會讓同一 benchmark 出現明顯差距。

Grok 4.7 比 Grok 4.6 便宜嗎?

標準 API 的每 token 單價相同;每項任務總成本不一定相同。AA 的 xhigh 測試中,4.7 使用更多輸出 token,但若它能減少失敗、重跑與人工修正,某些工作仍可能有更低的成果成本。

為什麼綜合指數只多 2 分,Coding Agent 卻多 9 分?

兩個指標的任務與權重不同;Coding Agent Index 又採原生 harness,並且這次 Grok Build 版本也更新。它說明改進集中在 coding-agent 系統,不代表兩個分數互相矛盾。

接著閱讀

左右滑動查看更多推薦

結論:先把 9 分拆開,再決定是否換模型

Grok 4.7 最值得關注的不是版本號,而是它揭露了 2026 年模型競爭的新常態:進步越來越像「模型、推理預算、Agent harness 與工具」共同交付的系統結果。AA 的資料支持它在 coding-agent 長任務上有實質升級,也同時提醒我們,更多 token、不同 harness 與 benchmark 缺陷都會改變答案。

因此,最好的下一步不是直接把所有工作切到 Grok 4.7,而是選一組真實任務,固定 high/xhigh 與 Grok Build 版本,量出每個可接受成果的成本。若 9 分能轉成更少的人類修正,它就是有價值的升級;若只是產生兩倍以上 token,卻沒有提高你的任務完成率,那麼榜單上的進步還沒有變成產品價值。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。