跳到主要內容

Grok 4.6 與 Grok Bot 為何爆紅?61 分只是起點(2026)

最後更新: ·
Grok 4.6 與 Grok Bot 主圖,官方影片中的 AI 同事場景搭配「AI 同事進入 beta」

2026 年 8 月 11 日,SpaceXAI(xAI)先推出早期 beta 的 Grok Bot;隔天又發布 Grok 4.6。前者把 AI agent 放進一台可持續運作的雲端電腦,後者把 Artificial Analysis Intelligence Index 推到 61 分。兩個產品連續登場,讓 xAI 不只在比誰的模型更強,也開始回答另一個問題:AI 系統要怎麼在你離線後繼續把工作做完?

截至 2026 年 8 月 14 日 19:28(台北時間),兩則官方 X 貼文合計約 5,718 萬次觀看、逾 6.19 萬個讚;Grok 4.6 的 Hacker News 討論另有 627 points、606 comments。這足以證明注意力高度集中,卻不能證明使用者採用、任務成功率或安全性。X 的 view count 是貼文顯示次數,同一帳號重複觀看也可能重複計入。

這輪真正值得拆解的,不是「xAI 又拿到一個高分」,而是模型層與代理產品層同時推進:Grok 4.6 在 agent 與終端任務有亮點,Grok Bot 則把登入狀態、檔案與瀏覽器留在雲端。但兩者的證據強度完全不同——模型已有多項第三方 benchmark;Bot 仍是早期 beta,截至 2026 年 8 月 14 日,官方 launch article 與文件未提供任務成功率或 Bot 專屬紅隊結果。

先把 Grok 4.6 原文放在桌上。點擊下面截圖可在新分頁開啟 xAI 公告;接下來我會還原兩次發布、核對 benchmark 與社群熱度,再從第一性原理判斷:這是能力突破、產品突破,還是兩者被熱度混在了一起。

SpaceXAI 官網 Introducing Grok 4.6 發布頁的瀏覽器截圖
SpaceXAI 於 2026 年 8 月 12 日發布 Grok 4.6,主打長時間 agent、coding 與 knowledge work。點圖可前往原文。圖/SpaceXAI

兩天兩個發布:模型與工作介面同時升溫

這兩次發布在時間與敘事上彼此呼應,但不能直接畫上技術等號。截至 2026 年 8 月 14 日,xAI 的 Grok Bot 文件沒有說明它是否、或如何使用 Grok 4.6;官方 Teams 文件反而表示產品不提供 model picker,請求會在產品管理的固定模型集合內 routing。以下把它們視為相鄰的模型發布與 agent 產品發布,不假設兩者存在未公開的固定映射。

首發日期產品官方主張目前證據
2026/8/11Grok Bot在雲端電腦跨網站與工具工作,使用者離線後仍可繼續早期 beta;截至 8/14,官方頁面未列成功率
2026/8/12Grok 4.6強化長時間 agent、coding、知識工作與互動式作品官方表格、Artificial Analysis 與初步 Arena 排名

“Introducing Grok Bot, now in early beta.”

中文:「Grok Bot 正式登場,目前仍處於早期 beta。」

— SpaceXAI 官方關聯帳號 @bot

官方首發貼文把 Bot 稱為會真正工作的「AI teammates」:它能登入既有工具,像使用者一樣操作,完成後再回報。官方文件進一步說明,這台雲端電腦會保留檔案、瀏覽器與登入狀態;Bots 可以跨 app、信箱與沒有 API/MCP 的網站工作,也能把示範過的流程保存成 routine。

Grok Bot 官方發布影片中的雲端電腦工作介面,可看到多個 Bot 對話與 Open computer 按鈕
Grok Bot 官方影片展示多個 Bot 對話與「Open computer」入口。它把持續執行與登入狀態留在雲端,不等於每個 Bot 各有一台隔離電腦。點圖可看原始貼文。圖/SpaceXAI

最容易誤解的地方是「自己的電腦」。官方文件明確寫道:同一位使用者的 Bots 共用同一台機器,包括檔案、瀏覽器與登入;隔離單位是 user,不是單一 Bot。這讓多 Bot 能共享狀態、並行協作,也把權限與錯誤的影響範圍綁在一起。產品在 launch 時開放 SuperGrok Heavy、Cursor Ultra 與 Cursor Teams Premium,支援 desktop 與 iOS;Enterprise 採逐步 rollout、需聯絡 Cursor account team。這些條件都提醒我們:它是受限的 beta,不是已普及的通用員工。


Grok 4.6 真正更新了什麼?

公告未揭露 architecture 細節,但明確表示 Grok 4.6 比 Grok 4.5 經歷更長的 supplemental training run。官方表示,團隊加入模型生成的 reasoning 與進階技術資料、高品質工程資料,調整 optimizer 與 training recipe;再用 Grok 4.5 重建不同 reasoning effort、agent harness、STEM、軟體工程與知識工作的 SFT trajectories,之後進行涵蓋 coding、kernel optimization、web development 與 CAD 等環境的 agentic RL。

這條訓練路線透露出真正的產品方向:不是讓模型只在單題回答多拿幾分,而是讓它在長 trajectory 裡持續研究、寫程式、檢查結果並修正。xAI 稱 Grok 4.6 在互動式與視覺專案的第一版更完整,也更常自我測試;不過這些仍是官方觀察。多項 agentic benchmark 相較 Grok 4.5 上升,還不能替所有產品場景證明自我驗證已經可靠。

“It delivers frontier intelligence and is a significant improvement over Grok 4.5 at the same price.”

中文:「它提供前沿水準的智慧,並在相同價格下,相較 Grok 4.5 有顯著提升。」

— SpaceXAI 官方 X 貼文

這句話把官方敘事濃縮得很漂亮,但「顯著提升」是公司措辭,「相同價格」也只對未快取 input 與 output 的牌價成立。xAI 官方列出 Grok 4.6 發布時已可在 Cursor、Grok Build、xAI API、OpenRouter、Vercel 與 Cloudflare 使用;公告另提到 launch week 的 Cursor 與 Grok Build 兩倍 included usage,這是有時間範圍的發布活動,不是長期模型價格。若目標是 API 接線與 coding harness,可另看 AlphaLab 的 Grok 4.6 coding agent 實作指南


Grok 4.6 的 61 分代表什麼:追平同一把尺,不是所有能力相等

Artificial Analysis Intelligence Index v4.1.1 把九項英文、純文字評測加權成一個總分,權重分別為 Agents 34%、Coding 24%、Scientific Reasoning 24%、General 18%。它比只看一道數學題或一個 coding benchmark 更完整,但仍然偏重 agent,而且不測多語言、影像輸入與語音。Artificial Analysis 自己也估計總指數的 95% confidence interval 小於 ±1%;個別評測的不確定性可能更大。

在這套指數下,Grok 4.6 的精確分數是 60.92297,GPT-5.6 Sol max 是 60.92987,顯示時都四捨五入成 61。兩者只差約 0.0069,遠小於一個整數點,因此說「同分」合理;說 Grok 已全面超越 Sol,就沒有證據。相較 Grok 4.5 的 55.75890,Grok 4.6 在同版指數上提高約 5.16 分,支持其綜合評測明顯進步,但不代表每項子能力都有相同幅度提升。

Grok 4.6 High、Grok 4.5 High、GPT-5.6 Sol Max 與 Fable 5 Max 的十項官方發布頁評測比較表
Grok 4.6 High 與 Grok 4.5 High、GPT-5.6 Sol Max、Fable 5 Max 的十項評測。Grok 4.6 的 AA Intelligence Index 為 61,Terminal-Bench v3.0 為 26%。圖/SpaceXAI 官方發布頁,2026 年 8 月 13 日擷取

xAI 自己列出的十項比較也比「61」更有資訊量。在 xAI 選取的四模型發布表中,Grok 4.6 的 GDPVal-AA v2 1753、AA-Briefcase 1577、Harvey LAB 15.8% 是該表最高值;但 Fable 5 Max 在 CursorBench、FrontierCode、APEX-Agents 與 APEX-SWE 領先,GPT-5.6 Sol Max 則在 DeepSWE 1.1 與 Terminal-Bench v3.0 領先。以「每列最高分」計,Grok 4.6 只拿下十列中的三列。這不是所有公開模型的全球排名,而且發布頁混合開發商自報與公開榜單的最佳成績,只能視為摘要,不是 harness、budget 與 reasoning 設定完全一致的 head-to-head。

截至 2026 年 8 月 14 日的 Artificial Analysis 榜單快照,Grok 4.6 high 在 188 個可見 model settings 中排名第 6;同一模型的不同 reasoning effort 會分開排名。Artificial Analysis 對這次結果的總結很精確:Grok 4.6 最強的結果集中在 agentic work,而非 static reasoning。比較穩妥的結論是:它已回到第一梯隊,而且非常接近 Sol max;它不是一致公認的新王者。

Arena 的 Code #5、Text #44,為何不是互相矛盾?

截至 8 月 12 日的初步快照,Arena Code/WebDev 給 Grok 4.6 high 的 point rank 是 #5,score 1630±18、1,407 votes,rank spread 為 5–7;Arena Text Overall 的 point rank 卻是 #44,score 1464±10、3,396 votes,rank spread 達 20–63。兩頁都標示 Preliminary。

Code Arena 評的是人類對 web/full-stack app 成品的偏好,不是所有 coding 任務;Text 的排名區間又非常寬。Grok 4.6 在 Code 的 point estimate 明顯高於 Grok 4.5 的 #14,但 Text 的信賴區間與 4.5 重疊,不能據此宣稱退步。這組落差反而支持同一個敘事:Grok 4.6 的強項偏向 agent、builder 與工作流,不是每一種文字問答都同步登頂。


Terminal-Bench 2.1 的 88.4% 沒有錯,但不是官方榜首

Artificial Analysis 的 Terminal-Bench v2.1 評測確實測得 Grok 4.6 為 88.39%,四捨五入就是 88.4%。它使用 Terminus 2 agent harness 與 E2B 環境,對 89 個任務各跑三次,最多允許 250 episodes。這是有方法、有重複次數的第三方結果,不是隨手挑出的 demo;Artificial Analysis 官方 X 貼文則是這次發布的社群摘要。

但這個數字屬於 Artificial Analysis 自己的評測管線。在 Artificial Analysis 的同口徑結果裡,它排在 GPT-5.6 Sol xhigh 的 89.51% 與 Claude Opus 5 max 的 89.14% 之後,進入領先群但不是該測試的最高值。最準確的寫法是「Artificial Analysis 測得 88.4%」,而不是把第三方管線的結果改寫成 Terminal-Bench 官方榜首。

另一個容易混淆的地方是版本。xAI 發布頁另列 Terminal-Bench v3.0,Grok 4.6 為 26%,高於 Grok 4.5 的 15.7%,卻落後 Sol Max 的 34.6% 與 Fable 5 Max 的 34.1%。不同版本、不同 harness 與不同資源上限不能橫向硬比;它們共同說明的是:Grok 4.6 明顯進步,但「coding agent 已經全面第一」仍站不住腳。


US$2/US$6 的價值是真的,也有兩道門檻

“Pricing starts at $2 per million input tokens and $6 per million output tokens.”

中文:「價格從每百萬 input token 2 美元、每百萬 output token 6 美元起。」

— SpaceXAI,〈Introducing Grok 4.6〉

關鍵字是「starts」。依xAI 即時 API 價格表,Grok 4.6 的 500K context window 以 200K prompt token 為分界;一旦 prompt 達 200K,該次請求的全部 token都按長 context 價格計費,不是只有超過門檻的部分加價。

模型與情境InputCached inputOutputContext
Grok 4.6,prompt < 200KUS$2US$0.50US$6500K
Grok 4.6,prompt ≥ 200KUS$4US$1US$12
Grok 4.5,prompt < 200KUS$2US$0.30US$6500K
GPT-5.6 Sol max,prompt ≤ 272KUS$5US$0.50US$301.05M
GPT-5.6 Sol max,prompt > 272KUS$10US$1US$45
截至 2026 年 8 月 13 日的 Standard API 牌價,單位為每百萬 token。Cached input 欄為 cache read;OpenAI 的 cache write 另按未快取 input 的 1.25 倍收費。Grok 與 Sol 的長 context 門檻、倍率與最大 context 不同;未含 Fast/Priority 等加速服務。

第一道門檻是長 context:500K 是容量上限,不代表全部都用 US$2/US$6。第二道門檻是 cache:Grok 4.6 的未快取 input/output 與 Grok 4.5 相同,但短 context cached input 從 US$0.30 升到 US$0.50,長 context cached input 從 US$0.60 升到 US$1。因此官方所稱「same price」對 headline uncached rates 成立,對所有流量型態不成立。

若改用 xAI 發布頁所稱的 Fast variant(API 文件稱 Priority Processing),input、cached input 與 output 都是標準價格的兩倍。它買的是較高服務優先級,不是折扣;延遲有商業價值時才值得納入比較。

GPT-5.6 Sol 官方牌價相比,Grok 的短 context input 便宜 60%,output 便宜 80%,差距很大;但真實工作流還要看模型用了多少 reasoning 與 output token。Artificial Analysis 在 Intelligence Index workload 上的加權 cost per task 更實用:Grok 4.6 約 US$0.837,Sol max 約 US$1.231,Grok 約低 32%。這仍是有吸引力的優勢,只是沒有 output 牌價表面上的 80% 那麼誇張,也不能直接外推每個 production 任務。

原因也看得到:Artificial Analysis 測得 Grok 4.6 在這套 workload 的加權平均每題輸出約 21.7K token,Sol max 約 16.9K;Grok 的便宜 token 被更長輸出吃掉一部分。這正是選模時應追蹤「每個成功任務成本」,而不是只看每百萬 token 的原因。若要建立自己的比較方法,可搭配 AlphaLab 的模型路由評測流程,把品質、重試、延遲與完整帳單放回同一張表。


更便宜,不代表更快、更即時或更穩

xAI 官方 thread稱 Grok 4.6 比可比模型更快,但速度高度依賴供應商、reasoning effort、harness 與量測方式。截至 2026 年 8 月 14 日,Artificial Analysis 的 model page 顯示 xAI 第一方 API 約 65.8 個 token/秒、time to first token 約 32.3 秒。這是會隨時間與負載變動的服務快照,不是模型固定常數;對長時間 agent,工具等待、重試與總完成時間往往比第一個 token 更重要。

這不代表 Grok 一定慢,而是「更快」不能脫離場景。對長時間 agent,總完成時間、工具等待與成功率可能比第一個 token 更重要;對即時聊天,首答延遲又可能直接決定體感。部署前至少要把 p50/p95 latency、成功率、輸出長度與重試次數分開量,不能拿一個 tokens-per-second 數字代替。

500K context 也應做同樣區分:它是 API 可接受的容量,不是模型在 500K 內每個位置都能可靠回憶的保證。Artificial Analysis 的 AA-LCR 使用約 100K-token 等級的文件組,Grok 4.6 得分 75.0%,低於 Sol max 的約 77.7%;但該測試並未覆蓋完整 500K 範圍,因此本文引用的公開資料不足以推論模型在接近視窗上限時仍能穩定召回與推理。長 repo 與長文件流程仍需要 retrieval、context 壓縮與分段驗證。

另一個常被 Grok 品牌印象遮住的邊界是即時性。xAI Models 文件列出的 Grok 4.6 knowledge cutoff 是 2026 年 2 月 1 日;要取得發布後的即時事件,必須在 agent 中明確啟用 Web Search 或 X Search。基礎 API 並不會因為出自 xAI,就自動知道所有 X 上的最新資訊。


5,718 萬次觀看:這是注意力證明,不是採用證明

來源發布時間觀看/points讚/comments
Grok Bot 官方 X8/11(UTC)約 3,167 萬 views約 3.17 萬 likes
Grok 4.6 官方 X8/12約 2,551 萬 views約 3.02 萬 likes
Grok 4.6 Hacker News8/12627 points606 comments
2026 年 8 月 14 日 19:28(台北時間)快照,X 數字依畫面四捨五入。Grok Bot 貼文在台北時區顯示為 8 月 12 日 01:09,但官方文章與 UTC 日期皆為 8 月 11 日。

Grok Bot 的觀看數比模型貼文還高約 24%,但兩者的讚數非常接近。這個差異不能推出 Bot 比模型更受歡迎,卻暗示「AI 同事在你離線後繼續工作」比另一個 benchmark 分數更容易讓廣泛讀者理解。換句話說,Grok 4.6 提供可信度,Grok Bot 提供想像力,兩者在 24 小時內互相放大。

X 對 view count 的定義,這是貼文被顯示的總次數,不是去重後的人數;同一帳號多次觀看也可能多次計入。因此它能衡量 reach 與話題性,不能代替盲測品質、企業採用或續用率。真正應該觀察的是:第三方 eval 能否重現長程 agent 改善、API 與 Bot 是否能穩定完成真實任務,以及使用者在 beta 新鮮感消退後是否留下來。


Grok Bot 的第一性原理風險:能力越大,錯一次的半徑也越大

純聊天介面的直接輸出通常停在文字;登入信箱、網站與內部工具的 agent 答錯時,可能真的寄信、修改資料或暴露憑證。Grok Bot 的價值來自三件事:持續在線、保留狀態、能採取行動。風險也恰好來自同三件事。尤其多個 Bots 共用同一位使用者的瀏覽器、檔案與 logins,一個遭誤導的工作流,影響範圍可能超過單一 Bot。

“No browser agent is immune to prompt injection.”

中文:「沒有任何瀏覽器代理能完全免疫 prompt injection。」

Anthropic 瀏覽器代理安全研究

這是整個 browser-agent 類別的威脅模型,不能拿來當作 Grok Bot 已存在漏洞的證據。不過 Bot 會一邊讀取不受信任的網頁與信件,一邊使用已登入帳號採取行動,正符合 prompt injection 最需要防守的情境。xAI 表示敏感操作「可以」經 Auto Review,也稱 Bot 需要批准時會回來詢問;截至 2026 年 8 月 14 日,本文核對的 launch article 與官方文件沒有承諾每一個不可逆操作都強制人工批准,也未列出 Bot 專屬的成功率、失敗率或紅隊數據。

因此早期 beta 最合理的測法是:只給低風險、可逆、可稽核的任務,使用權限較窄的專用帳號,保留送出/刪除/付款/管理員操作的人工 gate。先讓它整理資料、建立草稿、跑研究與製作報表;不要一開始就讓它代寄發票、刪除資料或操作 production。


AlphaLab 的判讀:61 分說明模型進展,持久代理代表產品轉折

判讀一:最重要的不是多 5 分,而是模型與工作介面同時移動

Grok 4.6 比 Grok 4.5 約多 5.16 個 Intelligence Index 分數,標準未快取牌價維持 US$2/US$6;另一條產品線上的 Grok Bot,則展示可持續運作的雲端環境。單看模型,xAI 是重返第一梯隊;把相鄰的 Bot 發布放回來看,真正的競爭已從「誰回答得最好」轉向「誰能保留狀態、操作工具並交付完成品」。這是 harness 與產品方向的轉折訊號;截至 2026 年 8 月 14 日,官方未揭露 Bot 與 4.6 的模型映射,更不等於可靠性已被證明。

判讀二:前沿模型的競爭正在從單價轉向 task economics

牌價只說明一個 token 多少錢,task economics 還包含 reasoning 長度、工具呼叫、重試、人工 review 與錯誤成本。Grok 的 output 牌價只有 Sol 的五分之一,Artificial Analysis 在 Intelligence Index workload 的加權 cost per task 卻大約只低三分之一,正好示範了這層差別。接下來模型商真正要競爭的,是「一次完成可靠任務」的成本,而不是價格頁上最小的數字。

判讀三:benchmark 不會替你完成路由決策

同一個 Grok 4.6,可以在 xAI 選取的四模型發布表中於 GDPVal-AA、AA-Briefcase 與 Harvey LAB 領先,也可以在 DeepSWE 1.1 與 Terminal-Bench v3.0 明顯落後。這不是 benchmark 互相打臉,而是不同工作真的需要不同能力。做研究交付、長程知識工作與產出文件的團隊,得到的排序可能和管理大 repo、修複雜軟體問題的團隊完全不同。

判讀四:500K 是容量承諾,不是可靠性承諾

大 context window 很容易變成行銷捷徑:看見 500K,就想把整個 codebase 或資料室一次塞入。實際上,更長的 prompt 可能增加延遲與成本,接近視窗上限時的可靠性仍要按實際長度測試。Grok 4.6 的正確用法不是取消 context engineering,而是讓良好檢索與壓縮策略擁有更大的安全邊際。

判讀五:持久代理放大便利,也放大權限與錯誤半徑

雲端電腦讓 agent 不受使用者筆電開關限制,這是真正有用的產品能力;但 persistent browser session 與共享 logins 也讓一次錯誤更有後果。未來勝負不會只看模型是否會用工具,而要看平台能否提供最小權限、逐步批准、可重播 audit log、每個 Bot 的隔離與可靠的回復機制。Grok Bot 把問題問對了,早期 beta 還沒有把答案交完整。

我同意的部分:Grok 4.6 已有足夠的第三方與官方數據,支持它重返前沿模型第一梯隊;在 Artificial Analysis Intelligence Index workload 上,它以接近 Sol max 的總分做到約低 32% 的加權 cost per task。Grok Bot 把登入狀態與持續執行移到雲端,也針對「筆電關閉後 agent 停工」提供直接解法。

我存疑的部分:「顯著提升」「更快」與「相同價格」都需要限定;Arena Text #44、Terminal-Bench v3.0 的落後、200K 長 context 倍率與較高 cached-input 價格,都不支持全面稱王。截至 2026 年 8 月 14 日,Grok Bot 官方文件也未列出成功率與安全量化資料。把觀看數、benchmark 與產品 demo 合在一起當成可靠性證明,會跨過證據邊界。

安全資訊的證據邊界:xAI 表示 Grok 4.6 已改善 safeguards,也表示 Bot 在需要批准時會詢問使用者;截至 2026 年 8 月 14 日,兩份發布資料都未提供可核對的量化安全結果。本文只把它們記為官方聲明,不把「沒有公開事故」寫成「已證明安全」。


你現在該怎麼做:API 跑十個任務,Bot 從低權限開始

你的主要需求較合理的起點上線前必測
知識工作、文件交付、長程 agent,且在意成本把 Grok 4.6 API 納入候選成功任務成本、輸出長度、工具重試
大型 repo、終端機與高難度軟體工程同時 shadow-test Grok、Sol 與其他 coding agent自己的 issue 集合,不用單一榜單代替
想讓 agent 在關機後繼續整理、研究與製作草稿用 Grok Bot beta 跑可逆任務專用帳號、最小權限、人工批准、audit trail
寄信、付款、刪除或 production 管理暫不全自動化每一步強制人工 gate 與可回復流程
已大量使用 Grok 4.5 prompt cache先重算遷移帳單cache hit rate 與 Grok 4.6 較高 cached-input 價格

最小可行做法是從 production 抽十個任務:三個最常見、三個最昂貴、兩個最容易失敗、兩個最需要長 context。固定工具與驗收規則,同時跑現用模型與 Grok 4.6,記錄成功率、總 token、工具費、重試、人工修正時間與 p95 latency。若測 Grok Bot,再加上「它能讀到什麼、能做什麼、哪一步必須等人」三欄。只有當每個成功任務的完整成本下降,而且錯誤半徑受控,才值得擴大權限。

接著閱讀

左右滑動查看更多推薦

Grok 4.6 最值得記住的,不是「61 分打敗了誰」;Grok Bot 最值得記住的,也不是「AI 終於能取代同事」。這兩次發布並列顯示,產業一邊提升模型,一邊把 agent 做成會保留狀態、跨工具執行、在人離線後繼續工作的系統;截至 2026 年 8 月 14 日,xAI 並未公開兩者的固定模型映射。接下來請同時保存一組可重跑的真實任務與一張權限清單;你要比較的是成功任務成本、人工介入次數與最壞錯誤半徑,而不是廠商挑好的冠軍數字或一支漂亮 demo。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。