跳到主要內容

Gemini 4 Argon:53 分並列前沿,Google 為何先開放資安防守?(2026)

最後更新: ·
Gemini 4 Argon 53 分,誰能用?

2026 年 9 月 30 日,Google DeepMind 首席 AI 架構師 Koray Kavukcuoglu 在 Google 官方部落格發布〈Gemini 4 Argon: our next era of frontier intelligence〉。這篇 Gemini 4 Argon 宣言把長時間軟體工程、企業知識工作與資安防禦放在同一張牌桌上;但模型目前先交給特定資安防守者測試,一般人還不能直接拿它驗證自己的工作。要理解這次發布,得把 Google 的承諾、外部測試與實際開放範圍分開看。

Gemini 4 Argon Google 原文頁面截圖,點擊閱讀公告
點擊圖片閱讀 Google 原文。圖/Google 官方部落格

Google 這篇公告究竟說了什麼?

原文的核心不是一款聊天產品立即上架,而是 Google 宣告一個能持續處理複雜任務的前沿模型,並以分階段開放來換取測試時間。它列出三組證據:公開評測表、Google 內部工程案例,以及資安防守與安全措施。最後的訴求很明確:先讓可信任的測試者找出能力與風險邊界,再擴大到開發者、企業與消費者。

Safely releasing frontier capabilities at this level requires a phased approach.

中文:要安全釋出這種等級的前沿能力,需要分階段進行。

Koray Kavukcuoglu,Google 官方公告

Google 說,Argon 正透過 Fairwind Program 向一批受信任的資安防守者推出,之後才計畫擴大。這是「宣布模型與有限測試」,不是對所有 Gemini 使用者或 API 客戶開放。Google 同時提出可藉由續接機制形成 100 萬 token 輸出軌跡、編碼與企業工作流能力,以及對間接提示注入、濫用與代理失控的防護;這些主張需要放回各自的測試條件看。

53 分的外部測試,支持了什麼?

Artificial Analysis 於 9 月 30 日公布的原始評測,把高推理設定的 Gemini 4 Argon 評為 Intelligence Index 53 分,與 GPT-6 Astra 的 max 設定同分。這是同一套綜合指標上的並列,不等於兩者在每種任務都打平,更不代表一般使用者已能取得同樣設定。

細項比總分有用:Artificial Analysis 報告 Argon 在 AutomationBench-AA 得 78%,Terminal-Bench 4.0 約 57%;但 Terminal-Bench 仍落後於其列出的幾款競品。它在 AA-Omniscience 的幻覺率為 15%,同時正確率為 50%。較少亂答,部分來自更願意承認不知道;把「低幻覺」直接翻成「答案最準」會忽略這個取捨。這些是評測機構在特定設定與題集觀察到的結果,AlphaLab 沒有取得 Argon 進行獨立重跑。

Google 原文也使用第三方基準。Vals AI 的模型結果頁列出 Vals Index 68.90%(誤差約 ±0.97 個百分點);原文下圖把這項結果和幾款競品並排。讀圖時要留意:這是特定知識工作題庫與配置下的表現,不是企業導入後的生產力增幅。

Google Gemini 4 Argon Vals Index 評測比較圖
Google 公告中的 Vals Index 比較圖;Vals AI 公開結果列出 Argon 為 68.90%。圖/Google

工程成果與資安能力:哪些仍是 Google 的說法?

Google 描述 Argon 代理分析資料中心遙測、已釋出超過 300 TiB 記憶體,並估計還有更大的節省空間;它也描述 C/C++ 到 Rust 的大型遷移、量子演算法優化,以及 libgav1 Rust 版本的效能改進。這些例子顯示 Google 看重的是模型在工具、測試與反覆修正組成的流程裡能否產生價值。它們目前仍是 Google 的內部報告;其中核心程式碼遷移,原文也明說正接受自動與人工審查,不能把「產生了程式碼」寫成「已安全部署」。

Argon can autonomously find, validate, and patch critical software vulnerabilities.

中文:Argon 可以自主尋找、驗證並修補重大軟體漏洞。

Koray Kavukcuoglu,Google 官方公告

這是原文最需要對帳的能力宣稱。Google 圖表顯示 Argon 在 CWE-bench v1 的修補通過率為 68%,在 pass@1 指標上與其他最高分模型同為 68%;官方榜單再用 pass@4 破同分,因此不能把它寫成獨佔第一。但「基準題能修補」與「在真實系統中找到可利用漏洞並安全上線補丁」隔著授權範圍、誤報、回歸測試和人工審核。Google 的評測方法文件也說,部分資安測試用內部資料集與 Wiz 內部滲透測試題,外界難以直接重跑。

Gemini 4 Argon CWE-bench v1 資安修補評測圖
Google 公告中的 CWE-bench v1 圖表:Argon 的 68% 是特定修補測試通過率。圖/Google

AlphaLab 的判讀:領先訊號與開放落差同時存在

一、總分並列是真的,工作流勝率還沒定案

Artificial Analysis 的 53 分足以把 Argon 放進前沿候選名單;它的代理工作流、較低幻覺率,也讓 Google 的「長任務」主張有外部支撐。但同一份報告顯示各細項勝負不一。真正的選型仍要看你的任務、代理框架、延遲、失敗成本,以及同一題多次運行的穩定度。GPT-6.1 Sol 與 Astra 的成本比較提供了另一個看「分數換成本」的切角。

二、現在的低價是促銷價,不是長期成本

Google 公告列的每百萬輸入/輸出 token 2/10 美元是推出初期價格;原文註腳寫明促銷期過後會變成 4/20 美元。Artificial Analysis 以現價估算每題約 1.99 美元,標準價下估計約 3.98 美元。促銷何時結束尚未有明確日期;用目前的價格宣布 Argon 長期更便宜,證據不夠。更大的輸出額度也意味著代理若反覆展開長軌跡,必須看每題總 token 與完成成本,而非只看單價。

三、有限開放既是安全策略,也是驗證限制

資安模型同時能幫助守方與攻方,Google 先讓受審核的防守者使用,有合理的風險管理理由;但公開評測與受控試用,還不足以讓一般團隊查證它在自己資料、權限與系統上的交付率。Google 的 Fairwind 頁面描述申請、身分審查與使用限制;而 另一篇資安模型分析提醒我們,漏洞能力的宣傳數字必須連同測試條件一起讀。

所以我同意 Google 傳達的方向:前沿模型的競爭已延伸到長流程與資安防禦,外部 53 分確實值得關注。我保留的判斷是:內部節省與大型程式遷移能否普遍複製、限量測試能否擴成可靠服務,以及標準價下的完成成本。這三件事都要等可用性與更多外部實務資料,不能由發布日的榜單替代。

接下來該看什麼?

如果你正在選模型,先把 Gemini 4 Argon 放進待測名單,別急著改動生產流程。等 Google 公布可申請的 API 範圍後,拿固定的真實任務比較成功率、人工返工、總費用與等待時間;資安用途還要把授權、漏洞驗證與補丁回歸測試分開記錄。若你關心代理會自行推進多少工作,常駐代理的權限分析可作為設計驗收邊界的參照。下一個真正的轉折點,是一般開發者可以用相同條件反覆跑出可靠結果,而不只是看到一個並列的分數。

接著閱讀

左右滑動查看更多推薦

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。