2026 年 9 月 29 日,Artificial Analysis 在官網發布〈GPT-6.1 Sol replaces GPT-6 Sol after just 7 days, with near-Astra intelligence〉,把 GPT-6.1 Sol 的新測試結果放到「能力接近旗艦,單題成本卻低得多」的框架下。這篇先還原原文的測量,再對照 OpenAI 官方發布,最後回答更實用的問題:你的任務是否真的能用較便宜的模型完成。

GPT-6.1 Sol 的原文主張:接近,不等於相同
這篇文章的核心是一次價值曲線移動:GPT-6 Sol 發布七天後,GPT-6.1 Sol 在 Artificial Analysis 的綜合 Intelligence Index 提高 4 分;在最高推理設定下,它拿到 52 分,GPT-6 Astra 為 53 分。原文同時量到每件指標任務的平均 API 成本約為 0.72 美元與 3.26 美元,兩者相差約 4.5 倍。這是特定測試集合、模型版本及推理設定下的觀察,不是每一項工作都能照比例省錢。
It scores 1 point below GPT-6 Astra in the Intelligence Index at less than one quarter of the Cost per Task.
中文:在 Artificial Analysis 的綜合指標中,它比 Astra 低 1 分,而每題成本不到 Astra 的四分之一。
Artificial Analysis,2026 年 9 月 29 日
這裡的「每題成本」是評測者用受測任務、輸入與輸出 token 消耗和 API 單價計出的平均值;它不同於 API 價目表,也不等於你自己的成功任務成本。若便宜模型要重試、需要人工修補或呼叫更多工具,表面上的 token 節省可能縮水。

編碼代理的圖表:設定差異會改變勝負
Artificial Analysis 另一張圖將 DeepSWE v1.1、Terminal-Bench 4.0 與 SWE-Atlas-QnA 組成 Coding Agent Index。圖中 GPT-6.1 Sol 在 max 設定為 60 分,Astra max 為 62 分;同一 Sol 模型改為 xhigh 則得 63 分。這說明「哪個模型較強」必須連同推理強度、Agent 工具與評測規則一起讀。原文還指出 Sol 比舊版 Sol 多用約 10%~30% 輸出 token,較低的單位價格並非唯一成本變數。

GPT-6.1 Sol 的官方資料支持哪些結論?
OpenAI 官方發布列出的 GPT-6.1 Sol 標準 API 價格是每百萬輸入 token 2 美元、輸出 token 10 美元、快取輸入 token 0.10 美元;Astra 的標準輸入與輸出單價分別為 10 與 50 美元。單位價格因此是五分之一,但實際帳單仍由 token 用量、快取命中率與任務重試決定。這也解釋為何 Artificial Analysis 量到的單題比率不是整齊的五分之一。
OpenAI 另報告 DeepSWE v1.1、OSWorld 2.0、GDP.pdf 與 Terminal-Bench Science 等不同任務的提升。這些是 OpenAI 的研究環境或 API 評估;官方註明生產環境可能因系統提示、工具與推理設定而有差異。它在 OSWorld 2.0 離線集合的最高推理設定中,仍比 Astra 低 2.1 個百分點。官方的事實性測試則選自使用者曾標記錯誤的難題,不能拿來推算一般對話的錯誤率。
供應範圍也要讀精確:OpenAI 於發布日表示,付費方案的 ChatGPT Work 與 Codex 可用 GPT-6.1 Sol,開發者可在 API 使用 gpt-6.1-sol;同篇發布文寫明一般 Chat 當時尚未提供。這是 2026 年 9 月 29 日的發布狀態,不是對日後介面的永久判斷。
AlphaLab 的判讀:真正的分母是完成一件合格工作
一分的差距,可能藏著任務分布
綜合指標把多種題目壓成一個分數;兩個模型分數接近,只能說在這組權重下接近。你若做的是長時間科學研究、電腦操作或某一類程式碼修復,應看相應子項及失敗型態。OpenAI 自己在 Terminal-Bench Science 0.1 指出,Astra 仍取得受測模型中的最高分。對高代價錯誤的流程,一次失敗就可能吃掉價格優勢。
價格下降會擴大可測試的任務
更低的邊際成本,讓團隊能把更多候選任務交給 Agent 試做,也能為同一任務保留多次驗證與回退的預算。這比宣稱「中階模型取代旗艦」更可靠:較便宜的模型可以先處理常見任務,難題再升級,但這個分流規則必須由你自己的合格率與總成本校準。
一次選型,應同時計入人工與延遲
比較 Sol、舊版 Sol 與 Astra 時,固定同一批真實任務、相同工具權限及驗收標準,記錄每次成功率、API 花費、耗時和人工修補時間。若需要重試,把重試算在同一件工作的成本裡。可以參照我們對 Claude Sonnet 5.5 跑分與成本、Holo4 模型與 Harness 的分析,避免把單一跑分誤讀成整套系統的能力。
現在該怎麼做?
若你已經有穩定的 Agent 任務,先挑 20~50 件可重跑且有明確驗收的工作,讓 GPT-6.1 Sol 與現用模型在相同設定下各跑一次;比較「合格任務的總成本」,再決定哪些工作預設用 Sol、哪些保留 Astra。若還沒有任務收據,先建立輸入、工具版本、驗收結果與人工修補紀錄,再談省錢。想把這個方法用在多模型流程,可接著看 Opus 與 Codex 接力驗收;若你要設計同題選型測試,Sonnet 與 Opus Effort 比較教學也提供一套可操作的驗收框架。
接著閱讀
左右滑動查看更多推薦






