2026 年 9 月 22 日,Artificial Analysis 在官網發布〈GPT-6 Sol and Luna push the cost efficiency frontier〉,把 GPT-6 Sol、GPT-6 Luna 放進自家的能力、Coding Agent、知識可靠度與成本評測。最值得注意的結論不是「新一代全面變強」,而是 API 單價大幅下降後,兩款模型用接近前代的綜合能力,把每題成本往下推了一截;同一份報告也記錄了知識工作退步與更常拒答的代價。
這篇會先忠實整理原文,再用 OpenAI 的發表文、模型文件與定價頁逐一核對,最後回答一個實際問題:當 Token 變便宜、分數沒有同步上升時,什麼情況值得換模型,什麼情況只是把失敗做得更便宜?

原文的核心主張:這是成本曲線前移,不是能力全面跳級
Artificial Analysis 的主張可以濃縮成兩句話。第一,GPT-6 Sol、Luna 的標準 API 單價大約降到前代的一半;第二,在它的 Intelligence Index 與 Coding Agent Index 裡,總體能力沒有出現同幅度躍升,而是有進步、有持平,也有退步。
“This is driven by the price cut, as both models use slightly more output tokens per task.”
中文:這主要由降價推動,因為兩款模型每題其實都使用了稍多的輸出 Token。
Artificial Analysis
這句話把新聞的本質講得很準:效率改善主要來自價格,不是模型突然用更少 Token 完成工作。Sol 每題平均輸出約 31k Token,前代約 29k;Luna 約 51k,前代約 41k。單次任務變便宜是真的,但原因和「推理更精簡」不同。
價格先核對:2/10 美元與 0.10/0.50 美元是真的
OpenAI 的官方 API 定價頁與兩張模型卡都能交叉確認短上下文標準價。每百萬 Token:
| 模型 | 輸入 | 快取輸入 | 輸出 | 相較前代 |
|---|---|---|---|---|
| GPT-6 Sol | US$2.00 | US$0.20 | US$10.00 | 輸入、輸出皆降 50% |
| GPT-5.6 Sol | US$4.00 | US$0.40 | US$20.00 | 比較基準 |
| GPT-6 Luna | US$0.10 | US$0.01 | US$0.50 | 輸入降 50%,輸出降約 58% |
| GPT-5.6 Luna | US$0.20 | US$0.02 | US$1.20 | 比較基準 |
不過「2/10」與「0.10/0.50」不是所有請求的單一價格。GPT-6 Sol 與 GPT-6 Luna 模型頁都寫明:輸入超過 272k Token 時,整個請求的輸入與快取費率變成 2 倍,輸出變成 1.5 倍;Batch/Flex 是標準價的一半,Fast mode 則是適用價格的 2 倍。只看發表文裡最醒目的兩個數字,會低估長上下文 Agent 的真實帳單。
每題成本下降多少?Sol 約省 47%,Luna 約省 61%
在 Artificial Analysis Intelligence Index v4.3.2 的 max effort 設定中,GPT-6 Sol 每題成本是 US$1.06,GPT-5.6 Sol 是 US$1.99,約下降 47%;GPT-6 Luna 是 US$0.07,前代是 US$0.18,約下降 61%。這是原評測團隊在指定任務、指定 effort 與當時 API 價格下觀察到的結果,不是任何工作負載都會自動得到的固定折扣。

能力端的變化小得多:Sol 的整數顯示值由 47 到 48,Luna 維持 37。Artificial Analysis 的方法頁指出,v4.3.2 把十項評測加權成一個總分,並估計整體指數的 95% 信賴區間小於 ±1%。因此,Sol 的一分差距更適合讀成「大致同一級、成本更低」,而不是確定的世代飛躍。
Coding Agent:Sol 小升,Luna 反而退兩分
同一份報告在 OpenAI Codex harness 下測 Coding Agent Index。GPT-6 Sol max 得 57 分,GPT-5.6 Sol max 是 55;GPT-6 Luna max 得 41,前代是 43。換句話說,Sol 在這組 coding 任務小幅前進,Luna 則沒有守住前代分數。

這裡最容易犯的錯,是把「更便宜」和「更適合」合成同一個結論。若一個 Luna 任務本來就能穩定通過驗收,成本下降非常有價值;但若少兩分剛好落在你的關鍵失敗型態上,節省的 API 費可能被重試、人工接手與錯誤修復吃掉。真正該比較的不是單次呼叫,而是每次驗收通過的總成本。
幻覺率看似大降,其實有一部分是「更願意說不知道」
AA-Omniscience 是這次最值得慢讀的一組結果。Artificial Analysis 報告稱,Sol max 的幻覺率由 92% 降到 60%,Luna 由 93% 降到 77%。但它的「幻覺率」不是日常對話中所有回答的錯誤率,而是該評測定義下,在非正確回答中有多少屬於錯答,而不是拒答。

AA-Omniscience 方法對拒答不扣分。Sol 回答題目的比例由 99% 降到 83%,因此錯答少了,但整體準確率也由 59% 降到 54%;Luna 的準確率則由 43% 到 44%,大致持平。這不代表改善是假的,而是改善包含一個產品取捨:少猜一點,少答一點,可靠度指數更好,但覆蓋率也下降。
知識工作退步:短回答可能省 Token,也可能漏掉交付要求
原文最不利於「全面升級」敘事的證據,來自 GDPval-AA v2.1 與 AA-Briefcase v1.1。Artificial Analysis 觀察到,Sol 在 GDPval-AA 約下降 100 Elo,Luna 約下降 75;Luna 在 AA-Briefcase 另降約 45 Elo,Sol 大致持平。團隊表示,人工檢查數百份輸出後,退步常與呈現品質下降、交付物漏掉 rubric 項目有關。

這一段必須保留邊界。GDPval-AA 與 AA-Briefcase 含私有任務、模型評審與版本化方法,外部讀者無法只靠文章重現完整結果;本文也沒有把它改寫成 AlphaLab 實測。它能支持的,是「Artificial Analysis 在指定設定下量到退步」;不能直接推出「所有報告、簡報、法律或研究任務都會變差」。
OpenAI 的發表為什麼看起來更樂觀?兩邊測的不是同一組工作
OpenAI 的官方發表文把這次定位為整個家族的能力與成本效率升級,列出 AutomationBench、Agents’ Last Exam、FrontierCode、DeepSWE 與 OSWorld 等結果;其中既有外部 benchmark,也有 OpenAI 自己的 factuality 與 alignment 評測。
“Together, these improvements make advanced AI practical for more everyday tasks and applications at scale.”
中文:這些改善合在一起,讓進階 AI 更適合日常任務與大規模應用。
OpenAI
官方數據和 Artificial Analysis 不必互相否定。它們的任務、harness、effort、評分方式與成本計算都不同;OpenAI 的結果可以支持「某些 Agent、coding 與電腦操作設定進步」,AA 的結果則支持「跨十項評測的總分大致持平,部分知識工作退步」。把任何一張表當成模型的永久身分證,才是錯誤的讀法。若想先補足榜單的判讀方法,可搭配 AI 模型排行榜交叉判讀。
AlphaLab 的判讀:GPT-6 Sol、Luna 真正改變的是選型門檻
1. 我同意:這是一個重要的經濟性更新
當模型已經達到任務需要的最低品質,價格下降會直接擴大可行工作量。批次分類、資料抽取、初稿生成、低風險程式維護與大規模 Agent 子任務,可能不需要 Astra 等級的最高能力;Sol 或 Luna 只要通過相同驗收,就能讓更多迭代進入預算。
2. 我存疑:不能把 Pareto frontier 寫成全面能力突破
Pareto frontier 的意思,是在某個品質水準下沒有更便宜的選項,或在某個成本下沒有更高分的選項;它不是「所有能力最強」。這次最穩健的結論是價格/能力組合變好,而不是底層模型在每一種工作都勝過前代。想看「同分不等於同能力輪廓」的完整例子,可延伸讀 Fable 5.1 vs GPT-6 Astra 雙榜比較。
3. 單價、每題成本、每次成功成本,是三個不同問題
API 單價只告訴你每個 Token 多貴;每題成本還會受到輸入長度、輸出長度、推理 effort、快取命中與工具迴圈影響;每次成功成本則要再把失敗與重跑算進去。最有用的分母是:
每次驗收通過成本 = 全部測試花費 ÷ 通過驗收的任務數
如果一個模型便宜 60%,卻讓通過率由 95% 掉到 70%,它不一定更省;反過來,如果品質守住,降價就是實質進步。
4. 「少說」可能同時降低幻覺與交付完整度
Sol 在 AA-Omniscience 更常拒答,知識可靠度指數因此改善;但知識工作評測又出現較短、漏項的交付物。兩者指向同一個可能的產品性格:更克制的回答在事實問答可能是優點,在需要完整清單、長報告或多項交付的任務卻可能變成缺口。評估時不能只看平均分,要特別檢查漏項率。
實際怎麼選:用 30 題影子評測決定是否切換
- 抽 30 個真實任務:包含最常見、最昂貴、最容易出錯的三類,不要只挑模型擅長的題目。
- 凍結輸入與驗收:同一 prompt、工具、資料、effort、timeout、rubric 與隱藏測試,舊模型和新模型各跑多次。
- 同時記錄四項:通過率、漏項率、人工修正時間、總 Token/總成本。長上下文請另開一組,避免把 272k 以上的費率混進一般請求。
- 先設品質底線:只有新模型達到底線,才比較每次驗收通過成本;低於底線就不因單價便宜而上線。
- 分層路由:可重試、低風險、高量任務先測 Luna;複雜 coding/Agent 任務先測 Sol;高風險或最高品質需求保留更強模型,再以真實結果調整。
若團隊已經有正式服務,不要直接全量替換。先讓 GPT-6 Sol 或 Luna 在旁路處理同一批請求,不影響使用者,再用既有輸出做盲評。遇到模型分數突然變動,也可用 AI 模型 Shadow Eval 的方法拆開模型回歸、harness 變更與路由漂移。
常見問題
GPT-6 Sol 比 GPT-5.6 Sol 強嗎?
不能用一句話概括。Artificial Analysis 的綜合指數是 48 對 47、Coding Agent Index 是 57 對 55,但 GDPval-AA 約退 100 Elo。比較穩健的說法是:部分 Agent/coding 指標進步,總體接近前代,知識工作有退步訊號。
GPT-6 Luna 適合取代所有小模型嗎?
不適合直接這樣推論。它的價格極低,但 Coding Agent Index 比前代低兩分,輸出 Token 也更多。高量、可驗收、低風險任務值得優先測;缺少明確驗收的高風險工作,不應只靠單價決定。
為什麼「幻覺率下降」不等於「準確率上升」?
因為 AA-Omniscience 對拒答不扣分。Sol 更常選擇不答,錯答比例下降,但所有題目的正確率反而由 59% 降到 54%。可靠度、準確率與回答覆蓋率必須一起看。
API 帳單真的會直接減半嗎?
不一定。標準短上下文單價大致減半,但實際帳單還取決於 Token 用量、長上下文倍率、快取、effort、工具呼叫與重試。Artificial Analysis 的每題成本確實下降約 47%/61%,但那是指定評測配置的結果。
接著閱讀
左右滑動查看更多推薦
結論:先確認便宜的答案仍然能交付,再放大用量
GPT-6 Sol、Luna 最確定的進步,是把價格/能力曲線往前推;最不該誇大的,是把它寫成每一種能力都跨代升級。先拿真實任務跑影子評測,守住通過率與完整度,再比較每次驗收通過成本。只要品質底線沒有掉,便宜一半會是很大的產品優勢;如果漏項與返工變多,低單價只是把成本從 API 帳單移到人的時間裡。






