GPT‑5.6 Luna 降價 80%:OpenAI 把 AI Agent 成本曲線改寫了嗎?(2026)

最後更新: ·
GPT‑5.6 Luna 降價 80%:OpenAI 官方 price-performance 視覺與 AlphaLab 標題卡

2026 年 7 月 30 日,OpenAI 在官網發布了〈Advancing the price-performance frontier with GPT‑5.6〉,宣布 GPT‑5.6 Luna 降價 80%:標準短上下文 API 的 input/output 價格,降至每百萬 tokens US$0.20/US$1.20。Terra 同步降價 20%;Sol 的 Priority Processing 則更名為 Fast mode,OpenAI 稱其速度最高可達 Standard 的 2.5 倍,價格為 2 倍。

先把界線說清楚:這不是 GPT‑5.6 新模型發布。GPT‑5.6 家族已在 7 月 9 日正式推出;7 月 30 日改的是價格與 serving tier。真正值得在意的,也不是 benchmark 又多了幾分,而是同一筆預算現在能買到約 5 倍的 Luna tokens——大量分類、文件抽取、背景 coding worker 與多代理驗證,突然有了不同的成本答案。

先把 OpenAI 原文放在桌上。點擊下面截圖會在新分頁開啟全文;接下來我會先忠實整理公告,再查價格、速度與外部數據,最後回答一個更實際的問題:便宜 80% 的 token,究竟能不能變成便宜 80% 的成果?

GPT‑5.6 Luna 降價公告原文截圖:OpenAI 2026 年 7 月 30 日發布的價格效能文章
OpenAI〈Advancing the price-performance frontier with GPT‑5.6〉原文。點擊圖片前往閱讀(另開新分頁)。

一、GPT‑5.6 Luna 降價 80%:價格到底怎麼變?

OpenAI 的核心句很直接:

“GPT‑5.6 Luna, our fastest and most affordable model, will cost 80% less.”

中文:「GPT‑5.6 Luna 是 OpenAI 最快、最便宜的模型,價格將下降 80%。」

— OpenAI,2026 年 7 月 30 日
API 模式先前 input/output7 月 30 日起 input/output變化
GPT‑5.6 Luna StandardUS$1/US$6US$0.20/US$1.20−80%
GPT‑5.6 Terra StandardUS$2.50/US$15US$2/US$12−20%
GPT‑5.6 Sol StandardUS$5/US$30US$5/US$30不變
GPT‑5.6 Sol Priority → FastUS$10/US$60US$10/US$60價格不變;為 Standard 的 2×
每百萬 tokens 的 input/output 價格;Standard 欄為不超過 272K input 的短上下文。價格依 OpenAI 2026 年 7 月 31 日價目表整理。

80% 與 20% 都不是修辭,而是精準算術:Luna 的 input 從 US$1 降到 US$0.20、output 從 US$6 降到 US$1.20;Terra 則從 US$2.50/US$15 降至 US$2/US$12。Luna 官方 model card同時列出 cached input 為 US$0.02、cache write 為 US$0.25。

但頭條省略了三個邊界。第一,這是 Standard 短上下文價:input 超過 272K 後,整筆 Luna request 會按長上下文的 US$0.40/US$1.80 計費。第二,Batch 與 Flex還有另一套折價。第三,ChatGPT 與 Codex 的訂閱月費、quota budget 沒有下調;改變的是 Terra/Luna 消耗較少 credits。換句話說,不能把「Luna API 標價降 80%」改寫成「所有 OpenAI 使用者帳單都降 80%」。

時間線也很重要:OpenAI API changelog把 7 月 9 日標為 GPT‑5.6 家族發布,把 7 月 30 日標為價格與 Fast mode 的 update。這篇文章談的是成本曲線,不是 Luna 換了一個新模型。


二、原文真正推銷的不是 Luna,而是「分層用模型」

OpenAI 的完整論點不是「便宜模型可以取代一切」,而是每個工作階段都只買剛好夠用的智能。高風險、資訊不足、需要規劃的節點交給 Sol;規格清楚、可測試、可重跑的執行工作交給 Luna;日常綜合任務則由 Terra 接住。

公告甚至直接給了一個 coding workflow:Sol 先釐清不確定性與制定計畫,Luna 再實作明確修改、撰寫與執行測試、評估結果。這和「一個最強模型包辦整條 agent loop」是不同產品哲學,也正好呼應 AlphaLab 的AI 模型路由小型 Eval 實作:模型選擇應該是任務路由問題,不是品牌忠誠問題。

GPT‑5.6 Luna 降價文章圖表:OpenAI 以 Artificial Analysis Intelligence Index 對照每任務成本
圖/OpenAI:公告把 Luna 的多個成本/分數 operating points 與其他模型放在同一張圖。圖中藍點沒有逐一對應具名推理設定,適合看方向,不宜把單點讀成所有工作負載的保證。

這張圖的底層分數來自 Artificial Analysis,但圖的選樣、每任務成本估算與結論仍由 OpenAI 呈現。OpenAI 進一步主張,Luna 相較一年前的 frontier-class 模型,每任務成本約只剩 6%、速度接近 9 倍;在 Agents’ Last Exam 上,成本估算比 Fable 5 低近 99%。這些是有數據外觀的官方比較,卻不是跨供應商、同 harness、同驗收門檻的獨立審計。

六則客戶案例也應用同一把尺閱讀:Notion 說 Terra 在內部 eval 達到近似 GPT‑5.5 的品質、每任務成本約一半且時間少 60%;Blitzy 報告 Luna 讓 cache reuse 從 24% 升到 90%、output tokens 大減,對 GPT‑5.4 mini 成本低 87%;Dust 則稱同類 agent 任務快 40%、便宜 40%。這些都是值得注意的 production signals,但原文只提供結果摘要,資訊不足以讓讀者重跑其樣本、rubric、失敗分布與比較基線;本文不把它們當成獨立驗證


三、為什麼大家興奮?同一筆預算可以買五次 Luna

如果 token 用量完全相同,GPT‑5.6 Luna 降價 80% 的直接效果很簡單:原本只能跑一次的預算,現在可以跑五次。這不會讓單次答案自動變聰明,卻讓 parallel sampling、critic、重試、交叉驗證與低價 worker 變得更容易負擔。

大量分類:最直接受益,也最容易驗收

假設每筆都在 Standard 短上下文、沒有快取/工具/區域處理加價,API 實際計費用量為 2,000 input tokens 與 50 output tokens(包含 reasoning 用量),新 Luna Standard 約為 US$0.00046/筆;跑 100 萬筆約 US$460,若工作適合非同步、24 小時 completion window 的 Batch,則約 US$230。先前同量 Luna token 約 US$2,300。分類有 labeled holdout set、precision/recall 與錯誤類別可查,這是最容易把降價兌現成成果的場景。

文件處理:經濟性改善,不等於長文件突然可靠

沿用 Standard 短上下文、沒有快取/工具/區域處理加價的假設,一份 100K input+1K output 的文件,純 token 約 US$0.0212;100 萬份約 US$21,200,Batch 約 US$10,600。這足以讓許多過去不值得跑的抽取、摘要、分類與索引開始算得過來。

但「能放進 1.05M context window」不等於「能可靠利用 1.05M」。OpenAI 自己的GPT‑5.6 評測表顯示,Luna 在 MRCR v2 的 256K–512K 與 512K–1M 區間都是 41.3%,GraphWalks BFS 1M 為 51.2%。這些特定測驗不能代表所有文件任務,卻足以提醒你:context capacity、有效檢索與正確抽取是三件事。chunking、retrieval、結構化 schema 與確定性檢查仍然重要。

背景 coding agent:最適合可測試、可回滾的工作

機械性修改、補測試、分類 issue、依既定 plan 實作,確實更適合交給廉價 worker;OpenAI 將 7 月 30 日列為價格與 Fast mode 更新,該公告未公布新的 Luna 權重或新增品質 benchmark,品質判斷仍須沿用 7 月 9 日的模型評測與自己的 eval。低價最可能把瓶頸從「token 太貴」推向「測試、sandbox、review 與錯誤清理不夠」。這也是為什麼AI 代理人比人更難管理:便宜的錯誤如果會污染 codebase 與後續 context,最後仍可能比一次用對模型更貴。

多代理:五倍呼叫額度,不是五倍成果

同 token 規模下,一個 root 加四個 Luna workers 的新 token 費,約等於先前一次 Luna 呼叫。這會鼓勵更多平行探索;多代理是否值得,高度取決於任務能否拆解及訊息能否驗證。2026 年一篇 Nature Machine Intelligence 研究在 matched-compute 條件下發現:集中式多代理在可平行的 Finance Agent 任務,整體表現比單代理高 80.8%;到了高度序列化的 PlanCraft,四種多代理架構反而低 39.1% 至 70%,其中集中式架構低 50.3%。架構與任務是否匹配,比 agent 數量更重要;想把這件事做成可重跑流程,可參考 AlphaLab 的多 Agent 工作圖教學

社群反應也反映了這個張力。截至 2026 年 7 月 31 日 16:40(台北時間)Hacker News 討論串已到 570 points/370 comments。有留言者說自己已跑 10 個 workers,並想像同預算可擴到 50 個;另有留言者分別質疑更多步數、不佳輸出,以及留在 codebase 的錯誤內容會推高實際成本。HN 能證明關注度,不能證明品質。


四、80% 的 token 降價,不是 80% 的成果成本下降

真正該追的指標不是 price per token,而是 cost per accepted outcome

每個可接受成果成本 =(模型 tokens+工具+sandbox+重試+人工 review)÷ 通過驗收的成果數,再加上未偵測錯誤的預期損失。

如果舊總成本裡只有一半來自 Luna tokens,其他一半是 web search、container、review 與失敗處理,而且工作量、Luna token 用量與其他成本都不變,那麼單純由此次價格調整帶來的總成本降幅就是 40%。可寫成:

在工作量、Luna token 用量與其他成本不變時,總成本降幅 = 80% × 舊總成本中的 Luna token 占比。

工具價格是另一條成本線:OpenAI 2026 年 7 月 31 日價目表中,web search 為 US$10/1,000 calls,另按模型費率計 search-content tokens;Responses API 的 file search tool call 為 US$2.50/1,000 calls,另有 US$0.10/GB/日 storage、首 1 GB 免費。1 GB hosted shell/code interpreter 的表列價格為 US$0.03/20 分鐘;符合資格的 session 按分鐘計費、最低 5 分鐘。當 Luna 本身非常便宜時,這些固定或半固定成本會更快變成主角。

「快」也要拆成不同軸。截至 7 月 31 日,Artificial Analysis 的 Luna max 頁面在 10K input、過去 72 小時 P50 的 OpenAI provider 測量中,記錄約 184.4 output tokens/秒,以及 116.5 秒的 time to first answer token;output speed 從第一個 chunk 後開始量,後者則依其定義包含模型 reasoning/thinking 的等待,不能寫成一般 TTFT。這不矛盾:首段答案出現後的輸出很快,不代表等待可見答案或完成整個 agent 任務也快。互動式產品要看首個答案等待、p95 latency 與端到端時間;背景批次則更在意總吞吐與每個成功結果成本。


五、Sol Fast mode:用兩倍價格買時間;OpenAI 稱 intelligence 不變

Fast mode 是另一條完全不同的更新:Priority Processing 更名,Sol 的 serving 速度提升,而價格仍是 Standard 的兩倍。原文的精準措辭是:

“up to 2.5× faster speeds than Standard processing at twice the price”

中文:「速度最高可達 Standard processing 的 2.5 倍,價格則是兩倍。」

— OpenAI,GPT‑5.6 Sol Fast mode

三個詞不能省略:Sol、最高可達、兩倍價格。這不是 Luna 的速度承諾,也不是平均 2.5×。Fast mode 官方文件還列明不支援 long context、fine-tuned models 與 embeddings;既有標記為 priority 的 request 會向後相容。至於 intelligence 不變,本文把它視為 OpenAI 對同模型、不同 service tier 的產品聲明,而非獨立結論。

最實用的決策規則是:只有當省下的等待時間價值高於額外 token 費,才開 Fast。即時客服、互動 coding 與關鍵人工流程可能值得;夜間批次、背景分類與離線文件管線,通常更適合 Standard、Batch 或 Flex。


六、這 80% 是 AI 自己省出來的嗎?官方證據只到 20%+15%

OpenAI 把這次降價放進一個更大的敘事:GPT‑5.6 Sol 幫工程團隊改寫 production kernels、設計實驗與監控訓練,形成「AI 改善 AI serving」的回饋迴圈。相鄰的工程文章量化了兩件事:kernel 工作讓 end-to-end serving cost 下降 20%,另一批實驗讓 token-generation efficiency 提升超過 15%。

這兩個數字不能直接相加成 35%,更不能推導出 Luna 售價為何能降 80%。模型架構、routing、硬體利用率、prompt caching、供應合約、競爭與商業定價都可能參與其中;截至 2026 年 7 月 31 日,上述 7 月 29–30 日官方文章只量化前述兩項改善,未提供 Luna 的單位成本拆解,因此公開資料無法量化各項 serving 改善對 80% 降價的貢獻。比較準確的說法是:OpenAI 公開了一部分 serving 改善,也選擇把 Luna 標價降 80%;公開資訊不足以判定兩者各自貢獻多少。想看 Sol 實際做了哪些優化,可接著讀GPT‑5.6 Sol 推論優化深度解讀


七、AlphaLab 的判讀:真正稀缺的,從 token 轉向驗證

判讀一:價格曲線真的變了,但品質曲線沒有在 7 月 30 日重畫

我同意這是一個立即生效、足以改變產品設計的降價。分類、抽取、監控、候選生成與可丟棄的背景工作,現在能用更低門檻試做。OpenAI 將 7 月 30 日列為價格與 Fast mode 更新;該公告未公布新的 Luna 權重或新增品質 benchmark。若你的 Luna eval 昨天不過關,今天不會因為帳單便宜就突然過關。

判讀二:省下的預算,應優先買獨立樣本與確定性檢查

最差的用法,是讓五個 agent 無限互聊;更好的用法,是讓多個 worker 獨立產生候選,再用測試、schema、規則與較強模型集中驗證。廉價推理把「多試幾次」變便宜,卻沒有把「知道哪一次是對的」一起商品化。

判讀三:模型正在商品化,harness 與私有 eval 反而更像護城河

當 frontier 級能力不斷往低價 tier 下沉,競爭優勢會從「我能呼叫哪個模型」移到「我知道什麼時候用 Luna、何時升級 Terra/Sol,以及如何證明結果可接受」。這也是小模型接手大量任務真正困難之處:routing、評估與回滾比 demo 更重要。

我同意什麼、又存疑什麼?

  • 我同意:Luna token 價格精準降到原本五分之一,會擴大分類、文件處理與 worker agent 的可行範圍。
  • 我同意:Sol 規劃、Luna 執行的分層架構,是比全程使用同一模型更成熟的方向。
  • 我存疑:OpenAI 的每任務成本、9× 速度、99% 成本優勢與客戶案例,原文提供的是結果摘要;在公開方法足以重跑前,不宜把它們當成獨立結論。
  • 我存疑:更多 agent 會自動帶來更多成果;matched-compute 研究顯示,它高度依賴任務可分解性與中央驗證。

八、現在怎麼做?用 100–500 筆自家任務驗證 GPT‑5.6 Luna 降價 80%

  1. 先定義可接受成果。準備 100–500 筆代表性任務,寫清楚正確答案、rubric、必過測試與高代價錯誤。
  2. 用 Luna 跑基線。分開記錄 input、output、cached tokens、工具費、重試、TTFT、p95 latency 與通過率。
  3. 只升級失敗類型。把低信心、無法驗證、高風險或多次失敗的 case 路由到 Terra/Sol,不要全量升級。
  4. 比較每個通過成果成本。若 Luna token 帳單降了,人工 review 與錯誤清理卻上升,這個 migration 就沒有成功。
  5. 把 Fast 留給真正值錢的等待。延遲價值不到兩倍 token premium 的工作,不必為「最高 2.5×」買單。

GPT‑5.6 Luna 降價 80% 最重要的意義,不是「AI 突然便宜到不用管」,而是你現在能以更低的 Luna token 成本,認真測試哪些工作適合廉價智能、哪些錯誤必須升級處理。先把驗收做對,再把五倍預算花在更多嘗試上。

📚 延伸閱讀

如果你今天就要開始,第一步不是把現有 agent 全部切到 Luna,而是先抽出一小批真實任務,算出你的 cost per accepted outcome。這個數字更能告訴你,這次 80% 降價究竟是新聞,還是你產品真正的成本突破。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。