2026 年 9 月 8 日,OpenAI 在官網發布〈Introducing ChatGPT Images 2.5〉,開始把 ChatGPT Images 2.5 推向各 ChatGPT 方案、ChatGPT Work 與 Codex。這次最值得追的,不是示範圖又漂亮了多少,而是一個更難驗證的承諾:使用者連續改圖時,模型能否只動指定部分,保留其餘人物、文字、構圖與細節。
以下先還原 OpenAI 實際發布了什麼,再把官方說法放進外部偏好數據、研究論文與早期使用回報裡核對,最後給出一套能直接拿去驗收的五輪改圖測試。結論先說:這像是一次有意義的升級,但「比較會保留」距離可預測的圖像編輯器仍有一段路。

ChatGPT Images 2.5 的真正更新:從「會生成」走向「會保留」
OpenAI 對這次更新的核心描述很直接:細節更銳利、光線與材質更自然,參考人物更穩定,而且多輪編輯比較不會破壞前一步已經做對的內容。官方還宣稱,相較 Images 2.0,ChatGPT 端的生成延遲最高可降低 50%;API 端則把同一個「最高 50%」說法限定在 Flare 相對 GPT-Image-2 的比較。兩者都是 OpenAI 的發布數字;截至 9 月 9 日,發布頁與兩個模型頁面未列出提示詞集合、品質設定、地區或延遲百分位,因此不能改寫成「平均快一倍」。
“Images 2.5 is better at editing only what you’ve asked for, while keeping the rest of the details the same.”
中文:Images 2.5 更擅長只修改你要求的部分,同時保留其餘細節。
OpenAI,〈Introducing ChatGPT Images 2.5〉
這句話碰到生成式改圖最棘手的地方。從零做一張圖,只要整體結果討喜就可能過關;修改既有圖像卻有兩個同時成立的目標:指定區域要明顯改變,未指定區域又必須近乎不變。改太少是沒聽懂,改太多則是重畫,不是編輯。
Flare 與 Sunburst:速度路線和控制路線
API 不是單一型號,而是兩個可明確指定的模型。OpenAI 建議多數應用先用 gpt-image-2.5-flare:它偏向速度與日常高品質輸出;gpt-image-2.5-sunburst 則被定位成能力與編輯控制優先、生成時間較長的高階選項。兩者都能透過 Image API 或 Responses API 的圖像工具生成與編輯圖片。
| 路線 | 官方定位 | 適合先測的工作 | 不能直接推論 |
|---|---|---|---|
| Flare | 較快、適合多數應用 | 大量草稿、即時互動、低等待流程 | 較快不等於總成本較低,也不代表每輪都快 50% |
| Sunburst | 能力與編輯控制優先 | 高價值主視覺、人物與品牌元素保留 | Flare 的 50% 延遲數字不能套用到 Sunburst |
消費端的「ChatGPT Images 2.5」不等於介面會讓你挑 Flare 或 Sunburst;截至 9 月 9 日,官方的 ChatGPT 說明未公開把某一個 API 型號對應到聊天介面。核心圖片能力開始跨方案推出,不代表每個周邊功能同時出現在每個表面:官方版本紀錄顯示 Templates 尚未進入 Work,而 Sketch 與圖片留言/編輯流程帶有行動裝置限制。
官方示例證明了方向,還沒證明成功率

上圖是發布頁最貼近「保留」問題的示例:模型要讓立方體換角度,同時守住材質、比例與物件身分。這比單張成品更有資訊量,但仍是官方挑選的案例;發布頁的合作夥伴感言也沒有公開樣本數、失敗案例或測試設定。它能說明產品要解哪一題,不能單獨回答成功率有多高。
早期外部偏好:有訊號,但不是多輪編輯測試
截至 2026 年 9 月 9 日,Arena 的單圖編輯榜把 Sunburst 與 Flare 排在 GPT-Image-2 之前,文字生圖與多圖編輯榜也出現類似的早期領先。這是目前最像外部交叉檢查的訊號,但榜上仍標示 Preliminary,新模型票數遠少於舊模型;Arena 衡量的是匿名兩兩比較後的整體偏好,不是延遲、局部保留率或五輪對話漂移。尤其「多圖編輯」指多張輸入圖,不是同一張圖連續修改多輪,兩者不能混用。
發布當天的 Reddit 討論與 Hacker News 討論同時有正面反應與失敗回報:有人覺得參考圖匹配和姿勢保留改善,也有人貼出細小文字失真、紋理噪點或局部修改後整體被重新生成的例子。這些沒有固定提示詞、種子、重複次數或可確認的模型版本,只能當成要加入測試集的失敗模式,不能用來估算普遍發生率。
為什麼「不要亂動」比看起來難
圖像生成模型不是把既有畫布當成一組可獨立鎖定的圖層;它會根據指令與輸入重新推算像素。每一輪都可能讓高頻細節、人物特徵、字形與空間關係稍微漂移。CVPR 2026 的 FreqEdit 研究正是從多輪編輯的漸進品質劣化出發,將高頻資訊流失視為關鍵問題;這說明「前四輪看起來沒事」不代表第八輪仍能守住原圖。
另一個 2026 年的評測集 GEditBench v2把指令遵循、視覺品質與視覺一致性分開評分。這個拆法很重要:一張圖可以更漂亮,卻沒有照做;也可以完成局部修改,卻讓人臉、標誌或背景悄悄改變。GEditBench v2 發表早於本次發布,並未測到 Images 2.5,因此它提供的是驗收框架,不是替新模型背書的分數。
OpenAI 自己留下的反證:它仍不是確定性編輯器
如果「更精準」被理解成 Photoshop 式的像素鎖定,官方文件本身就足以反駁。OpenAI 的 圖像生成指南仍列出文字位置與清晰度、結構化版面、重複角色與品牌元素一致性等限制;複雜提示也可能需要等待最長兩分鐘。ChatGPT 的選取區域編輯說明則提醒,修改有時會延伸到選取範圍以外。
因此,ChatGPT Images 2.5 比較合理的定位是「降低迭代摩擦的生成模型」,不是「每個未選像素都保證不變的影像工具」。這個差別會直接影響商用流程:社群草圖可接受小幅漂移,產品包裝、人物授權照、商標與法規文字卻不能只靠肉眼覺得差不多。
安全層也要跟著升級
更寫實、更容易保留人物身分,會同時放大正常創作與冒用風險。OpenAI 的 Images 2.5 System Card明確把更具說服力的深偽內容列為風險,並公開其安全評測;但那份文件測的是政策與安全表現,不是產品品質 benchmark。OpenAI 表示,從 ChatGPT、Codex 與 API 產出的 Images 2.5 圖片會帶 C2PA 資訊及 SynthID 隱形浮水印。來源標記值得保留,但內容審核、人物授權與發布紀錄仍不能外包給標記本身。
AlphaLab 的判讀:真正的護城河是少重做幾次
1. 速度只有乘上成功率,才是工作流收益
單次等待縮短 50%,如果每次仍要重抽三次,總工時不一定下降。團隊真正該記錄的是「從原圖到可交付版本花了多久、重做幾輪、最後有多少未指定區域被改壞」。OpenAI 的延遲宣稱值得期待,但要到這三個數字一起改善,才構成生產力提升。
2. Flare 與 Sunburst 應該是路由,不是冠軍榜
低風險草稿先走 Flare;涉及人物、品牌、文字或高額媒體投放,再升級到 Sunburst 並加人工覆核。若把所有任務都丟給同一型號,就看不見速度、品質與失敗成本之間的交換。這和「哪個模型永遠最好」是兩種完全不同的決策。
3. 多輪編輯的敵人是累積漂移
第一輪只改天空、第二輪換外套、第三輪補上標語,到第五輪才發現臉型和產品比例已經偏移,回頭成本會很高。與其只看最終圖,應保留每一輪輸入、輸出與提示詞,逐輪比對。既有的 GPT Image 2 Prompt-as-Code 工作流可用來固定提示與產物紀錄,再把「未指定區域保留率」加入驗收。
4. 我同意什麼,我存疑什麼
我同意 OpenAI 把焦點放在編輯控制與迭代速度,因為這兩項比單張示範圖的美感更接近真實工作價值;早期 Arena 偏好也提供了方向一致的外部訊號。我存疑的是「更穩定」究竟能跨多少輪、哪些素材類型,以及 50% 延遲下降能否轉化成較低的完成時間。發布資料尚不足以回答這三題,官方已列出的文字、版面與角色漂移限制也提醒我們不要把改善寫成解決。
把 ChatGPT Images 2.5 放進工作流前,先跑這個五輪測試
- 選 20 張真實素材:人物、產品、標誌、細字與複雜背景各至少四張,不要只挑模型擅長的宣傳照。
- 鎖定五輪腳本:每輪只改一件事,例如背景、服裝、姿勢、標語、光線;Flare 與 Sunburst 使用相同順序。
- 標出不可變區域:記錄人臉、商標、包裝比例、既有文字與背景物件;每輪逐項判定是否漂移。
- 同時計時與計次:除了單輪延遲,也記錄重抽、回退、人工修補次數,以及從開始到通過驗收的總時間。
- 先定發布閘門:只要人物身分、商標、數字或法規文字改變就阻擋發布;其他瑕疵再依用途分級。可沿用 AI Evals 七步框架保存案例、評分規則與版本。
如果五輪後的成功率、總時間與重做次數都優於現有流程,ChatGPT Images 2.5 才算真正升級;若只有第一張圖更吸睛,它仍只是更好的提案工具。這也是這次發布最值得持續對帳的指標。
接著閱讀
左右滑動查看更多推薦
現在就挑一張最容易看出漂移的舊專案圖,照同一腳本連改五輪;別先問新模型漂亮不漂亮,先看它能否保住你沒有要求它改的東西。






