跳到主要內容

Grok Imagine Image 2.0 正式上線:可編輯工作流補齊,但「雙榜第二」怎麼看?(2026)

最後更新: ·
Grok Imagine Image 2.0 特色圖:從能改,到更可控

Grok Imagine Image 2.0 正式上線了——更精確地說,xAI 在 2026 年 8 月 7 日把官方稱為 Imagine Image 2.0 的新模型,作為 Quality Mode 推到 grok.com/imagine、iOS 與 Android。這次最重要的變化,不是 Grok 第一次能改圖;既有 Imagine API 已經支援 image editing。真正的升級,是把局部選取、去背、改比例與五張參考圖整合成更精準、可控的工作流。

區域編輯、精準選取、背景移除、最多五張參考圖,以及可依目標比例延展畫框的 Smart Resize,都已列為上線功能。可是另一半故事也很清楚:截至 2026 年 8 月 9 日,xAI 發布頁仍寫 Image 2.0 API 即將推出;官方突出的量化證據是兩個 Arena 圖像榜 raw rank 第二名,而 r/grok 的早期討論則出現人物一致性與塑膠感抱怨。這到底是成熟工具,還是一個很會贏單張盲測的新起點?

xAI Imagine Image 2.0 官方發布頁,顯示 2026 年 8 月 7 日的標題與開場說明
xAI 在 2026 年 8 月 7 日發布 Imagine Image 2.0,主打可用於實際創作的圖像生成與編輯。圖/xAI

這次真正上線的是什麼?

“generally available as the new Quality Mode”

中文:已正式作為新的 Quality Mode 提供。

xAI,Imagine Image 2.0 發布頁

換成白話:Image 2.0 已經列入網頁與手機 App 的產品模式,不只是發布頁上的功能預告。根據 xAI 官方發布頁,這次新增或強化的能力可以整理成四組:

功能它解決的工作目前該怎麼理解
Magic Wand+Segmentation指向並選取局部區域再修改xAI 宣稱能保留未選取區域;仍待獨立、可重複測試
Background Removal移除背景並輸出透明底主體把去背從外部工具拉回生成流程
Multi-reference一次放入最多五張參考圖可拿來測試角色、產品、場景與風格的混合,但不等於已證明跨圖一致性
Smart Resize改變長寬比並由模型補滿畫框功能上接近 outpainting;「Smart Resize」才是 xAI 的正式名稱

另外,xAI 也以延續同一視覺風格、建立可供影片使用的世界為例。單看功能表,Image 2.0 不只想幫你得到第一張圖,而是想讓你把同一個構想一路改到能交付。

真正的升級:從能改,走向更精準可控

傳統生圖最像抽卡:提示詞送出去,得到一張接近目標的圖;哪裡不對,就重新抽。Grok 在 Image 2.0 之前已有基本的 image editing 與多圖編輯 API,這次的差異是把「能改」進一步產品化成可選區域、可去背、可延展比例的控制。對做廣告、社群素材、電商圖或角色系列的人來說,成本通常不在「有沒有漂亮圖」,而在「能不能只改錯的那一塊」。

所以區域編輯、去背與多參考圖不是配菜,它們決定模型能不能進入真實製作鏈。Smart Resize 也很典型:同一張主視覺若能從 1:1 延伸成 16:9,就不必為每個版位重新生成;但邊緣是否自然、主體有沒有漂移,才是日常工作真正會遇到的問題。

xAI Smart Resize 官方範例,將同一間客廳由一比一畫面延伸為十六比九
左為 1:1,右為 16:9。xAI 用同一個客廳範例展示 Smart Resize 如何改變比例並填滿畫框;這是官方示範,不是獨立品質測試。圖/xAI

「雙榜 raw rank 第二」是真的,但只回答半個問題

xAI 宣稱模型在 Text-to-Image Arena 與 Image Edit Arena 都排第二。逐項核對 Text-to-Image 排行榜Single Image Edit 排行榜後,這個原始名次(raw rank)確實成立

2026/8/7 Arena 快照Raw rankRank spread分數票數
Text-to-Image#22–31320 ± 122,722
Single Image Edit#22–21439 ± 85,931
兩筆結果當時都標為 Preliminary。Arena 榜上模型名稱為 grok-imagine-image-2.0 (low)。

這比「xAI 自己說第二」更有力,因為 Arena 的評測說明是讓使用者匿名比較兩張輸出,再用 Bradley–Terry 模型把成對偏好整理成排名。它支持的結論是:Arena 使用者對榜上 (low) 版本的匿名成對偏好排名很高。

但三個但書不能省略。第一,兩項結果都還是 Preliminary;第二,文生圖與 Reve 2.1 的 rank spread 重疊,依 Arena 定義屬於統計並列;第三,編輯榜測的是單張圖片編輯。截至 8 月 9 日,Arena 公開的 Multi Image Edit 最新快照仍停在 7 月 24 日,早於 Image 2.0 上榜,因此目前沒有 Arena 多圖成績能替「五張參考圖」流程背書;沒有公開成績也不等於測試失敗。

還有一個服務設定問題:Arena 的公開標籤是 grok-imagine-image-2.0 (low),產品發布頁則稱 Quality Mode。Arena 政策要求預發布模型與公開版本一致,但也允許供應商選擇配置;截至 8 月 9 日,查閱的公開頁面沒有定義 (low),因此不足以證明兩邊的服務設定一對一相同。排行榜能告訴我們競爭力,卻還不能告訴我們連續改十次後,角色、商品、文字與未編輯區域是否仍然穩定。

Arena 第二,早期討論為何仍出現摩擦?

這兩則早期討論的互動有限,而 r/grok 那一串偏負面。截至 2026 年 8 月 9 日晚間,這則 Hacker News 投稿只有 3 points、0 comments;r/grok 的 2.0 與 1.5 比較串頁面當時則顯示約 46 upvotes、24 則留言,抱怨集中在蠟感皮膚、人物一致性與提示詞沒有被遵守。

這些數字不能被寫成模型評分。HN 的 3 分只代表那一則投稿沒有形成討論;Reddit 的比較也不是受控 A/B——原發文者說明新舊版用了不同提示詞,貼文未公開固定 seed,也未呈現可重複測試結果。這也是主動發文的自選樣本;留言裡同樣有人認為問題在提示詞,或表示自己的結果正常。

可是這則討論仍把 Arena 不容易看見的檢查點推到檯面:同一個角色能否跨圖維持、局部修改後其他區域會不會漂、寫實膚質能否避免塑膠感。Arena 的數千次匿名成對比較與 r/grok 的早期摩擦並不互相否定;它們測的是不同問題。

我同意 xAI 的方向,但證據還沒追上功能

我同意的地方:xAI 抓到圖像模型最該前進的方向。再高一點的單張畫質,邊際價值已經不如「能選、能改、能延伸、能帶入多張參考圖」。Image 2.0 把這些入口放在同一個產品裡,對非專業設計者尤其重要。

我存疑的地方:截至 2026 年 8 月 9 日,xAI 這份發布頁展示了功能與 Arena 快照,卻沒有交代模型架構、訓練資料、內部評測設計、延遲或成本。官方對「保留未編輯區域」與「一致性」的描述,目前仍是待外部重複驗證的產品主張。

“API access is coming soon.”

中文:API 存取即將推出。

xAI,Imagine Image 2.0 發布頁

翻成白話:即將開放的是Image 2.0 的 API,不是 Grok Imagine 從來沒有 API。xAI 現行 Imagine API 文件列出 grok-imagine-image-quality,模型頁給出的 pinned alias 是 grok-imagine-image-quality-20260403,而文件中的多圖編輯上限是三張。開發者現在不該自行猜測 2.0 的模型 ID、價格、速率限制或五圖工作流會如何映射到 API。

現在值得換嗎?先測第十張,不要只看第一張

如果你只是偶爾生一張社群配圖,Quality Mode 已值得直接試;如果你用 AI 圖像接案、做品牌角色或商品素材,我不會因為榜單第二就立刻換掉原流程。更合理的做法,是拿同一組素材做一輪影子測試:

  1. 固定提示詞與參考圖,連續產出 10 次,記錄人物臉部、商品結構與文字是否漂移。
  2. 只改一個局部,檢查未選取區域的像素、光線與構圖是否被悄悄重畫。
  3. 分別測去背邊緣、1:1→16:9 延伸,以及五張參考圖混合後的主體一致性。
  4. 等 Image 2.0 API 公開後,再補測延遲、成本、可重現性、速率限制與失敗重試。

我的結論是:Grok Imagine Image 2.0 把既有編輯能力推向更完整、更精準可控的產品工作流;但距離「可以放心接管正式製作」,還差一層公開、可重複的工作流證據。Arena raw rank 第二讓它值得測,r/grok 的早期抱怨則提醒我們要測對地方。真正有價值的不是第一張驚艷圖,而是第十次修改後,它還是不是同一個作品。

接著閱讀

左右滑動查看更多推薦

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。