xAI Grok Imagine Image 2.0:設計師等級的 AI 編輯能力直衝 Arena 第二名
xAI 的 Imagine Image 2.0 帶來區域級編輯、多圖融合、智慧縮放與設計師級字體排版——一舉躍升至圖像 Arena 排行榜第二名。
2026 年 8 月 7 日,馬斯克旗下的 xAI 低調推出了今年最具影響力的 AI 圖像模型更新之一。Grok Imagine Image 2.0 現已作為全新「Quality Mode(品質模式)」在 grok.com/imagine 網頁版及 iOS、Android 應用程式上全面開放。它不只是生成更漂亮的圖片——而是從根本上重新定義了 AI 圖像工具應該做的事情:將「編輯」視為與「生成」同等重要的核心能力。發布後數日內,它立即攀升至 Artificial Analysis 圖像 Arena 排行榜第二名,僅次於長期盤踞榜首的模型。
Image 2.0 為何不同
上一代 AI 圖像模型——從 DALL-E 到 Midjourney 再到初代 Grok Imagine——共享一個共同缺陷:它們本質上就是吃角子老虎。你輸入提示詞、拉下搖桿,然後要麼滿意、要麼失望。所謂「編輯」意味著要嘛接受瑕疵,要嘛從頭重新生成整張圖片,祈禱下一個隨機種子能修正某個特定細節。Image 2.0 打破了這個模式,以五項環環相扣的能力,將工作流程從「生成然後祈禱」轉變為「生成然後精修」。
魔術棒區域級編輯
最核心的功能是魔術棒(magic wand)工具,實現了區域級編輯。使用者不再需要為了修正一個小問題——一隻畸形的手、偏色的背景、一段錯誤的文字——而重新生成整張圖片。現在只需選取特定區域,用自然語言描述想要的改動,模型就能智慧填補並融合編輯區域,同時保留構圖的其餘部分。這呼應了 Adobe Photoshop 等專業影像編輯器數十年前提出的非破壞性編輯理念,但完全由自然語言指令驅動。已測試該功能的使用者普遍反映,融合效果極為自然——編輯區域的光線、紋理和風格與周圍完美匹配,沒有可見的接縫或瑕疵。
多圖融合:最多五張參考圖
Image 2.0 可以同時接收最多五張參考圖,並將其中的元素融合為一個連貫的輸出。這開啟了以往單一參考系統無法實現的創意可能。設計師可以同時輸入一張產品照、一組情緒板配色、一張紋理樣本、一張構圖參考,以及一份字體風格指南——然後要求模型將這五者綜合為一件統一的行銷素材。模型並非簡單地疊加或拼貼這些輸入,而是理解每張參考圖的語意意圖,在深層結構層面加以整合。
智慧縮放:任意長寬比
Smart Resize(智慧縮放)能將一張現有圖片智慧延伸至任何常見長寬比,且不失真或裁切。支援的比例包括 1:2、9:16、2:3、3:4、1:1、4:3、3:2,以及 16:9 寬螢幕標準。模型會分析原始構圖,並生成符合上下文的內容來填滿擴展的畫布——在風景上方添加天空、在產品下方延伸桌面、或在主體背後延續花紋壁紙。這解決了一個自從多平台發布興起以來困擾內容創作者的痛點:同一張圖片需要同時適用於 YouTube 縮圖(16:9)、Instagram 貼文(1:1 或 4:5)、TikTok 封面(9:16)和 Pinterest 釘圖(2:3)。
設計師級字體排版
也許最令人驚豔的升級在於文字渲染。AI 生成圖片長期以來因文字混亂而惡名昭彰——多出的手指搶盡風頭,但拼錯的單字和融化的字母其實是更持久的問題。Image 2.0 特別針對字體排版和版面規劃進行了訓練,讓模型能像人類設計師一樣思考——將文字視為構圖的有機組成部分,而非裝飾性的附加物。模型在攝影、設計和插畫風格中都能產出清晰可讀、字距適當、符合語境的文字,保真度顯著提升。
跨類型保真度訓練
在底層架構上,Image 2.0 明確針對三個不同的視覺學科進行了保真度訓練:攝影、設計與插畫。許多圖像模型在某一類型表現出色,但切換到另一類型就會失常——以攝影為主的模型可能產出褪色的插畫,反之亦然。透過將這三種類型視為同等重要的訓練目標,xAI 打造出了一個無論你生成的是擬真產品照、平面海報還是風格化數位繪畫,都能保持一致品質的模型。
Arena 排名:訊號,而非終點
攀升至 Artificial Analysis 圖像 Arena 第二名絕非易事。Arena 採用盲測、面對面的人類偏好投票——這套方法已成為大語言模型評測的黃金標準。使用者會看到兩張由不同模型根據相同提示詞生成的圖片,並投票選出較好的一張,結果匯入 Elo 評分系統。達到第二名意味著 Image 2.0 在與除當前領先者之外的所有圖像模型的直接比較中,贏得了壓倒性多數的選票,而且這一切是在發布後數天內完成的。它能否縮小與第一名的差距——或者被競爭對手超越——將取決於 Arena 投票社群的持續偏好。
定價與可用性
Image 2.0 現已於 xAI 所有消費端平台上線:網頁版 grok.com/imagine,以及 iOS 和 Android 上的 Grok 應用程式。它以現有 Imagine 介面中新的「Quality Mode」切換按鈕形式呈現。API 存取列為「即將推出」,不過既有的 Imagine API 基礎設施已經以具競爭力的費率支援圖像生成與編輯。根據 xAI 截至 2026 年 8 月 7 日的定價頁面,grok-imagine-image 模型的收費為每張輸入圖片 0.002 美元,每張輸出圖片 0.02 美元(1K 和 2K 解析度同價)。作為比較,OpenAI 的 DALL-E 3 標準圖片收費 0.040 美元、HD 圖片 0.080 美元——xAI 在標準層級的價格大約只有一半,在高解析度層級更是只有幾分之一。
更大的格局:xAI 的平台策略
Imagine Image 2.0 的推出是 xAI 在 2026 年夏季更廣泛產品攻勢的一部分。就在數天前的 7 月 29 日,xAI 發布了 Grok Voice Think Fast 2.0——一個語音對語音模型,在 Artificial Analysis 語音指數上獲得 82.9% 的分數,首次音訊回應時間僅 0.70 秒,定價每分鐘 0.08 美元。再前一週是支援參考素材的 Grok Imagine Video 1.5。而 xAI 用於程式編寫和代理人任務的 Grok 4.5 持續在 xAI API 上提供,每百萬輸入 token 收費 2 美元。這些發布共同勾勒出一個清晰的策略:xAI 正在 Grok 品牌下打造一個全端 AI 平台——文字、語音、圖像、影片——以積極的定價削價競爭,同時在基準測試排行榜上攀升。
圖像生成領域已成為 AI 最激烈的競技場之一。Midjourney 在數位藝術家心中仍是美學首選;OpenAI 的 DALL-E 受益於深度的 ChatGPT 整合;Google 的 Imagen 藉由搜尋與 Workspace 的分發優勢;Adobe 的 Firefly 則直接嵌入專業人士日常使用的創意工具中。xAI 的優勢在於 X(前身為 Twitter)平台——Grok 原生整合其中,而病毒式的圖像生成已被證明是強大的參與度驅動力。透過結合具競爭力的品質、積極的定價和原生社群分發,Grok Imagine Image 2.0 將 xAI 定位為 AI 圖像生成大戰中認真的競爭者——而非曇花一現的新奇玩意。
展望未來
從 Imagine Image 1.0 到 2.0 的軌跡顯示,xAI 正在快速迭代並從使用者回饋中學習。對「編輯」而非僅僅「生成」的強調,表明他們理解現實世界中的創意工作是反覆迭代的,而非一次成型的。如果 API 近期以傳聞中的定價開放,正在開發創意工具、行銷平台和內容管線的開發者將獲得一個極具吸引力的新選擇。真正的考驗在於 Image 2.0 能否在競爭對手反擊時守住 Arena 排名——以及其編輯能力能否經得起專業設計師的嚴格檢驗,他們會將魔術棒和多參考融合推至極限。
至少目前,xAI 已經交付了一個不只生成圖片、而是與使用者協作創造圖片的模型。在一個充斥著吃角子老虎式生成器的市場中,這個區別可能證明是決定性的。
Sources
- [1] https://x.ai/news/grok-imagine-image-2
- [2] https://thenextweb.com/news/grok-imagine-image-2-editing-arena-ranking-spacexai
- [3] https://venturebeat.com/technology/openai-launches-gpt-5-6-cyber-with-reduced-refusals-95-completion-on-advanced-cybersecurity-tasks
- [4] https://www.basenor.com/blogs/news/grok-imagine-image-2-0-5-details-that-matter
- [5] https://startupfortune.com/grok-imagine-20-pushes-xai-deeper-into-openai-and-midjourney-territory/
- [6] https://medium.com/no-time/grok-imagine-image-2-0-launch-new-editing-tools-rank-2-on-arena-5415f984d9ff
- [7] https://docs.x.ai/developers/pricing
- [8] https://datanorth.ai/news/spacexai-releases-grok-imagine-image-2-0