← All posts / Models

四千像素與一段記憶:騰訊 Hy Image 3.5 Preview 深入解析

騰訊推出為反覆修改而生的圖像模型,支援 4096×4096 輸出與聊天式 API,並根據內部設計師測試宣稱追平 ByteDance Seedream 5.0 Pro。

四千像素與一段記憶:騰訊 Hy Image 3.5 Preview 深入解析

四千像素與一段記憶:騰訊 Hy Image 3.5 Preview 深入解析

2026 年 9 月 22 日,當阿里巴巴執行長吳泳銘正在杭州雲棲大會(Apsara Conference)的舞台上揭櫫 5 至 10 兆參數模型路線圖、並發表新款 Zhenwu V900 AI 加速器之際,騰訊悄然打出了自己的反制招——不是透過主題演講,而是透過一份雲端 API 文件。混元(Hunyuan)圖像模型家族的最新一代 Hy Image 3.5 Preview,以 hy-image-v3.5-preview 的模型 ID 出現在 9 月 21 日更新的騰訊雲文件中,目前正陸續整合進騰訊元寶(Yuanbao)聊天機器人、影片剪輯工具與設計工具。

這個時間點是刻意安排的。Bloomberg 的報導直白地下了註腳:騰訊推出這款 AI 圖像模型,是為了追趕 ByteDance 與阿里巴巴——它在的中國多模態軍備競賽中最直接的兩個對手。但真正值得深入的故事並不是這種競爭姿態,而是這個模型究竟被設計來做什麼,因為 Hy Image 3.5 Preview 建立在一個與眾不同的核心假設之上:人們要的不是「生成一張圖」,而是「改一張圖」。

一個有記憶的圖像模型

大多數圖像生成器把每一次提示都當成全新的開始。你描述某個畫面,模型產出一張圖,如果想修改,你要麼整張重擲,要麼跟局部重繪遮罩搏鬥。Hy Image 3.5 Preview 反轉了這套邏輯:它是為「修改循環」而設計,不是為一次性生成。

API 採用聊天式的訊息格式。一個請求可以同時攜帶文字與參考圖;模型回傳結果;到了下一輪,開發者把先前生成的圖像與對話歷史一併附加到請求中。模型會把這些上下文帶往前,於是「把外套改成紅色」「主體往左移」「背景光線柔和一點」這類局部指令,修改的是現有圖片,而不是產出一張毫不相關的新圖。

這聽起來像個小小的介面細節,其實不然。跨輪次保留準備好的歷史,讓「連續編輯」成為介面設計的一部分,而不是應用開發者必須自己想辦法重現的未公開行為。對於打造創意工作流程的團隊——迭代設計稿的設計工具、調整分鏡畫面的影片剪輯管線、反覆打磨活動視覺的行銷團隊——「重新生成然後祈禱」和「帶著記憶修改」之間的差別,就是玩具與工具的差別。

同步回傳的路徑同樣重要。應用程式不需要提交任務再輪詢等待完成,而是在同一個請求中直接收到完成的圖像。對於使用者盯著螢幕等待下一次修改的互動式編輯循環來說,這種延遲行為本身就是產品體驗的核心。

API 揭露的細節

根據騰訊雲文件,這項服務支援:

  • 文字生圖與圖生圖,可接收參考圖作為引導生成的輸入。
  • 多輪編輯,透過聊天式訊息格式,將先前生成的圖像與對話歷史附加到後續請求。
  • 自訂圖片尺寸,包括明確要求最高 4,096 × 4,096 像素的 4K 輸出。
  • 可選的外部搜尋增強,讓模型在生成時引入外部資訊。

最後一項很容易被忽略。搜尋增強式的圖像生成——讓模型根據檢索到的參考資料來作畫,而非僅依賴凍結的訓練資料——正在成為整個產業的隱形差異化戰場。它出現在 API 中,代表騰訊預期開發者會建構「有事實錨定」的視覺工作流程,而不只是風格化的創作。

宣稱的效能,以及它的分量

騰訊表示,這個模型經過數百位內部設計師的測試。在這些內部試用中,公司宣稱其輸出可與 ByteDance 的 Seedream 5.0 Pro 相當——後者是目前中國最強的圖像模型之一——並略微領先 Google 的 Nano Banana Pro 與阿里巴巴的 Qwen-Image-3.0 Pro。

這些是相當有企圖心的宣稱,而它們的證據地位值得精確檢視:騰訊並未隨發布公布任何量化指標。沒有基準測試表格、沒有人類偏好研究的樣本數、沒有勝率百分比。這幅競爭圖像目前只存在於公司對自家模型、由自家員工評測的自我評估中。即便如此,股市依然買單——消息公布後騰訊港股上漲超過 7%——但市場對宣稱的反應,不等於宣稱本身已被驗證。

真正的考驗有兩個層面。第一,獨立評測——那些已成為此領域實質仲裁者的圖像模型排行榜與社群盲測——能否在這個預覽版廣泛開放後,重現騰訊的排名。第二,修改工作流程能否在生產環境中站得住腳:多輪圖像編輯出了名的難以維持穩定,身分漂移與構圖劣化會在連續修改中不斷累積。一個在第二輪编辑得漂亮、到第五輪就崩壞的模型,並沒有解決這個 API 所圍繞的核心問題。

全端堆疊的暗戰

這次發布也落在更宏觀的戰略脈絡中,Bloomberg 的框架僅點出了冰山一角。阿里巴巴利用同一天發表了晶片(Zhenwu V900,宣稱效能為前代的三倍)並承諾 2032 年前建置 20 GW 的資料中心容量。ByteDance 的 Seedream 系列持續在中國實驗室中設定圖像品質的標竿。騰訊的回應——同時將一款「編輯優先」的圖像模型直接推進消費級與專業級產品,並以雲端 API 作為後盾——反映出它一貫的打法:靠分發渠道取勝。

元寶給了 Hy Image 3.5 即時的消費者介面;影片剪輯與設計工具的整合給了它專業場景;而同步、帶歷史感知的 API 則給了第三方開發者一個在騰訊雲上建構的理由,而不是把混元當成研究展示品。這正是自混元組織重整以來定義騰訊 AI 戰略的漏斗邏輯——產品整合驅動雲端消費。

這套邏輯這次能否奏效,取決於新聞稿無法製造的唯一一件事:這個模型在剝除行銷話術之後,編輯能力是否真的如其生成能力一樣好。hy-image-v3.5-preview 中的「Preview」標籤在這一點上是誠實的。這是一個等待驗證的宣稱,卻以最容易驗證的方式發布——直接進入數百萬使用者日常使用的產品中。

目前記分板上的局勢是:騰訊把圖像編輯變成了其 frontier 圖像模型的一級公民,支援最高 4K 解析度,API 更是專為創意團隊實際運行的迭代工作流程而設計。如果內部設計師測試的結果能轉化為外部現實,ByteDance 與阿里巴巴將面臨真正的麻煩。如果不能,這只會成為實驗室替自家作業打分數的漫長歷史中,又一個平凡的章節。