Gemini Omni Flash 正式版上線:Google 對話式影片模型進入生產環境
Google 將 gemini-omni-1.1-flash 升級為正式版(GA)——這個能用聊天方式編輯影片、任意輸入轉影片的模型,現在已可供開發者與企業在生產環境使用。
Google 低調地將旗下最有趣的模型家族之一推向了正式營運。根據 Gemini API 官方 release notes(日期為 2026 年 8 月 27 日),Gemini Omni Flash 已正式全面供應(Generally Available),模型 ID 為 gemini-omni-1.1-flash。這是 Google 今夏率先以預覽版形式推出的快速對話式影片生成與編輯模型的正式版本——而它從「preview」畢業升級為「GA」,意義遠超過一般的小版本更新。
Gemini Omni Flash 到底是什麼?
Gemini Omni 於 2026 年 Google I/O 首次亮相,定位為全新的多模態生成模型家族,賣點很簡單:一個模型,接受任意組合的輸入——文字、圖片、音訊、影片——然後輸出一支完成的影片。它不需要把文字模型和獨立的影片生成器用脆弱的膠水程式串接,而是在單一系統中原生處理所有模態,並以 Gemini 的真實世界知識為基礎。
Flash 版本是家族中針對速度優化的成員。完整版 Omni 追求最高保真度,而 Omni Flash 則是為快速、迭代、對話式的工作流程調校:短影音生成與多輪編輯,每一條指令都建立在前一輪的結果之上。你可以叫它換一個角色、調整光線、穩定鏡頭、改變攝影機角度,它會重新渲染影片,同時保持角色一致性與合理的物理效果。早期使用者開始稱它為「影片版的 Nano Banana」——向 Google 那款廣受歡迎的圖片編輯模型致敬——因為過去需要在專業剪輯軟體時間軸上折騰半天的複雜編輯,現在濃縮成一則聊天訊息。
從預覽到正式版
即使以 Google 的標準來看,邁向 GA 的速度也相當快:
- 2026 年 5 月 19–20 日 — Gemini Omni 於 Google I/O 發表,Omni Flash 透過 Gemini 應用程式與 Flow 向 Google AI Plus、Pro 與 Ultra 訂閱者推送,並承諾「未來幾週」透過 Gemini API 與 Vertex AI Agent Platform 開放給開發者。
- 2026 年 6 月 30 日 —
gemini-omni-flash-preview透過 Gemini API 向所有開發者開放,同時推出負責較輕量任務的 Flash Lite 兄弟版本。 - 2026 年 8 月 27 日 —
gemini-omni-1.1-flash達成正式版(GA),1.1 版本為要將影片工作流程整合進自家產品的開發者提供了更細緻的控制能力。
GA 里程碑之所以重要,有三個原因。第一,它代表 Google 對這個模型的可靠性與安全機制有足夠信心——preview 端點不提供任何穩定性保證,而企業根本不會在這類端點上打造產品。第二,GA 通常伴隨正式的 SLA、更高的速率限制與長期支援承諾,這會直接改變採購決策。第三,它讓對話式影片編輯在 Google 的正式 API 版圖中,與文字生成站在同一水位上。
經濟學:便宜到可以反覆迭代
價格是 Omni Flash 真正可能重塑工作流程的關鍵。影片輸出以每秒 720p 影片 5,792 tokens 計費,輸出單價為每百萬 tokens 17.50 美元,換算下來約為每秒生成影片 0.10 美元——一支標準 10 秒影片大約 1 美元。輸入的計費方式類似:Agent Platform 上每張圖片 1,120 tokens、每秒音訊 32 tokens、每秒影片 5,792 tokens。
就這個模型的能力而言,這個價位極具攻擊性。傳統生成式影片管線的行情約在每秒 0.20 至 0.60 美元之間,而且沒有一家提供有狀態的多輪編輯。由於 Omni Flash 跨輪次保留上下文——每次請求都會攜帶前一支影片與其參考資料——迭代修正的成本只是重新渲染的邊際價格,而不是從零生成的價格。對行銷團隊與代理商而言,這個差異會快速累積:Google DeepMind 頁面上引用的客戶案例報告,採用後創意產出提升 23%,工作流程成本降低 20%。
對話式編輯才是真正的突破
技術上的差異化關鍵是有狀態編輯(stateful editing)。單純的文生影片模型像吃角子老虎機:提示詞進去、影片出來、毫無記憶。Omni Flash 則把影片生成視為一場對話。每一輪都繼承前一輪影片的角色、場景幾何與參考資料,所以「改成黃昏」、「讓她在路口左轉」、「把轎車換成掀背車」這類指令,能夠精準地套用在已存在的內容上。
這正好對應創意工作者實際的作業方式。導演很少一開始就知道最終剪輯版本——那是透過反覆修改摸索出來的。Omni Flash 把每個修改週期從數小時的時間軸手術,壓縮成幾秒鐘的對話,讓瓶頸從「執行」轉移到「品味」。過去需要插畫師和數天等待的分鏡預視(pre-visualization)工作流程,現在可以在提案會議上即時完成。
它也自然而然地融入代理式(agentic)架構。一個有狀態、對話式的影片模型,正是自主代理可以操作的工具:電商系統按需生成產品側錄影帶、新聞室機器人組裝背景影片,或遊戲工作室管線徹夜迭代過場動畫草稿。Google 同時把這個模型放在消費端 Gemini 應用(透過 Flow)與企業端 Agent Platform API,顯示它兩邊市場都要。
競爭格局
這次 GA 上線正值影片模型競賽白熱化之際。位元組跳動的 Seedance 系列在原生生成品質上廣受好評,包括 MiniMax 在內的中國實驗室今夏也推出了自家的多模態影片模型。但 Omni Flash 的優勢在於控制力而非一次性美感——評測者普遍指出,競爭對手雖能產出驚豔的單次生成,卻沒有一家能提供 Omni 這種逐輪操控的精細度。再加上 Gemini 的通路優勢——Gemini 應用今夏稍早已突破十億用戶——Google 押注的是:可編輯性與生態整合,勝過孤立的跑分勝利。
當然也有但書。短片長度意味著長片仍需在下游組裝。影片轉影片編輯在某些市場仍有區域限制。而與所有生成式媒體一樣,對話式編輯也引發來源證明(provenance)的疑慮——不過 GA 狀態讓這個模型納入了 Google 的 SynthID 浮水印與企業治理體系。
後續觀察
GA 之後,接下來的問題是吞吐與規模:速率限制是否會放寬到足以支撐高流量媒體管線、1080p 與 4K 輸出等級是否會在目前第三方供應之外正式推出,以及代理生態系多快會把「有狀態影片」納為基本原語。Google 在五月的 I/O 種下了種子;從今天起,它成為了可收成的作物。對於撐過預覽期的開發者來說,等待結束了——gemini-omni-1.1-flash 現已在 Gemini API 與 Agent Platform 上線。
Sources
- [1] https://ai.google.dev/gemini-api/docs/changelog
- [2] https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni/
- [3] https://deepmind.google/models/gemini-omni/
- [4] https://ai.google.dev/gemini-api/docs/models/gemini-omni-flash
- [5] https://cloud.google.com/blog/products/ai-machine-learning/innovations-from-google-io-26-on-google-cloud