Gemini Omni 1.1 Flash 正式進入生產環境:40 秒場景、關鍵影格控制與 4K 輸出
Google DeepMind 的 Gemini Omni 1.1 Flash 將工作室級的生成式影片帶進 Gemini API——10 秒場景延伸上下文、首尾影格插值、成本僅三分之一的 360p 草稿,以及 4K 升頻輸出。
三個月前,Gemini Omni 在 Google I/O 上以「從任何輸入創造任何東西」的定位首次亮相;三個月後的 2026 年 8 月 27 日,Google DeepMind 推出了讓它從展示品變成生產工具的更新版本——Gemini Omni 1.1 Flash。這個已在 Gemini API 上正式可用(GA)的模型,補上了專業影片工作流程真正需要的控制能力:更長的連貫場景、精確的關鍵影格導演指令、低成本的迭代草稿,以及 4K 成品輸出。
對於打造生成式影片工具的開發者來說,這次更新的重點不在於原始能力的提升,而在於可導演性(controllability)——這是一個「能產出驚人片段的模型」與「能被指揮的模型」之間的分水嶺。
Omni 1.1 的新功能
帶有真實上下文的場景延伸
最核心的功能是場景延伸(scene extension)。Omni 1.1 在續接影片時,最多能分析前 10 秒的上下文——相較於過去版本只參考最後一秒的畫面,這是大幅躍進。實際效果是延伸出來的片段在視覺一致性與敘事連貫性上明顯更好:角色臉孔不會跑掉、光線維持連續,就算你中途轉向新的創意方向,故事也不會飄走。
影片可以每次延伸 10 秒,累計總長度可達 40 秒。Google 官方示範展現了這能做到的事:從一顆讓石柱走廊在光學透視下急劇拉伸、卻讓角色驚愕表情保持固定大小的滑動變焦(dolly-zoom),到新角色走進既有場景開口說話的對話續接。
值得注意的是,API 採用了「互動(interactions)」設計:你傳入 previous_interaction_id 並要求模型繼續場景,還能指定輸出解析度。這等於是影片版的對話式介面,對用過聊天 API 的開發者來說會非常熟悉。
首尾影格插值
Omni 1.1 允許你指定一顆鏡頭的起始影格與結束影格,由模型生成兩者之間的連續影片。這個功能瞄準的是剪輯中最困難的部分:複雜的運鏡環繞、變焦轉場、主體之間的甩鏡(whip-pan),以及無縫循環。Google 的範例包括從鼓手甩鏡到薩克斯風手與芭蕾舞者的一鏡到底——這種「one continuous shot, no jump cuts」的指令,過去對影片模型來說只能是許願清單上的項目。
360p 草稿:速度快 60%、成本僅三分之一
創作的本質是迭代,而每次實驗都用完整解析度渲染非常浪費。Omni 1.1 支援輕量的 360p 預覽,生成速度最快提升 60%、成本約僅為標準 720p 的三分之一(依 Google 的系統吞吐量測試)。工作流程顯而易見且合理:在 360p 裡做分鏡與探索,得勝的鏡頭再用高解析度重新渲染。
4K 輸出
概念確定後,Omni 1.1 可以升頻到 1080p 或 4K,產出可直接進入製作的成品。結合草稿工作流程,Google 明確瞄準了「原型→迭代→完稿」的完整管線,而且全部在一個模型內完成。
多模態輸入中的影片參考
模型現在可以在單一提示中,連同圖片與文字一起接受最多三秒的參考影片。這解鎖了過去很棘手的角色與動作一致性應用:Google 的示範把三段人類舞者的參考影片舞步,套用到一隻狗、一隻章魚和一隻熊身上,並合成為一顆連續鏡頭。對打造虛擬角色或品牌吉祥物工具的人來說,基於參考的一致性是讓 AI 影片真正能上線的關鍵功能。
價格與可用性
Omni 1.1 Flash(模型 ID 為 gemini-omni-1.1-flash)現已透過 Google AI Studio 的 Gemini API 與 Gemini Enterprise Agent Platform 提供。Agent Platform 上的定價為:輸入(文字、圖片、影片、音訊)每百萬單位 1.50 美元,文字輸出(回應與推理)9.00 美元,影片輸出 17.50 美元。使用舊版 gemini-omni-flash-preview 端點的用戶請注意,它將於 2026 年 9 月 30 日除役——由於 API 結構延續,遷移到 1.1 相當直接。
誰已經在用它
Google 為這次上線準備了相當有說服力的客戶陣容。Adobe 已將 Gemini Omni Flash 整合進 Adobe Firefly 的影片編輯功能。Figma Weave 將它作為畫布上最強的影片模型之一,其創意總監指出,延伸、更豐富的參考素材與 4K 解析度,讓團隊「超越了生成影片,真正做到執導影片」。Runway 在自家模型之外提供 Omni Flash,形容它自然融入「提示→圖片→影片」的工作流程。GMI Cloud 則特別點出模型在教育與解說內容上的準確度——在細節經得起檢視的場景裡,可靠性比任何單一功能都重要。
為什麼重要
過去一年,生成式影片市場處於一種奇特的狀態:模型產出的秒數越來越驚人,但專業製作管線仍把 AI 產出視為需要大量修整的原始素材。差距從來不在原始品質,而在可導演性。導演與剪輯師的思考語彙是關鍵影格、場景連貫性與迭代成本,而多數影片模型對這三者視而不見。
Omni 1.1 的功能清單像是對這批評的直接回應:10 秒延伸上下文處理連貫性、首尾影格控制回應關鍵影格思維、360p 草稿解決迭代經濟學、4K 升頻負責完稿。單看每項都只是漸進更新,但合起來勾勒出的是一條可信的生產工作流程,而不是新奇展示。
競爭格局讓這一點更尖銳。OpenAI 的 Sora 系列、Runway 的 Gen 系列與 Kling 都在推升品質;差異化的戰場正轉向工作流程整合——而這正是 Google 分發優勢(AI Studio、企業級工具,加上 Adobe 與 Figma 等合作夥伴)發揮複利的地方。當一個模型只是創意團隊既有工具裡的一次 API 呼叫,轉換成本就站在既有者這邊。
仍有值得觀察的未知數。40 秒的累計場景長度是一大步,但距離敘事格式仍短;跨「多分鐘」的一致性還沒有被解決。影片輸出 17.50 美元的定價,意味著大量以完整解析度迭代會快速累積成本——這讓 360p 層級不是便利選項,而是經濟上的必需品。此外,預覽端點短短幾個月內就除役,顯示 Google 打算維持快速迭代節奏——對能力是好事,但 API 使用者得持續維護。
儘管如此,方向很清楚。隨著 Omni 1.1 Flash,生成式影片跨過了從「令人驚豔」到「可以被執導」的門檻——而這才是真正進入生產工作的關鍵。