Gemini Omni 1.1 Flash:Google 以 40 秒場景、關鍵影格控制與 4K,讓 AI 影片正式邁向量產
Google 的 Omni 1.1 Flash 更新把生成式影片變成可控的製作管線:10 秒場景上下文、40 秒延伸、首尾影格插值、4K 放大,草稿價格每秒最低 0.03 美元。
兩年前,生成式影片還只是個炫技玩意兒:幾秒鐘閃爍不定的畫面,角色一轉頭就破功。2026 年 8 月 27 日,Google 推出了一項更新,迄今最有說服力地證明 AI 影片已經從展示品跨入量產工具的領域。Gemini Omni 1.1 Flash——這是 Google Omni 影片模型今年初問世以來的首次重大版本升級——是一整套面向開發者的創作控制功能,其功能清單讀起來不像模型改版,更像後期製作的檢核表。
Omni 1.1 新功能一覽
首要升級是場景延伸(scene extension)。過去的模型在續接影片時只能參考最後一秒的畫面,導致較長的序列不斷漂移:角色外觀改變、光線偏移、故事推進幾個鏡頭後就失去連貫性。Omni 1.1 在生成新畫面前會分析多達 10 秒的前置上下文,讓角色身分、動作與敘事狀態保持一致。場景可以每次延伸 10 秒,累積總長度可達 40 秒——這已經足夠容納一個完整的敘事段落,而不只是一張加長版的 GIF。
其次是首尾影格插值(first/last frame interpolation)。開發者可以指定一個鏡頭的起始與結束影格,模型會在兩個關鍵影格之間生成連續影片。這種控制對真正的剪輯工作至關重要:運鏡環繞、快速橫搖、推軌變焦(dolly zoom)與無縫循環,全部都可以透過錨定鏡頭的起點與終點來下達指令。在 Google 的示範素材中,鼓手的特寫鏡頭一個快速橫搖,帶出薩克斯風手與正在旋轉的芭蕾舞者——一鏡到底,沒有跳接。
第三是 4K 放大路徑。先快速且便宜地生成,再把選定的結果放大到 1080p 或原生 4K 交付。Google 明確針對「先草稿、後成品」的工作流程做最佳化:360p 草稿模式的生成速度最快提升 60%(依系統吞吐量計算),成本僅為 720p 的三分之一。對於習慣燒預算在全解析度生成、只為確認提示詞是否可行的團隊來說,光這一點就改變了迭代的經濟學。
第四是影片參考(video references)。Omni 1.1 接受最多三秒的上傳影片作為風格與動作參考,讓創作者能把角色、編舞與動作模式帶進新的生成結果。Google 的示範:把三段參考舞者換成一隻狗、一隻章魚和一隻熊,各自演出指定參考片段中的舞蹈,一鏡到底完成。
價格的數學
Omni 1.1 Flash 的每秒定價:360p 為 0.03 美元、720p 為 0.10 美元、1080p 理論上為 0.15 美元、4K 為 0.30 美元。這個定價經過精心布局——720p 與 Google 自家的 Veo 3.1 Lite 持平(0.10 美元),360p 草稿則全面低於市場上所有對手。一段完整的 40 秒 720p 場景約需 4 美元;同樣長度的 360p 草稿只要 1.20 美元。對於在確定主鏡頭前需要測試數十種版本的代理商與工作室而言,草稿級距才是真正的亮點。
誰已經在用了
Google 也藉這次發表展示採用成果。Adobe 已將 Gemini Omni Flash 整合進 Firefly;Figma Weave 將它作為創意畫布的核心影片引擎,創意總監 Itay Schiff 指出,延伸功能、更豐富的參考素材與 4K 解析度「讓團隊不只是生成影片,而是真正在執導影片」。Runway——名義上是 Google 在生成式影片領域的競爭對手——也在自家模型之外提供 Omni Flash,其創意長 Jamie Umpherson 形容它「自然融入人們既有使用 Runway 的方式」。GMI Cloud 則以教育內容為例,強調其細節「經得起放大檢視」。
最後這點其實比行銷話術更重要。外界對 AI 影片的一貫批評從來不是解析度,而是可靠性:手部、文字、物理效果與連貫性在細看時崩壞。10 秒的上下文視窗無法修好每一個瑕疵,但它直接攻擊了連貫性這個核心問題,而合作夥伴選擇 Omni 用於教育這類對準確度敏感的垂直領域,恰恰說明這一代模型比前代更撐得住嚴格檢視。
全面同步上線
有別於某些分階段推出,Omni 1.1 第一天就廣泛上線:Google AI Studio 與 Gemini API、企業用的 Gemini Enterprise Agent Platform,以及全球所有 Google AI Plus、Pro 與 Ultra 訂閱者的 Google Flow,場景延伸功能也同步在 Gemini 應用程式中開放。API 本身極簡——Google 文章中的程式碼範例只是一段簡短的 genai.Client() 呼叫,指定模型、先前的互動 ID 與目標解析度。低整合摩擦顯然是策略的一環。
為什麼重要
生成式影片市場正在收斂到一個論點:獲勝的模型不是單次生成最漂亮的那個,而是行為像一條可控製作管線的那個——負擔得起迭代的草稿、可以對其下指令的關鍵影格、能保留身分一致性的參考素材,以及通往交付解析度的放大路徑。OpenAI 的 Sora、Runway 的 Gen-4 與 Kling 都在競逐同一份檢核表。Omni 1.1 Flash 是目前為止最完整的版本,而且在草稿級距擁有最激進的價格。
「令人驚豔的展示」與「工作室能拿來計費的工具」之間的差距,向來在於控制、成本與可靠性。Google 這次同時轉動了這三個旋鈕。未來十二個月的 AI 影片競賽,重點不在模型能否生成美麗的幾秒鐘——這早就做得到了——而在誰能以製作預算吸收得起的價格,維持一個連貫的 40 秒場景。從這週起,這場競賽有了新的領先者。
Sources
- [1] https://blog.google/innovation-and-ai/technology/developers-tools/build-with-gemini-omni-1-1-flash/
- [2] https://the-decoder.com/googles-gemini-omni-1-1-flash-makes-ai-video-generation-cheaper-and-more-flexible/
- [3] https://ai.google.dev/gemini-api/docs/omni
- [4] https://ai.google.dev/gemini-api/docs/pricing