Google AI Releases Gemini Omni 1.1 Flash: 40-Second Scene Extension, First/Last Frame Control, and 4K Upscaling

2026年8月29日 14:30
站內 AI 整理稿

Google AI 正式發表 Gemini Omni 1.1 Flash:40 秒場景延伸、首末幀控制與 4K 解析度放大全面升級 Google 今日正式推出生成式多模態影片模型的最新生產版本 Gemini Omni 1.1 Flash。這是一次針對原生多模態影片生成與編輯能力的正式更新,鎖定創作者在實際影音產製過程中的關鍵痛點,從場景延展、畫面精準控制到高解析度輸出皆有所著墨,為 AI 影片生成工具樹立了新的應用標竿。此次更新並非僅止於效能層面的微調,而是將重心放在影片創作流程的實用性升級。Gemini Omni 1.

1 Flash 延續了 Google 一貫的原生多模態架構思維,並非只是單純的影片生成器,而是能夠同時理解並處理文字、影像與影片三種資料型態的整合式引擎。這也意味著使用者得以在同一個工作流程中,自然地進行跨格式的指令切換與素材融合,大幅降低過去必須在不同工具間來回切換所造成的效率損失與溝通落差。在這次備受矚目的功能清單中,場景延伸能力無疑是最大的亮點。透過 Gemini Omni 1.1 Flash,創作者可以鎖定一段既有的影片素材,讓模型自動生成後續的連貫內容,將原本片段的情節一舉延長至 40 秒。

這項能力的突破點在於時長的顯著提升,過去許多模型在執行延伸時,往往只能產出短短數秒且容易產生斷裂感的過場,導致敘事節奏被迫中斷。如今,40 秒的延伸長度讓 AI 影片從過去的單一「鏡頭」層級,開始具備建構完整「場景」的潛力。對於需要鋪陳情緒、交代事件來龍去脈或進行轉場設計的使用者而言,這無疑是相當實際的進展,也讓 AI 生成影片的完整性提升到了新的層次。與此同時,新版本加入了對首幀與末幀的明確控制功能。這項設計讓使用者不再只是被動地接受 AI 隨機生成的結果,而是能夠在生成開始前,先指定影片的起點與終點畫面,要求模型在兩張確認過的圖片之間,填補符合物理邏輯與視覺慣性的動態過程。

首幀與末幀控制在影視製作流程中有著舉足輕重的地位。透過設定明確的關鍵幀,創作者可以在生成前就先規劃好視覺的起承轉合,確保最終定格的畫面能精準呼應客戶需求或隱含的敘事意圖。對於強調「精準」的商業專案而言,這項功能賦予了導演與剪輯師以往難以想像的敘事主導權,能更有效地掌握影片節奏與視覺的連貫性。因應現今高標準的影像放映與輸出規格,Gemini Omni 1.1 Flash 也正式導入 4K 解析度放大功能。過往 AI 生成影片常因原生解析度不足,一旦放大檢視便容易出現細節模糊或破綻,往往無法滿足嚴苛的商業放映規格。

透過內建的 4K 放大機制,生成的影片內容現在可以進一步補足高畫質所需的細節層次,無論是投放於大型數位看板、串流平台或專業的公開簡報場合,都能呈現更為精細的畫質表現。這項升級補足了高畫質輸出的關鍵缺口,也大幅縮短了「概念快速驗證」與「最終成品輸出」之間的距離。過去創作者必須先以低解析度影片確認構圖與運鏡,再交由後期軟體進行繁瑣的放大修飾;現在則可以在生成階段就鎖定高規格的目標,讓整個工作流程更加一氣呵成。綜合上述功能,Gemini Omni 1.1 Flash 明顯將目標市場鎖定在廣告創意、社群短片製作以及專業影像的前期提案流程。

在廣告提案階段,創意團隊可以快速生成高畫質的影片草圖,透過首末幀的設定確認分鏡邏輯,再以場景延伸功能補足所需的秒數細節。如此一來,客戶在投入大量預算進行實拍前,就能透過 AI 生成的畫面明確想像最終成果的樣貌,進而降低溝通成本與決策風險。作為一項專為生產環境所設計的版本更新,Gemini Omni 1.1 Flash 並未單純追求某一方面的極致表現,而是試圖在生成品質與操作彈性之間取得平衡。它保留了 Google 模型在語意理解上的優勢,並透過更深度的控制參數,讓創作者能夠在自由嘗試與精準掌控之間自由切換,充分滿足不同類型專案的需求。

在實際的工作流程中,使用者可以仰賴模型的多模態整合特性,先以文字撰寫腳本,再以參考影像定義整體視覺風格,最後透過多段影片的串接與延伸完成剪輯邏輯。所有步驟皆能在統一的環境下順利完成,有效降低因轉檔、軟體切換或格式不相容所產生的摩擦,讓文字、影像與影片之間的跨形式生成與編輯流程更加順暢。綜合來看,Gemini Omni 1.1 Flash 的推出,顯示 Google 正將 AI 影片技術從純粹的技術展示,逐步推向可落地、可獲利的商業應用場域。

透過 40 秒場景延伸、首末幀控制與 4K 解析度放大這三大重要更新,新版本不僅強化了最終的輸出規格,更賦予創作者在敘事主導權上的顯著升級,預期將對專業影像內容的生產模式與創意發想流程帶來深遠的影響。

Related

相關文章

IT之家模型更新

國家數據局:截至 7 月底,我國智算總規模達到 245 萬 PFLOPS

作者:清源 責編:清源 評論: 8 月 29 日消息,據新華社報道,8 月 29 日,國家數據局相關負責人在 2026 中國國際大數據產業博覽會主題交流活動上表示,截至 2026 年 7 月底,全國智算總規模達 245 萬 PFLOPS(FP16),八大國家算力樞紐和三個算電協同發展區已建成智算規模佔全國比重超 85%,已有 145 萬 PFLOPS 智能算力納入國家級監測調度平臺監測範圍,算力資源集約化利用、一體化調度能力不斷增強。

剛剛
何夕2077模型更新

AAR露出自改進潛力

Training AI models with other AI models has become a very popular goal for neolabs — and now, a researcher in Anthropic’s fellows program has given us an early look at what it might look like in practice.

17 小時前
何夕2077模型更新

Keras解碼宇宙射線

Keras官方科學部落格近日發表最新應用,展示深度學習在宇宙射線研究上的突破。傳統上,分析宇宙射線需要從複雜的觀測資料中手動提取特徵,但這次研究團隊選擇讓模型直接讀取原始波形,跳過繁瑣的前處理環節。透過陣列探測器,系統能進一步提取出由13×13個站點組成的訊號圖,完整保留空間分佈資訊,作為神經網路的輸入。 這套以Keras打造的模型,核心任務是同時判斷宇宙射線抵達時的能量與來向。不同於過去仰賴人工判讀或簡化統計方法,端到端的深度學習架構能自動捕捉波形中細微的變化模式,讓事件重建的精確度獲得提升。

17 小時前
IT之家模型更新

靈掌機器人完成數千萬元天使輪融資

首頁 IT圈 最會買 設置 日夜間 隨系統 淺色 深色 主題色 黑色 投稿 訂閱 RSS訂閱 收藏 軟媒應用 App客戶端 要知App 軟媒魔方 業界 手機 電腦 測評 視頻 AI 蘋果 iPhone 鴻蒙 軟件 智車 數碼 學院 遊戲 直播 5G 微軟 Win10 Win11 專題 搜索 首頁 > 智能時代>具身智能 靈掌機器人完成數千萬元天使輪融資 2026/8/28 21:09:19 作者:潞源 責編:潞源 評論: 8 月 28 日消息,據《科創板日報》今天報道,工業具身機器人技術企業靈掌機器人近日完成數千萬元天使輪融資,投資方包括凱龍高科、遨博智能、錫創投、芯能創投。

20 小時前
鈦媒體模型更新

騰訊 WorkBuddy,學不會豆包工作?

藍洞商業2026.08.28 16:25 · 來自雲南全文4561字00:00 / 10:45騰訊 WorkBuddy 會整合企業微信嗎?文 | 藍洞商業,作者 | 趙衛衛字節跳動的豆包工作上線當天,騰訊雲與智慧產業事業群 CEO 湯道生髮布了一篇內部信長文。Chatbot 的戰役已經是過去時了, AI 辦公智能體才是當下的熱點。湯道生提到了過去一年元寶與豆包的競爭,承認對手值得學習,而元寶在巨大的用戶增長壓力下,花了較多精力去做推廣與引流,當時模型與產品都還沒 ready,其實效果並不滿意。

1 天前