xAI升級 Imagine Video1.5:新增圖像語音參考與原生1080p視頻生成

2026年8月3日 02:007200 次瀏覽

重點摘要

xAI 為視頻生成模型 Imagine Video 1.5 推出重大升級,新增圖像參考、語音參考、純文本生成影片與原生 1080p 輸出能力,強化角色一致性與場景控制。目前文字轉影片與 1080p 功能已於 Grok Imagine 網頁版、iOS 及 Android 上線,圖像與語音參考功能率先提供給美國地區 SuperGrok Heavy 與 SuperGrok Plus 用戶,並計劃後續擴大覆蓋範圍。

站內 AI 整理稿

xAI 於近日為旗下影片生成模型 Imagine Video 1.5 推出重大更新,一口氣加入圖像參考、語音參考、純文字生成影片與原生 1080p 輸出等多項能力。這次升級讓 AI 影片創作在角色一致性、場景控制與畫面品質等面向都更加貼近專業製作需求,也讓創作者在產製內容時擁有更高的靈活性與可控性。 這波功能目前已陸續上線,其中文字轉影片與 1080p 高畫質生成已可在 Grok Imagine 網頁版、iOS 版與 Android 版使用。至於圖像參考與語音參考功能,則率先開放給美國地區的 SuperGrok Heavy 與 SuperGrok Plus 用戶體驗,xAI 也預告後續會逐步擴大適用到更多使用者,讓不同等級的訂閱用戶都能享受到這波模型升級帶來的便利。 從實際應用面來看,新版 Imagine Video 1.5 提供了更自由的創作流程。使用者可以直接輸入文字描述來生成影片,也能上傳參考圖像,以此鎖定特定角色、產品或場景的視覺風格。更進一步,創作者還可以將角色圖片與語音樣本結合在一起,交由 AI 在不同鏡頭之間維持角色外觀與聲音的一致性,大幅減少過去生成多段影片時常見的角色漂移或聲音不連貫問題。 值得注意的是,Imagine Video 1.5 單次生成最多可支援七個視覺參考,這些參考可以用來分別固定人物臉部、產品特徵或環境元素,讓內容控制達到更精細的程度。在多重參考模式之下,使用者可以保留角色身份直接替換背景,或維持場景不變但更換角色,也可以只調整動作而讓整體視覺設定保持原樣。這樣的設計讓創作者不必從零開始調整每個畫面,而是能在既有設定的基礎上進行局部變更,效率與創作自由度都明顯提升。 語音參考功能則是這次升級的另一大亮點,主要用來解決 AI 影片製作中的角色連續性問題。透過結合語音樣本與角色圖像,同一角色在多個影片片段中都能維持穩定的面部特徵與聲音表現,這對於需要大量對話場景或系列式內容創作的團隊來說尤其實用。未來若要製作具有連貫角色的短劇、廣告或多集式內容,這項功能有望成為關鍵輔助工具。 除了終端使用者的功能更新,xAI API 同步開放了相關能力。開發者目前已可透過 grok-imagine-video-1.5 模型來呼叫圖像引用、文字轉影片與原生 1080p 影片生成功能。API 端支援傳入提示詞、參考圖像 URL、影片時長、寬高比與解析度等參數,開發者可依實際需求彈性組合。至於語音參考功能,則需要透過請求方式另行接入,提供給有進階整合需求的團隊使用。 回顧 Imagine Video 1.5 的發展時程,該模型於上月才正式發布,當時 xAI 便表示這一代版本在運動表現、物理模擬與音頻生成方面都有顯著優化。如今相隔不到一個月便推出功能更新,顯示 xAI 正以相當快的節奏推進影片生成模型的迭代,也反映市場對於更精細控制工具的高度需求。 整體而言,這次升級進一步強化了模型對身份、場景與產品細節的掌控能力,讓 AI 影片生成從單純的畫面轉換,逐步走向更接近專業影視製作流程的多模態創作工具。當創作者可以同時指定視覺參考與語音參考,並透過 API 串接自動化工作流程,AI 影片生成的應用邊界也將隨之擴展。從社群內容創作、廣告製作到品牌行銷素材產出,這類功能都可能帶來實質影響,而有機會在未來成為影片生成領域的重要趨勢方向。

Related

相關文章

AI寫的書潛入線下書店,“稿子工整得有點嚇人”

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦安徽最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作AI寫的書潛入線下書店,“稿子工整得有點嚇人”新週刊·2026年08月03日 10:36“我的文字來自我撫摸過的真實世界。AI只撫摸過我的文字。” 當下的AI,已經不僅僅是協作工具,甚至成了“槍手”。不僅在網文領域,傳統出版社也出現了大量內容由AI生成的現象。而且,AI生成內容正在“進化”,不像以往那麼易於辨認,為甄別它們增加了難度。 就讀者而言,他們不希望什麼東西都由AI代勞。“AI的加入或許能讓書的內容更完美,但同時也模糊了作者身上關於這個世界的信號。” “毫不掩飾AI的痕跡”“到底誰允許這種AI廢料出版的?” 近日,社科類圖書《飯圈紀實:愛、數據和權力》被讀者批評其內容大量使用AI生成。目前,該書在豆瓣的評分已跌至5.3分,評論區湧入大量差評。 有讀者指出,書中有大量意義不明的修辭和生硬表達,疑似AI生成,例如這一句:“這種認知鴻溝,恰如深海魚與飛鳥的對話——前者在高壓黑暗中守護微光,後者在晴空下卻無從想象那束光的分量”“她們通過三重維度,在虛擬與現實交織的縫隙裡,一磚一瓦地建造抵禦原子化孤獨的堡壘。” 豆瓣評論區截圖。(圖/豆瓣) 面對爭議,該書第一作者馬中紅回覆媒體:“實事求是地講,我們就沒有用AI寫作。

剛剛
IT之家生成式AI

阿里巴巴千問 Qwen3.8-Max 模型正式上線,擁有 2.4 萬億個參數

首頁 > 智能時代>人工智能 阿里巴巴千問 Qwen3.8-Max 模型正式上線,總參數量 2.4 萬億 2026/8/3 10:31:02 來源:IT之家 作者:遠洋 責編:遠洋 評論: IT之家 8 月 3 日消息,今日,阿里巴巴千問 Qwen3.8-Max 人工智能模型正式上線,總參數量 2.4 萬億。官方稱,Qwen3.

剛剛
鈦媒體生成式AI

OpenAI 不靠最貴的模型賣錢了

OpenAI宣布GPT-5.6 Luna降價80%、Terra降價20%,並公開建議開發者依任務複雜度搭配不同模型,由最貴的Sol負責規劃、便宜的Luna負責執行,象徵不再以旗艦模型作為主要營收來源。Anthropic也跟進推出半價的Claude Opus 5,顯示兩大業者同步降低旗艦地位,轉向以低價衝刺調用量與生態黏性。文中也指出,模型已開始參與優化自身,帶動成本持續下降,AI競爭從「誰最聰明」轉向「誰最划算」。

剛剛
IT之家生成式AI

消息稱阿里內測 AI 辦公平臺“萬有無界”,多智能體協同交付

阿里雲正在內測針對B端的AI辦公平臺「萬有無界」,主打多智能體協同交付複雜項目,有別於千問辦公的日常辦公場景,目前所有功能免費,未來可能依任務規模推出付費版本。近期阿里也積極整併旗下AI辦公產品,並於7月底上線千問辦公官網,提供多種訂閱方案。

剛剛

OpenAI 不靠最貴的模型賣錢了

OpenAI 近日一紙價格調整公告,引發的討論遠不止於「降價」二字。七月三十日,OpenAI 宣布調整旗下模型價格,GPT-5.6 Luna 降價幅度高達八成,Terra 則降價兩成。乍看之下,這像是矽谷又一輪價格戰的開端,但翻開官方同步公開的技術文件與 API 調用指南,會發現真正值得關注的信號,藏在價格數字的背後。 這是 OpenAI 第一次明確告訴用戶:很多任務,其實不需要動用最強的模型。官方甚至給出了具體的建議流程——面對一項複雜任務,先讓 GPT-5.

剛剛