我做了個新聞聯播版《甄嬛傳》,全靠這款字節模型

重點摘要
字節跳動推出音頻創作模型Seed Audio 1.0,可透過提示詞生成包含對白、音效與環境聲的完整聲音場景,並支援多語種與角色一致性。實際測試顯示,該模型在聲音模仿、複雜場景編排表現突出,但部分音頻仍帶有AI感,情緒細節與真實度有待提升。
字節跳動今日(7月20日)正式推出音頻創作模型Seed Audio 1.0,這款模型號稱僅需一段提示詞,就可生成包含對白、音效與環境聲的完整聲音場景,並支援多音頻元素協同生成、音色風格控制與多語種自然表達,還能維持長音頻中的角色一致性。根據官方說法,Seed Audio 1.0在複雜聲音場景編排上無需拼接,就能自然組織角色語氣、背景氛圍與聲音節奏,輸出更接近一段完整作品。 實際測試發現,Seed Audio 1.0確實能根據文字描述生成包含角色對話、環境音與音效的完整聲音片段。例如在一段辦公室場景中,模型還原了角色落寞的語氣、翻頁時的停頓,以及主管走過來時的高跟鞋聲響,整體氛圍相當到位。不過,部分場景下生成的音頻仍帶有AI感,情緒細節與真實度仍有提升空間。 Seed Audio 1.0的另一項亮點是能僅憑場景描述,直接生成角色對話,無需在提示詞中指定語氣或對白內容。測試時輸入一段描述:「螢光燈持續嗡鳴、冰櫃壓縮機低響、高速貨車不時駛過,低沉懸疑弦樂鋪墊,兩名中年男人分開站在窗口兩側,一人侷促不安反覆望向加油站入口,另一人單手插兜、神色冷淡散漫,兩人刻意保持距離互不靠近。」模型便生成一段兩名男子在高速加油站等待同夥接頭的懸疑場景,環境音與角色語氣成功營造出緊張氛圍,兩人的對話也對應了提示中一人緊張、一人散漫的設定。 在角色聲音一致性方面,測試以古風武俠對話為例,要求模型生成包含對白、音效與環境聲的完整場景。提示詞描述深秋密林濃霧籠罩、寒風呼嘯、遠處狼嚎,並指定兩名角色「蘇晚」與「沈硯」的年齡、聲線與情緒狀態。生成的音頻不僅還原了密林風聲、狼嚎、箭矢穿透、巨石碎裂等聲音元素,兩名角色的音色與語氣也與設定一致,蘇晚的兩段台詞沒有出現明顯的角色漂移。 Seed Audio 1.0的聲音模仿能力同樣突出。測試時先提供一段新聞聯播女聲參考音頻,再給出《甄嬛傳》中甄嬛的台詞文字,要求模型以新聞聯播女聲風格輸出。結果顯示,模型無需額外訓練就能生成模仿音頻,音色還原度高,辨識度明顯。這項能力讓創作者可以直接用文字描述目標聲音,或結合參考音頻進一步控制生成結果,無需為每一種聲音單獨訓練模型。 多語言能力也是Seed Audio 1.0的重點特色。測試以粵語為例,要求模型生成一段茶餐廳場景的對話,包含底層音效如瓷碗碰撞、抽油煙機低頻嗡鳴、鄰桌客人交談等。生成的音頻完整還原了茶餐廳背景音效,語氣與節奏掌握良好,但部分段落音色仍有AI感,尤其剛進入對話時較不自然,後續對話則相對流暢。官方宣稱該模型支援20餘種語言生成,多數語種的人聲自然度MOS平均分超過4分(4分為優質標準)。 官方評測數據顯示,Seed Audio 1.0在音色生成、複雜場景創作與多語種表達方面具備較強能力。在盲測主觀偏好CMOS打分中,該模型相較頭部商用音頻服務最高提升0.79,用戶更偏好其生成音頻;在電影、短劇、播客、動畫等十餘類場景測試下,整體音頻可用率達91%。 除了上述能力,Seed Audio 1.0還具備時間線控制功能,能將角色、台詞、情緒與音效按照時間線進行編排,支援100毫秒級的時間精度,讓生成音頻更符合影視、廣告等內容創作需求。官方展示了一段模型對影片的翻配,角色進場與說話時間都能精準卡點。此外,模型還能在同一音色基礎上生成不同風格的音頻,例如足球解說的高亢激昂、有聲書的平穩敘述,以及直播帶貨的快速強調。 從語音合成到音頻創作,AI音頻模型正逐步突破單一聲音生成的邊界。Seed Audio 1.0嘗試將對白、音效、環境聲與情緒表達統一在同一生成框架中,讓AI能夠理解完整聲音場景,而不只是輸出一段語音。隨著模型對聲音結構、角色一致性與時間控制能力的不斷增強,AI音頻正從輔助工具逐漸走向內容生產的核心環節。未來,如何讓生成聲音進一步貼近真人表達,並滿足更複雜的創作需求,將是音頻大模型持續探索的方向。
Related
相關文章

教培AI能走多遠,核心取決於國產模型走多遠
教培AI的未来边界,本质上是由底层国产大模型的迭代速度与深度所决定的。当前行业内卷的智能化工具,无论是作文批改、口语陪练还是个性化推题,其底层能力都高度依赖于语言模型的逻辑推理与生成质量。一旦国产模型在复杂语义理解或多模态能力上遭遇天花板,教培应用的功能与体验便会同步触顶,无法实现真正的突破。 这背后实际上隐藏着一个“进口替代”的逻辑。

WAIC 2026,AI硬件的狂歡?
WAIC 2026尚未开幕,但围绕AI硬件的讨论已提前升温。从算力芯片到终端设备,硬件创新正成为这场盛会的核心议题,似乎预示着AI竞争正从算法模型转向物理载体,“狂欢”之势初现端倪。 根据“AI竞争的下半场,具身硬件”这一判断,行业焦点正在转移。具身智能不再只是软件层面的迭代,更需要机器人与传感器等硬件作为落地支撑。

國內首款,腦虎科技硬膜下植入式柔性腦機接口進入“綠色通道”
腦虎科技今日宣佈,其自主研發的「植入式腦機接口手部運動功能代償系統」已通過國家藥品監督管理局醫療器械技術審評中心(CMDE)公示,正式進入創新醫療器械特別審查程序,即俗稱的「綠色通道」。這是國內首款獲得該通道資格的硬膜下植入式柔性腦機接口產品,標誌著我國在這一前沿醫療器械領域取得了里程碑式的突破。 創新醫療器械特別審查程序是國家藥監局為鼓勵醫療器械研究與創新、促進新技術推廣應用而設立的快速審批機制,入選產品須具備核心發明專利、顯著的臨床應用價值且技術處於國際領先水平。
拍照即修圖!Adobe推出全新AI相機工具,一鍵開啟智能修圖新時代
AI資訊AI新閒資訊正文拍照即修圖!Adobe推出全新AI相機工具,一鍵開啟智能修圖新時代發布於AI新閒資訊時間 :Jul 21, 2026閱讀 :1分鐘Adobe公司近期對其實驗性相機應用Project Indigo進行了重大更新,正式推出了全新的1. 1 版本。這次更新最大的亮點是加入了由生成式人工智能驅動的全新編輯模塊,讓手機攝影體驗得到大幅升級。
Loopie循環模型登場
Loopie循環模型登場。 新型的循環大模型最近刷新了性能紀錄。團隊開發的這款20B參數模型非常高效。根據循環模型論文它在⚙️同等算力下表現更強。新架構不需要額外工具就能解決複雜數理。該算法在測試中拿下了令人驚訝 (≧▽≦) 的金牌成績。

李飛飛第一篇「觸覺」論文:機器人會盲摸麻將了
李飛飛團隊發表首篇機器人觸覺感知論文,機器人可透過盲摸方式辨識麻將牌,展現缺乏視覺下的精細物件分類能力。該技術與SHARPA靈巧手結合,提供高解析度觸覺感測,為物理AI的感知能力開創新路徑,未來可應用於黑暗、高粉塵等視線受阻環境。