我做了個新聞聯播版《甄嬛傳》,全靠這款字節模型

2026年7月20日 21:24
我做了個新聞聯播版《甄嬛傳》,全靠這款字節模型

重點摘要

字節跳動推出音頻創作模型Seed Audio 1.0,可透過提示詞生成包含對白、音效與環境聲的完整聲音場景,並支援多語種與角色一致性。實際測試顯示,該模型在聲音模仿、複雜場景編排表現突出,但部分音頻仍帶有AI感,情緒細節與真實度有待提升。

站內 AI 整理稿

字節跳動今日(7月20日)正式推出音頻創作模型Seed Audio 1.0,這款模型號稱僅需一段提示詞,就可生成包含對白、音效與環境聲的完整聲音場景,並支援多音頻元素協同生成、音色風格控制與多語種自然表達,還能維持長音頻中的角色一致性。根據官方說法,Seed Audio 1.0在複雜聲音場景編排上無需拼接,就能自然組織角色語氣、背景氛圍與聲音節奏,輸出更接近一段完整作品。實際測試發現,Seed Audio 1.0確實能根據文字描述生成包含角色對話、環境音與音效的完整聲音片段。例如在一段辦公室場景中,模型還原了角色落寞的語氣、翻頁時的停頓,以及主管走過來時的高跟鞋聲響,整體氛圍相當到位。

不過,部分場景下生成的音頻仍帶有AI感,情緒細節與真實度仍有提升空間。Seed Audio 1.0的另一項亮點是能僅憑場景描述,直接生成角色對話,無需在提示詞中指定語氣或對白內容。測試時輸入一段描述:「螢光燈持續嗡鳴、冰櫃壓縮機低響、高速貨車不時駛過,低沉懸疑弦樂鋪墊,兩名中年男人分開站在窗口兩側,一人侷促不安反覆望向加油站入口,另一人單手插兜、神色冷淡散漫,兩人刻意保持距離互不靠近。」模型便生成一段兩名男子在高速加油站等待同夥接頭的懸疑場景,環境音與角色語氣成功營造出緊張氛圍,兩人的對話也對應了提示中一人緊張、一人散漫的設定。

在角色聲音一致性方面,測試以古風武俠對話為例,要求模型生成包含對白、音效與環境聲的完整場景。提示詞描述深秋密林濃霧籠罩、寒風呼嘯、遠處狼嚎,並指定兩名角色「蘇晚」與「沈硯」的年齡、聲線與情緒狀態。生成的音頻不僅還原了密林風聲、狼嚎、箭矢穿透、巨石碎裂等聲音元素,兩名角色的音色與語氣也與設定一致,蘇晚的兩段台詞沒有出現明顯的角色漂移。Seed Audio 1.0的聲音模仿能力同樣突出。測試時先提供一段新聞聯播女聲參考音頻,再給出《甄嬛傳》中甄嬛的台詞文字,要求模型以新聞聯播女聲風格輸出。結果顯示,模型無需額外訓練就能生成模仿音頻,音色還原度高,辨識度明顯。

這項能力讓創作者可以直接用文字描述目標聲音,或結合參考音頻進一步控制生成結果,無需為每一種聲音單獨訓練模型。多語言能力也是Seed Audio 1.0的重點特色。測試以粵語為例,要求模型生成一段茶餐廳場景的對話,包含底層音效如瓷碗碰撞、抽油煙機低頻嗡鳴、鄰桌客人交談等。生成的音頻完整還原了茶餐廳背景音效,語氣與節奏掌握良好,但部分段落音色仍有AI感,尤其剛進入對話時較不自然,後續對話則相對流暢。官方宣稱該模型支援20餘種語言生成,多數語種的人聲自然度MOS平均分超過4分(4分為優質標準)。官方評測數據顯示,Seed Audio 1.0在音色生成、複雜場景創作與多語種表達方面具備較強能力。

在盲測主觀偏好CMOS打分中,該模型相較頭部商用音頻服務最高提升0.79,用戶更偏好其生成音頻;在電影、短劇、播客、動畫等十餘類場景測試下,整體音頻可用率達91%。除了上述能力,Seed Audio 1.0還具備時間線控制功能,能將角色、台詞、情緒與音效按照時間線進行編排,支援100毫秒級的時間精度,讓生成音頻更符合影視、廣告等內容創作需求。官方展示了一段模型對影片的翻配,角色進場與說話時間都能精準卡點。此外,模型還能在同一音色基礎上生成不同風格的音頻,例如足球解說的高亢激昂、有聲書的平穩敘述,以及直播帶貨的快速強調。從語音合成到音頻創作,AI音頻模型正逐步突破單一聲音生成的邊界。

Seed Audio 1.0嘗試將對白、音效、環境聲與情緒表達統一在同一生成框架中,讓AI能夠理解完整聲音場景,而不只是輸出一段語音。隨著模型對聲音結構、角色一致性與時間控制能力的不斷增強,AI音頻正從輔助工具逐漸走向內容生產的核心環節。未來,如何讓生成聲音進一步貼近真人表達,並滿足更複雜的創作需求,將是音頻大模型持續探索的方向。

Related

相關文章

天才,對AI發展到底有多重要?

加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

剛剛

Jeff Dean們,趕在貝葉斯AI到來之前跳船

Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

3 小時前

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分

Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

6 小時前

智元下架了首席科學家羅劍嵐

智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。

9 小時前