字節跳動發佈Seed Audio 1.0:音頻生成從“會說”邁向“會創作”

2026年7月20日 06:025400 次瀏覽

重點摘要

AI資訊AI新閒資訊正文字節跳動發佈Seed Audio 1.0:音頻生成從“會說”邁向“會創作”發布於AI新閒資訊時間 :Jul 20, 2026閱讀 :1分鐘近日,字節跳動正式推出音頻創作模型Seed Audio1.0,標誌著AI音頻生成技術從單一語音合成階段,邁入完整聲音場景創作的嶄新階段。該模型目前已上線火山方舟體驗中心,向創作者開放測試。

站內 AI 整理稿

# 字節跳動發佈Seed Audio 1.0:音頻生成從“會說”邁向“會創作”,AI全面賦能影視級聲音創作

在人工智能技術飛速迭代的當下,音頻生成領域迎來了一場具有里程碑意義的變革。近日,字節跳動正式推出其自研的音頻創作模型——Seed Audio 1.0。這不僅僅是一次技術版本的更新,更標誌著AI音頻生成技術從過去單一、機械的語音合成階段,正式邁入了能夠理解敘事邏輯、完整創作聲音場景的嶄新時代。目前,該模型已率先上線火山方舟體驗中心,面向廣大創作者開放測試,預示著高質量音頻內容生產的門檻將被大幅降低。 ## 顛覆傳統:從“拼接式製作”到“端到端創作”

長期以來,影視級別的音頻內容生產流程極為繁複。創作者通常需要依賴多個不同的模型或工具分別生成人聲對白、環境音效以及背景氛圍聲,隨後再通過後期軟件進行人工對齊、拼接與混音。這套流程不僅耗時費力,更關鍵的是,由於各音頻要素獨立生成,極難保證整體敘事的一致性與協調性,音頻與畫面之間的情感聯動往往大打折扣。 Seed Audio 1.0的核心突破正在於此。它並非簡單地將不同來源的素材進行物理拼接,而是在一個統一的深度學習框架下,聯合建模對白、音效、環境聲等多種音頻要素。模型能夠理解文本腳本中的情節推進與情緒變化,進而端到端地生成一個可直接服務於敘事的“完整聲音作品”。這意味著,AI第一次具備了“導演思維”,能夠從創作全局出發進行聲音設計。 ## 三大核心能力解碼:精準、穩定與地道

據官方技術介紹,Seed Audio 1.0之所以能夠實現從“會說”到“會創作”的跨越,源於其具備的三項極具競爭力的核心能力。 其一是**精準的時空編排能力**。在影視配音和廣告製作中,聲音與畫面的嚴格同步是基本要求。Seed Audio 1.0支持以100毫秒為單位的高精度時間線控制,創作者可以極其精確地指定某句對白或某個特定音效(如關門聲、腳步聲)的入場時機。這種精細化的控制力,使得AI生成的音頻能夠完美適配快節奏剪輯的視頻內容,告別了以往“音畫不同步”的尷尬。 其二是**穩定的音色演繹與情感表達能力**。該模型支持零樣本生成與長音頻延展。這意味著,創作者無需預先提供大量音頻素材進行訓練,模型就能在極長的音頻生成過程中,始終保持特定角色音色的一致性和穩定性。更為難得的是,在保持音色統一的基礎上,模型還能自然呈現出憤怒、喜悅、悲傷、平靜等不同細膩情緒,甚至允許同一音色在同一作品中演繹多個不同性格的角色,這為聲音演員和內容創作者提供了前所未有的創作自由度。 其三是**地道的多語種支持能力**。在全球化的內容傳播背景下,語言本土化是一個重要課題。Seed Audio 1.0覆蓋了包括中文、英語、日語在內的20餘種語言。與市面上許多僅能進行“翻譯式朗讀”的模型不同,它能夠深入理解不同語言的表達節奏、語調重音以及文化習慣,確保生成的聲音在不同語種下都能符合本土聽眾的聽覺習慣,實現真正的“入鄉隨俗”。 ## 評測數據亮眼:以實力證明可用性

技術的突破最終需要數據來說話。根據官方公佈的評測結果,Seed Audio 1.0在九大類常見的創作場景中,音頻的可用率已穩定超過90%。這一數據意味著,在絕大多數應用場景下,AI生成的音頻素材經過簡單調整甚至無需調整即可直接使用。此外,在多語言生成的自然度評測中,模型的MOS評分(主觀聽覺質量評分)普遍達到了4分以上,屬於業界公認的優秀水平。這一系列數據強有力地證明了Seed Audio 1.0不僅僅是實驗室裡的技術展示,更是具有極高商業化落地價值的生產力工具。 ## 降低創作門檻,賦能內容新生態

對於廣大內容創作者而言,Seed Audio 1.0的發佈無疑是一個重大利好。過去,想要製作出具有電影質感的聲音作品,往往需要昂貴的錄音設備、專業的聲學環境以及經驗豐富的音頻後期工程師。如今,藉助AI的能力,無論是個人創作者製作自媒體短片,還是小型工作室承接商業廣告項目,都能夠以極低的成本獲得專業級的音頻解決方案。 這種從“工具型”向“創作型”的轉變,極大地壓縮了創意實現的路徑。創作者不再需要將大量精力耗費在繁瑣的技術調試上,而是可以將更多的時間和靈感投入到故事本身與藝術表達中。這不僅僅是效率的提升,更是對創作想象力的一次解放。 ## 未來展望:多模態融合與可控創作

值得一提的是,Seed Audio 1.0的發佈只是一個開始。據字節跳動團隊透露,未來該模型將進一步融合視頻參考等多模態輸入信息。這意味著,AI不僅能根據文字生成音頻,未來或許可以通過分析視頻畫面中的動作、場景色調以及人物微表情,自動生成與之完美匹配的動態音效和情緒音樂。此外,團隊還計劃探索可控翻譯技術,並持續優化長音頻的穩定性與分軌生成能力,讓創作者能夠像使用數字音頻工作站一樣,對AI生成的聲音作品進行更精細的後期編輯與調整。 ## 生態聯動:字節跳動的AI內容佈局

Seed Audio 1.0的問世,也是字節跳動在AI內容生成領域整體佈局的重要一環。從此前備受關注的視頻生成模型Seedance系列,到圖像創作模型Seedream,再到如今在音頻領域的深耕,字節跳動正在構建一個涵蓋“文、圖、音、視”的全鏈路AI創作生態。這些技術的協同效應不可小覷。例如,創作者未來或許可以使用Seedance生成視頻畫面,同時調用Seed Audio 1.0為其生成對白和音效,再通過豆包等AI助手進行腳本策劃與編輯,形成一條完整的AI創作流水線。 這一生態佈局不僅服務於專業的影視從業者,也在為字節跳動旗下的短視頻、社交、辦公等多個產品矩陣注入新的活力。可以預見,隨著Seed Audio 1.0等基礎模型的持續迭代與普及,AI將不再只是回答問題的助手,而將成為真正能夠“創作”的藝術夥伴。 ## 如何體驗與探索

目前,有興趣的創作者已經可以通過火山方舟體驗中心進行實際測試。具體路徑為:登錄火山方舟平台,在模型列表中選擇語音模型板塊,點擊“語音合成”下的“Doubao-音頻生成-1.0”即可開始體驗。詳細的技術細節與應用案例,也可訪問項目主頁(https://seed.bytedance.com/seedaudio1_0)進行查閱。隨著越來越多的創作者加入測試,Seed Audio 1.0的真實實力將在更多實際場景中得以驗證,並推動AI音頻創作技術不斷邁向新的高度。

Related

相關文章

鈦媒體生成式AI

階躍星辰,還是有點急了

階躍星辰,還是有點急了藍媒匯2026.07.21 08:52 · 來自天津全文3056字00:00 / 08:58是好棋,還是豪賭?文 | 藍媒匯,作者 | 封華,編輯 | 魏曉剛結束的WAIC(世界人工智能大會)上,手機有了很多新花樣。榮耀把創新形態的Robot Phone推到臺前,試圖直接定義“機器人手機”;中興努比亞聯手豆包,要將第二代豆包手機敞開賣。最激進的當屬階躍星辰。7月13日,階躍星辰一口氣推出了大模型原生AI終端品牌STEPX、智能體原生操作系統階躍Step AOS、個人智能體Amoo,以及大模型原生智能體手機階躍STEPX Neo。“幹晚了,就不用幹了。”階躍星辰董事長印奇的一句話,講述了“大跨步”的原因——“全球首款大模型原生智能體手機”唯一的定義權,階躍星辰要搶到手。與此同時,7月15日,網信辦發佈“手機端側生成式人工智能服務”備案信息,為手機的AI Agent進程鋪路。這場AI手機混戰,是手機廠商、大模型廠商、互聯網公司之間,圍繞用戶入口的話語權分配。對於階躍星辰這樣的AI大模型廠商來說,意味著商業模式的重構,特別是在推進IPO的關頭上,意義非凡。不過,沒有硬件基因的階躍星辰,真能突破App生態、操作系統和商業模式之間的壁壘嗎?此次究竟是鎖定未來定義權的好棋,還是一次激進的豪賭?給安卓打工?階躍星辰的野心很大。智能體手機的整機製造,交由ODM廠商華勤技術負責,階躍則把最核心的資源放在軟件和AI能力上。其提出的路線更靠底層:以智能體的需求為核心,從零構建一套獨立操作系統。Step AOS在底層做了三件事:統一算力調度,彈性調配CPU、GPU、NPU 等異構算力;統一語義數據層,將感知、行為與個人數據加工為標準格式;原子化能力引擎,拆解系統功能為智能體可直接調度的服務,用戶無需逐個打開App,所有應用能力均由階躍Amoo統一調用。由此,同一臺STEPX

剛剛

智譜保衛硅谷

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作智譜保衛硅谷錦緞·2026年07月21日 08:36地緣無法阻擋代碼的流動 上週,全球最大的AI開源社區Hugging Face遭遇入侵。攻擊者是一個完全自主的AI智能體系統,在大量短生存期沙盒中執行了數千個獨立操作,在一個週末內橫向移動進入了多個內部集群。這是一次被行業預測多年、但首次在現實中完整上演的“智能體攻擊”。 事件發生後,Hugging Face的安全團隊需要分析攻擊者留下的超過17000條事件日誌。他們首先使用了商用API背後的某美國前沿大模型。結果被攔住了。Hugging Face在事件報告中的原話是:“分析需要提交大量真實的攻擊命令、漏洞利用載荷以及C2痕跡數據,而這些請求被服務提供商的安全護欄攔截了——它們無法區分事件響應者和攻擊者。” 翻譯成直白的話:美國AI的“安全機制”,在真正的安全危機中,把防禦者的手綁住了。 於是,Hugging Face的工程師們做了一個讓整個硅谷側目的決定:他們下載了中國智譜的開源模型GLM 5.2,在自己的基礎設施上跑完了全部取證分析。危機解除。 這是一次發生在安全戰場的意外交鋒,但它的隱喻遠遠超出了安全本身。當全球最大的AI開源社區在遭遇攻擊時,最終用一隻中國模

剛剛
鈦媒體生成式AI

AI巨頭正在爭奪人類的錯題本

AI巨頭正在爭奪人類的錯題本深流研究所2026.07.21 08:43 · 來自北京全文5549字00:00 / 15:50有反饋的錯題,才能帶來複利。文 | 深流研究所,作者 | 山杉7月,AI大戰最關鍵的一條戰線陡然升溫。10日凌晨,奧特曼重擺陣形,發佈新版ChatGPT桌面端。原本獨立的Codex被併入其中,變成一個標籤頁,夾在“Chat”和“Work”之間。看起來是幾項產品調整,背後意味卻完全不同。新版桌面端的三個標籤,幾乎就是OpenAI下一階段的作戰地圖:Chat是過去的入口,Codex對準程序員的終端,Work則瞄向表格、文檔和辦公流程。過去只坐在聊天框裡的ChatGPT,如今開始走進電腦桌面,將之變成工位,在代碼、辦公兩條線同時幹活。奧特曼顯然著急了。這場圍繞coding和辦公場景的爭奪戰,直接燒到了家門口。最難纏的是Anthropic。其Claude Code最初只是被當成又一個編程助手。到了4月,Claude Mythos在SWE-bench上拿到93.9%。這個榜單考驗的是讓模型進入真實的GitHub倉庫,修復那些曾經摺磨過真人程序員的歷史bug。程序員隨即湧入。Claude Code 由此大舉進入企業代碼庫,接手真實項目,佔住了程序員的終端。嚐到coding的甜頭後,Anthropic又把同一套打法推向了辦公。Claude Cowork接管表格、文檔和企業流程,這條戰線任務鏈更長、用戶更多,正是OpenAI那個"Work"標籤瞄準的同一塊陣地。靠著coding和辦公Agent撕開的商業化缺口,Anthropic的ARR從年初的140億美元暴漲至470億,估值陡然飆升至接近萬億美元,反超OpenAI;其企業市場份額34.4%,同樣實現反超。在其他AI企業都受困於商業模式時,Anthropic率先奪得了市場的青睞。不止於此。在商業數據之外,奧特曼們也看到

剛剛

Kimi K3爆火,GPU先扛不住了

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作Kimi K3爆火,GPU先扛不住了36氪的朋友們·2026年07月21日 08:32一場關於推理算力的現實考驗。 因為太過火爆,距離Kimi K3發佈不到一週,月之暗面就按下了“暫停鍵”。 7月19日晚,月之暗面宣佈,由於算力資源緊張,暫停開放Kimi新用戶訂閱,將有限算力優先保障現有訂閱用戶。 圖源:月之暗面 7月20日,月之暗面回應界面新聞稱,此次調整僅涉及新用戶訂閱,現有會員權益保持不變,老套餐並未取消,已訂閱用戶仍可正常使用並按原規則自動續費。 對於此前手動關閉自動續費的用戶,公司將陸續恢復續訂功能,老用戶升級套餐等功能也將逐步開放;至於新套餐,目前仍因算力資源限制暫未開放購買,恢復時間尚未確定。 從官方回應來看,此次調整更像是在有限算力資源下,對新增用戶和存量用戶體驗進行重新平衡,而非對會員體系進行調整。 K3發佈後,國內外開發者社區迅速湧現大量體驗和測評,不少人將它與Claude、GPT等國際頭部模型放在一起比較,圍繞推理成本、GPU資源、服務穩定性的討論,也開始取代Benchmark,成為AI圈新的焦點。 K3到底有多火? K3發佈後,很快登上了全球AI模型討論的焦點。 獨立AI模型評測機構Arti

剛剛
鈦媒體生成式AI

Edge AI Daily 早報(7月21日)

OpenAI模型突破數學難題後暴露安全困境,揭示長週期自主模型評測盲區。Alphabet將Gemini架構嵌入Frozen v2芯片,算力效率提升6-10倍,標誌AI競賽從規模轉向效率。SpaceX向鴻海下達520億美元AI服務器訂單,打破戴爾-超微壟斷,顯示算力產業邊界重構。

剛剛