字節發佈 Seed Audio 1.0 音頻創作模型:支持精細時間控制,音色風格可控、長時穩定

重點摘要
首頁 > 智能時代>人工智能 字節發佈 Seed Audio 1.0 音頻創作模型:支持精細時間控制,音色風格可控、長時穩定 2026/7/20 14:43:25 來源:IT之家 作者:沁滄(實習) 責編:沁滄 評論: 感謝IT之家網友 Domado 的線索投遞! IT之家 7 月 20 日消息,字節跳動 Seed 官方今日發佈了音頻創作模型 Seed Audio 1.
7月20日,字节跳动Seed官方正式发布音频创作模型Seed Audio 1.0。该模型面向完整声音场景,在统一框架下联合建模人声、音效和环境声等多种音频要素,能够端到端完成影视级音频创作。官方表示,声音不再只是画面的补充,而是可以直接参与叙事,在听者脑海中形成画面感,真正实现“听见”即“看见”。 Seed Audio 1.0具备多要素统一编排能力,支持精细的时间控制。用户只需输入一条提示词,即可统一编排带有特定情绪的对话、关键音效和环境声,并能够按时间线精准控制不同声音的进场顺序与持续时间,确保声音与画面完美同步,满足高标准影视制作需求。 在音色风格控制方面,模型支持文本与参考音频联合输入,在生成长音频或进行多次延长场景下,能始终保持角色音色的一致性与稳定性。同时,同一音色还能依据上下文自然呈现出多种语气和情绪,使角色声音更加生动立体,富有表现力。 多语种自然生成是该模型的另一大亮点。Seed Audio 1.0支持超过二十种语言的音频生成,同一角色的声音可根据不同语言的特点,在发音、节奏与表达方式上呈现更自然的表现,从而实现跨语言的角色声音一致性,为多语种内容创作提供有力支持。 在文本生成音色的基础能力上,根据官方公布的AB主观评测结果,Seed Audio 1.0相比以往模型表现出显著优势,在音频的可用率与优良率上均有明显提升,标志着其生成音质的自然度与逼真度达到了新水平。 针对多场景音频生成的适用性,官方评测了影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧以及语音合成等多个典型场景。结果显示,在绝大多数场景中,Seed Audio 1.0生成的音频可用率均已达到百分之九十以上,展现出广泛的业态势覆盖能力和稳定的生成质量。 在多语言音频生成的自然度评测中,模型在大部分语言上的平均意见得分超过四分,音质已达到优秀水准,听感自然流畅。这表明其跨语言合成能力能够胜任高品质音频内容制作。 在复杂音频生成的指令遵循能力上,除越南语外,其余语言的指令遵循平均意见得分均高于三点五分,说明Seed Audio 1.0能够准确理解并执行用户通过自然语言下达的指令,在多语言场景下依然保持较强的可控性与准确性。 目前,Seed Audio 1.0已正式在火山方舟体验中心上线,感兴趣的用户可通过官方链接免费进行体验。这台为内容创作者、影视制作人员及多媒体爱好者提供了一个高效便捷的音频创作工具,显著降低了专业音频制作的入门门槛。 作为字节跳动在人工智能生成领域的重要技术成果,Seed Audio 1.0的推出丰富了Seed系列的产品矩阵,也展现了其在音频理解与生成方面的技术积累。未来,该模型有望在更多场景中发挥作用,推动音频创作向智能化、高效化发展。 总体而言,Seed Audio 1.0凭借其细腻的多要素控制、稳定的角色音色以及出色的多语言能力,为影视级音频创作提供了全新的解决方案。从对白到环境声,从单语种到多语种,模型都能够胜任,真正让“听见”即“看见”从概念走向实际应用。
Related
相關文章

階躍星辰,還是有點急了
階躍星辰,還是有點急了藍媒匯2026.07.21 08:52 · 來自天津全文3056字00:00 / 08:58是好棋,還是豪賭?文 | 藍媒匯,作者 | 封華,編輯 | 魏曉剛結束的WAIC(世界人工智能大會)上,手機有了很多新花樣。榮耀把創新形態的Robot Phone推到臺前,試圖直接定義“機器人手機”;中興努比亞聯手豆包,要將第二代豆包手機敞開賣。最激進的當屬階躍星辰。7月13日,階躍星辰一口氣推出了大模型原生AI終端品牌STEPX、智能體原生操作系統階躍Step AOS、個人智能體Amoo,以及大模型原生智能體手機階躍STEPX Neo。“幹晚了,就不用幹了。”階躍星辰董事長印奇的一句話,講述了“大跨步”的原因——“全球首款大模型原生智能體手機”唯一的定義權,階躍星辰要搶到手。與此同時,7月15日,網信辦發佈“手機端側生成式人工智能服務”備案信息,為手機的AI Agent進程鋪路。這場AI手機混戰,是手機廠商、大模型廠商、互聯網公司之間,圍繞用戶入口的話語權分配。對於階躍星辰這樣的AI大模型廠商來說,意味著商業模式的重構,特別是在推進IPO的關頭上,意義非凡。不過,沒有硬件基因的階躍星辰,真能突破App生態、操作系統和商業模式之間的壁壘嗎?此次究竟是鎖定未來定義權的好棋,還是一次激進的豪賭?給安卓打工?階躍星辰的野心很大。智能體手機的整機製造,交由ODM廠商華勤技術負責,階躍則把最核心的資源放在軟件和AI能力上。其提出的路線更靠底層:以智能體的需求為核心,從零構建一套獨立操作系統。Step AOS在底層做了三件事:統一算力調度,彈性調配CPU、GPU、NPU 等異構算力;統一語義數據層,將感知、行為與個人數據加工為標準格式;原子化能力引擎,拆解系統功能為智能體可直接調度的服務,用戶無需逐個打開App,所有應用能力均由階躍Amoo統一調用。由此,同一臺STEPX

智譜保衛硅谷
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作智譜保衛硅谷錦緞·2026年07月21日 08:36地緣無法阻擋代碼的流動 上週,全球最大的AI開源社區Hugging Face遭遇入侵。攻擊者是一個完全自主的AI智能體系統,在大量短生存期沙盒中執行了數千個獨立操作,在一個週末內橫向移動進入了多個內部集群。這是一次被行業預測多年、但首次在現實中完整上演的“智能體攻擊”。 事件發生後,Hugging Face的安全團隊需要分析攻擊者留下的超過17000條事件日誌。他們首先使用了商用API背後的某美國前沿大模型。結果被攔住了。Hugging Face在事件報告中的原話是:“分析需要提交大量真實的攻擊命令、漏洞利用載荷以及C2痕跡數據,而這些請求被服務提供商的安全護欄攔截了——它們無法區分事件響應者和攻擊者。” 翻譯成直白的話:美國AI的“安全機制”,在真正的安全危機中,把防禦者的手綁住了。 於是,Hugging Face的工程師們做了一個讓整個硅谷側目的決定:他們下載了中國智譜的開源模型GLM 5.2,在自己的基礎設施上跑完了全部取證分析。危機解除。 這是一次發生在安全戰場的意外交鋒,但它的隱喻遠遠超出了安全本身。當全球最大的AI開源社區在遭遇攻擊時,最終用一隻中國模

AI巨頭正在爭奪人類的錯題本
AI巨頭正在爭奪人類的錯題本深流研究所2026.07.21 08:43 · 來自北京全文5549字00:00 / 15:50有反饋的錯題,才能帶來複利。文 | 深流研究所,作者 | 山杉7月,AI大戰最關鍵的一條戰線陡然升溫。10日凌晨,奧特曼重擺陣形,發佈新版ChatGPT桌面端。原本獨立的Codex被併入其中,變成一個標籤頁,夾在“Chat”和“Work”之間。看起來是幾項產品調整,背後意味卻完全不同。新版桌面端的三個標籤,幾乎就是OpenAI下一階段的作戰地圖:Chat是過去的入口,Codex對準程序員的終端,Work則瞄向表格、文檔和辦公流程。過去只坐在聊天框裡的ChatGPT,如今開始走進電腦桌面,將之變成工位,在代碼、辦公兩條線同時幹活。奧特曼顯然著急了。這場圍繞coding和辦公場景的爭奪戰,直接燒到了家門口。最難纏的是Anthropic。其Claude Code最初只是被當成又一個編程助手。到了4月,Claude Mythos在SWE-bench上拿到93.9%。這個榜單考驗的是讓模型進入真實的GitHub倉庫,修復那些曾經摺磨過真人程序員的歷史bug。程序員隨即湧入。Claude Code 由此大舉進入企業代碼庫,接手真實項目,佔住了程序員的終端。嚐到coding的甜頭後,Anthropic又把同一套打法推向了辦公。Claude Cowork接管表格、文檔和企業流程,這條戰線任務鏈更長、用戶更多,正是OpenAI那個"Work"標籤瞄準的同一塊陣地。靠著coding和辦公Agent撕開的商業化缺口,Anthropic的ARR從年初的140億美元暴漲至470億,估值陡然飆升至接近萬億美元,反超OpenAI;其企業市場份額34.4%,同樣實現反超。在其他AI企業都受困於商業模式時,Anthropic率先奪得了市場的青睞。不止於此。在商業數據之外,奧特曼們也看到

Kimi K3爆火,GPU先扛不住了
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作Kimi K3爆火,GPU先扛不住了36氪的朋友們·2026年07月21日 08:32一場關於推理算力的現實考驗。 因為太過火爆,距離Kimi K3發佈不到一週,月之暗面就按下了“暫停鍵”。 7月19日晚,月之暗面宣佈,由於算力資源緊張,暫停開放Kimi新用戶訂閱,將有限算力優先保障現有訂閱用戶。 圖源:月之暗面 7月20日,月之暗面回應界面新聞稱,此次調整僅涉及新用戶訂閱,現有會員權益保持不變,老套餐並未取消,已訂閱用戶仍可正常使用並按原規則自動續費。 對於此前手動關閉自動續費的用戶,公司將陸續恢復續訂功能,老用戶升級套餐等功能也將逐步開放;至於新套餐,目前仍因算力資源限制暫未開放購買,恢復時間尚未確定。 從官方回應來看,此次調整更像是在有限算力資源下,對新增用戶和存量用戶體驗進行重新平衡,而非對會員體系進行調整。 K3發佈後,國內外開發者社區迅速湧現大量體驗和測評,不少人將它與Claude、GPT等國際頭部模型放在一起比較,圍繞推理成本、GPU資源、服務穩定性的討論,也開始取代Benchmark,成為AI圈新的焦點。 K3到底有多火? K3發佈後,很快登上了全球AI模型討論的焦點。 獨立AI模型評測機構Arti

Edge AI Daily 早報(7月21日)
OpenAI模型突破數學難題後暴露安全困境,揭示長週期自主模型評測盲區。Alphabet將Gemini架構嵌入Frozen v2芯片,算力效率提升6-10倍,標誌AI競賽從規模轉向效率。SpaceX向鴻海下達520億美元AI服務器訂單,打破戴爾-超微壟斷,顯示算力產業邊界重構。
