何夕2077模型更新

萬頌生成五分鐘長歌

2026年7月18日 00:00

重點摘要

音樂生成基礎模型近期在業界引起高度關注,然而要同時實現高效率生成、高保真長音頻輸出,並支援可控性,仍是極具挑戰的課題。為解決這些需求,研究團隊正式發表了名為「萬頌」(WanSong)的全新模型,這是一個簡單而強大的長篇幅商業級歌曲生成方案。不同於當前的自回歸(AR)模型或由自回歸接續擴散的串聯多階段管線,萬頌採用純擴散(diffusion)基礎架構,能夠直接生成長達五分鐘、高保真度的多語言歌曲,並且在單次推理中同時輸出人聲與背景音樂雙音軌。 這項技術報告於7月16日發表在arXiv上,論文編號2607.

站內 AI 整理稿

音樂生成基礎模型近期在業界引起高度關注,然而要同時實現高效率生成、高保真長音頻輸出,並支援可控性,仍是極具挑戰的課題。為解決這些需求,研究團隊正式發表了名為「萬頌」(WanSong)的全新模型,這是一個簡單而強大的長篇幅商業級歌曲生成方案。不同於當前的自回歸(AR)模型或由自回歸接續擴散的串聯多階段管線,萬頌採用純擴散(diffusion)基礎架構,能夠直接生成長達五分鐘、高保真度的多語言歌曲,並且在單次推理中同時輸出人聲與背景音樂雙音軌。這項技術報告於7月16日發表在arXiv上,論文編號2607.

14749,由Binghui Chen、Pandeng Li、Yu Liu、Jingren Zhou等研究者共同撰寫,團隊來自與「萬一」(Wan-AI)相關的單位。報告詳細說明了萬頌的設計理念與效能表現,並指出其擴散框架可透過步蒸餾(step-distillation)技術實現更快的推理速度,同時也為下游編輯任務提供了高效率的微調與自訂化路徑。在音樂生成領域,現有主流方法多採用序列式的自回歸生成,或先由自回模型產生粗略結構再經由擴散模型細化,這種方式不僅耗時,也容易累積誤差。萬頌則跳脫此框架,直接以擴散模型從噪聲還原出完整音訊,避免了多階段管線的複雜度與延遲。

研究團隊強調,這項設計讓模型在生成五分鐘長歌曲時仍能維持一致的音質與結構,且支援中文、英文等多種語言的歌詞與演唱風格。更值得關注的是,萬頌在單次推理中即可分離出人聲(vocals)與背景音樂(background music)兩個獨立音軌,這對於後續混音、編曲或卡拉OK等應用場景極具實用價值。傳統上要獲得乾淨的分軌往往需要另外運算分離模型,而萬頌將此整合為原生輸出,大幅簡化了工作流程。在推理效率方面,研究團隊引入步蒸餾機制,讓模型在較少的擴散步驟下仍能生成高品質音訊,有效降低計算資源需求。

此外,擴散框架本身具備良好的可微調性,使用者可以針對特定歌手音色、樂器配置或編輯指令進行輕量訓練,擴展性相當靈活。消息發布後,學術社群也迅速展開討論。有網友在arXiv頁面留言詢問「這是開源還是閉源?」另有用戶則將萬頌與先前備受關注的Qwen Music相提並論,顯示業界對這類音樂生成基礎模型的進展抱持高度興趣。目前論文頁面已獲得9個正向評分,並被收錄在兩個專題收藏集中。萬頌的出現,標誌著音樂生成技術從多階段管線朝純擴散單階段方向邁出重要一步。其五分鐘長歌生成能力結合雙音軌輸出,為AI音樂創作、影視配樂、個人化音樂製作等領域提供了更具效率且可控的工具。

隨著論文公開,後續是否開放原始碼、模型權重或示範平台,將是開發者與創作者持續關注的焦點。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

2 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

2 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前