量子位模型更新

AI華語歌,終於能聽了!從零預訓練十億參數,告別「人機味」

2026年7月10日 12:52
AI華語歌,終於能聽了!從零預訓練十億參數,告別「人機味」

重點摘要

歌歌AI從零預訓練一個十億參數的華語音樂模型,透過雙流獨立生成架構改善AI中文歌的咬字與情感表達,告別「人機味」。該模型能一次生成完整立體聲歌曲,並與字節跳動簽訂版權分成合作,讓AI音樂可合法上架抖音等平台。此外,歌歌AI也啟動民樂專屬AI模型研發,計畫採集真實的傳統民樂聲音進行訓練。

站內 AI 整理稿

AI華語歌終於擺脫「人機味」!字節跳動入局,歌歌AI從零預訓練十億參數

AI生成的華語歌曲,終於不再讓人尷尬了。過去那種咬字飄忽、母語羞恥、濃濃的「人機味」——在這批新作品裡,幾乎聽不見。記者以一首自己喜愛的Jazz Hiphop為靈感,輸入歌詞讓模型進行零樣本生成,取名《關於小羊》。成果令人驚豔:Verse第四句開頭那個「塞」字的咬字,特意用帶停頓的短促發音製造律動,這是許多AI中文音樂從未注意到的細節;Pre-Hook前Bridge結尾的轉音,反覆聽了無數次;最驚喜的是最後一遍Hook,歌詞明明沒有寫,模型卻自己即興加了一段哼唱,手法與另一首名為《Coco》的作品結尾如出一轍。

另一版本的《關於小羊》同樣讓人有「很清爽」的感覺,這個詞已經很久沒有出現在AI歌曲的評價中。這款清爽的模型叫做「歌歌AI」,背後團隊只做一件事——讓AI音樂聽起來像中國人寫的歌。為了達成這個目標,他們從零開始預訓練了一個十億參數的模型,採用端到端設計:用戶輸入歌詞、風格情緒描述與指定歌手,模型一次性直接生成長達三分鐘、人聲與伴奏俱全的完整立體聲歌曲,還能同步輸出獨立的人聲分軌與伴奏分軌。為什麼不直接微調現有模型?這得從一個更根本的問題說起:為什麼以前的AI唱不好中文歌?市面上主流AI音樂模型從誕生之初就是為英語設計的,而漢語的演唱邏輯完全不同。

首先,中文每個字都有固定聲調,四聲之別讓「媽」和「罵」是完全不同的兩個字;其次,音節邊界清楚,英語可以連讀、吞音,中文一個字一個音節,一旦連得太厲害就聽不懂;第三,字音對齊邏輯不同,英語是重音計時型語言,一個音節拉多長都行,中文則要精準掌握哪個字落在哪個拍子上,輕聲助詞如「的、了、著」不能亂拖。基於英語模型做本土化,等於強行讓外國人唱京劇,結果就是人聲機械生硬、情感空洞,對國風、華語流行、民謠等曲風適應極差。問題不在參數,在架構。歌歌AI選擇從零為華語音樂重新設計技術棧,主要有三層。第一層是「雙流獨立生成架構」。

傳統AI音樂的做法是人聲和伴奏各自生成後再硬疊在一起,缺少呼吸感;真人歌手是聽著伴奏的律動決定氣口和咬字,是一個心流過程。歌歌AI把這種「心流」搬進模型,採用原生雙流設計——人聲一條通路、伴奏一條通路,各走各的生成鏈路,中間透過跨流注意力機制,即時完成節奏與和聲的精準對齊。第二層是「音素時序軟對齊」。咬字一直是AI音樂的大坑,模型若搞不清每個字在時間軸上的精確位置和發音時長,就會出現音節錯位、字音模糊。歌歌AI在模型「開嗓」前先畫一張地圖,告訴模型每個字的拼音在時間軸上大致落在哪裡,這張地圖作為先驗知識注入生成過程,讓每個字的起落更加穩定。第三層是「分層多維條件控制」。

華語音樂與歐美音樂最大的差異在於情感表達:歐美直抒胸臆,華語含蓄細膩。細膩的人聲處理是華語流行樂壇黃金時代的標誌,但「細膩」難以用自然語言描述。歌歌AI透過一套分層多維條件控制體系,將情緒、曲風、調性等全局風格資訊透過AdaLN-Zero機制逐層調製模型的生成行為,從第一層到最後一層情緒基調始終貫通。更關鍵的是,他們在不同條件維度上各自裝了獨立的引導強度旋鈕,可以讓模型「貼緊歌詞情緒」同時讓「旋律自由發揮」,就像一個混音臺,混的不只是音軌,而是情緒本身。技術雖強,但AI音樂最尷尬的痛點在於商業閉環:用戶花五分鐘做一首歌,發朋友圈獲得幾十個讚後就沒有然後了,缺乏分發渠道的AI音樂只是高級玩具。

歌歌AI直接找到一張王牌——與字節跳動簽訂版權分成合作。使用者用歌歌AI生成的原創歌曲、錄音製品、MV版權內容,全部可以合規上架抖音、剪映、汽水音樂、西瓜視頻、今日頭條等字節系全家桶。億級創作者可以直接從歌歌AI的版權曲庫中選歌,用於短視頻配樂、直播間BGM、翻唱二創。歌曲在汽水音樂的會員付費、數字專輯、單曲售賣、平台廣告分成,以及番茄系平台有效播放產生的收益,全部依照合約約定真金白銀地分成結算。後續歌歌AI新生成的非獨家版權曲目還會自動納入授權曲庫,形成飛輪效應。最後,歌歌AI宣布正式啟動民樂專屬AI模型的研發項目。目前AI生成的國風音樂大多令人失望:古箏彈得像電子琴,戲曲比念稿還令人尷尬。

多數AI模型訓練素材來自網路上經過二次加工的電子音源,骨子裡的韻味早已被濾掉。歌歌AI決定自己補上這塊數據空缺,團隊將前往陝西老戲台找秦腔老藝人、去江南水鄉錄評彈琵琶、到雲南村寨採葫蘆絲和蘆笙、在陝北黃土高坡聽嗩吶,請非遺傳承人與民間老藝人在他們最熟悉的角落打開錄音機,錄下指尖自然流淌的聲音。這些一手採集的原聲將完成正版版權歸檔,用來訓練真正的民樂AI模型。傳統民樂在中國的處境並不樂觀,年輕人很少能說出五種傳統民族樂器,秦腔更是遙遠。不是沒有人想保護,有非遺項目、有紀錄片、有各種文化保護行動,但傳播太難了。

而AI可以讓這些聲音被記住,融進任何一首新創作中,再透過抖音等平台被千萬人刷到、用作短視頻配樂,甚至無意識哼唱出來。這或許就是最好的傳承——不需要只被供在博物館裡的傳承。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

1 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

1 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前