靈動聲紋與情感釋放:Google DeepMind推出Lyria 3.5音樂生成模型
重點摘要
AI資訊AI新閒資訊正文靈動聲紋與情感釋放:Google DeepMind推出Lyria 3.5音樂生成模型發布於AI新閒資訊時間 :Jul 30, 2026閱讀 :1分鐘日前,Google DeepMind官方正式在Google Flow Music平臺上推出了新一代音樂生成模型Lyria3.5。
Google DeepMind 於 7 月 30 日正式在 Google Flow Music 平臺上推出新一代音樂生成模型 Lyria 3.5,這是繼 Lyria 系列問世以來最重大的一次升級。新模型在音樂結構、歌詞品質、人聲表現力及創作控制力上均取得突破,不僅讓 AI 生成的音樂聽感更為真實自然,也首度賦予用戶接近專業數位音訊工作站般的調整靈活性,標誌著 AI 音樂創作正式從「有趣嘗試」邁向「專業應用」的新階段。Lyria 系列最初以「文字轉音樂」的示範引發業界關注,但當時生成的樂曲在旋律層次與人聲細節上仍有明顯的機械感。
經過多次技術迭代,DeepMind 團隊此次從底層模型架構著手,在保持高生成速度的同時大幅提升音樂的複雜度與細膩度。官方說明指出,Lyria 3.5 能夠構建更加豐富且複雜的旋律織體,不再只是單一的背景音軌,而是具備多聲部編排、和聲進階以及動態起伏的飽滿聲音設計。在核心音質與結構設計方面,Lyria 3.5 展現出更強的理解力。過去的 AI 音樂生成器常有歌詞與旋律脫節、結構重複單調的問題,新模型特別強化了語義理解與結構意識——歌詞生成模塊能夠根據提示詞的風格自動選擇用詞與韻律,使其更好地呼應整體曲風,同時段落的鋪陳與轉折更符合音樂理論,讓一首歌從前奏到尾聲都保有流暢的敘事性。
這意味著使用者不再需要對生成結果進行大量剪輯修改,便能得到結構完整的作品。人聲質感始終是 AI 音樂最容易被挑剔的環節,Lyria 3.5 在此處的進步尤為明顯。新版模型輸出的歌聲富有情感張力且發音清晰,大幅提升了完成品的感染力。據技術團隊透露,這次升級引入了改進的聲碼器與對抗訓練機制,讓虛擬歌手能夠表現出氣聲、顫音、尾音收放等微表情,聽起來更像是擁有真實演唱經驗的歌手,而非冰冷的合成音效。這種「聲紋」的靈動感,正是標題所強調的「靈動聲紋與情感釋放」。除了輸出品質,創作掌控力亦迎來飛躍。
過去許多 AI 音樂工具就像黑盒子,使用者只能輸入提示詞並等待結果,難以對節奏、時長或段落順序進行干預;Lyria 3.5 則提供了更直觀的控制接口,創作者可以調整輸出內容的節奏與時長,甚至指定哪些段落要重複或轉調。這種靈活性對於需要精確配樂的影像工作者、廣告製作人或遊戲音效設計來說極具吸引力,等於在 AI 輔助與人類主導之間取得了良好的平衡。Google Flow Music 作為 Lyria 3.5 的獨家發布平台,也承擔了從文字到成品的最後一哩路。
該平台設計了簡潔的創作流程:使用者輸入一段描述或關鍵詞,模型便能迅速生成帶有人聲與伴奏的完整歌曲;之後可在平臺上進行微調、預覽,並一鍵匯出高品質音檔。結合 Google 雲端生態,創作者還可邀請團隊協作編輯,或直接將作品發布到 YouTube 等串流服務,大大縮短了從靈感問世到發行上線的週期。值得注意的是,Lyria 3.5 亮相的時機,正值 AI 音樂領域百花齊放。
ElevenLabs 推出了 iOS 應用 ElevenMusic,讓用戶以自然語言生成音樂並整合社交功能;QQ 音樂則強調本地化 AI 作曲,藉由酷睿 Ultra 處理器實現完全離線創作,重視隱私保護;崑崙萬維的 Mureka 系列持續迭代,V7.6 與 O2 模型在全球用戶數快速增長;華納音樂更與 Udio 達成版權和解,預告 2026 年推出基於授權音樂訓練的創作訂閱平台。這些動態顯示,市場正同時往更好聽、更可控、更合法三個方向發展。Lyria 3.5 的競爭優勢在於 DeepMind 深厚的基礎研究積累,以及 Google 龐大的算力與數據資源。
新模型在音樂結構的專業度和人聲擬真度上,普遍獲得早期試用者的好評。對比 ElevenLabs 的社群娛樂取向與 QQ 音樂的本地輕量化路線,Lyria 3.5 瞄準的是高品質創作市場,目標用戶包含音樂製作人、詞曲作者與多媒體內容創作者。版權與倫理問題也是此次發布不可忽視的環節。華納音樂與 Udio 的和解案顯示主流唱片公司開始接受授權訓練模式,為 AI 音樂的商業化鋪平道路。雖然 Google 尚未公布 Lyria 3.5 訓練數據的具體來源,但官方強調將遵循 Google 人工智慧原則,確保生成的內容不侵犯原創權利,並預計在未來版本中引入更透明的數據溯源機制,讓創作者與版權方都能受益。
Lyria 3.5 的發布不僅是技術參數上的升級,更代表 AI 音樂正在從「生成」走向「協作」。專業音樂人可以將其當作靈感催化劑,快速產出 Demo 或嘗試不同風格;業餘愛好者則可能因為低門檻而開啟創作之路。DeepMind 在說明中也提到,這一代模型在「人機協作」的體驗上下了許多功夫——不是取代人類藝術家,而是讓 AI 成為一位稱職的合奏夥伴。展望未來,Lyria 系列很可能進一步與 Google 生態系深度結合。想像在 YouTube 創作工具中直接呼喚 Lyria 生成背景音樂,或透過 Google Assistant 口述旋律便錄製成曲。
隨著模型持續迭代與終端計算能力的提升,即時互動式的音樂生成也不再遙遠。Google Flow Music 平台也透露將在後續更新中加入更多音色庫與風格模板,讓 Lyria 3.5 不僅是模型,更是一個持續進化的創作生態系。總而言之,Lyria 3.5 的推出,代表 AI 音樂模型在「聽感自然」與「創作可控」這條路上又踏出堅實一步。它證明了機器不僅能學會音符的排列組合,更能開始理解音樂中的情感流動與敘事節奏。當聲紋不再僵硬,情感得以釋放,AI 與人類在音樂創作上的距離正在快速縮短,一個更動聽的未來已然展開。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。