谷歌推出 Gemini 3.8 Flash / Flash-Lite 文本轉語音模型,每一行臺詞都能精確控制

2026年9月23日 23:31
谷歌推出 Gemini 3.8 Flash / Flash-Lite 文本轉語音模型,每一行臺詞都能精確控制
站內 AI 整理稿

作者:小泵 責編:小泵 評論: 9 月 23 日消息,谷歌今日宣佈,Gemini 家族新增兩款全新文本轉語音模型,將語音生成從靜態預設轉變為動態創意工作室,能夠幫助創作者、開發者和企業打造更豐富、更具表現力的音頻體驗,同時為 Gemini Notebook 和 Google Vids 等產品改進用戶體驗。兩款新模型分別為 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,定位各有不同:Gemini 3.

8 Flash TTS:面向深度創意方向和角色設計,可通過自然語言提示從頭創建全新語音,在遊戲、沉浸式有聲讀物、播客和互動媒體中賦予角色生命力,還可對錶演提示、節奏、方言轉換等進行精細控制。Gemini 3.8 Flash-Lite TTS:面向大容量、高性價比規模場景,針對大容量配音、音頻內容創作和富有表現力的語音代理進行了優化,可對音調、節奏和表現力細微差別進行精細控制。據瞭解,用戶可以從原有 30 種原始語音擴展到無限語音庫。該模型的具體功能包括:生成式語音設計:可通過自然語言提示,在 100 多種語言和方言中自定義角色、口音和語音特徵,從頭創建定製語音。

擴展語音庫:可訪問 2000 多種現成語音,覆蓋廣泛語言,包括墨西哥西班牙語、魁北克法語、蘇格蘭英語等區域變體。語音複製:僅需 30 秒音頻樣本即可重現一致的聲音特徵,並內置同意驗證、SynthID 水印和 C2PA 憑據,保護開發者和聲音人才。保存與擴展:可保存和管理自定義語音,確保在持續項目中保持一致性能,最小化漂移。語音混音:即將推出,用戶可從語音庫中選擇一種語音,對音色、音高、節奏和口音進行微調,還可使用提示調整特徵。

選好聲音後,兩款 TTS 模型都能讓用戶精確控制每一行臺詞的演繹方式:逐行指導表演:用戶可以編寫自己的舞臺指導,或讓 Gemini 通過自然腳本提示引導交付,無論是平靜的客服還是低聲的懸疑場景,都能實現。長篇生成:在數小時的連續音頻中保持高語音質量、自然節奏和角色音色,揚聲器漂移極小,非常適合播客和有聲讀物。原生雙聲音場景編排:可從單個腳本中無縫指導多輪對話,同時保持兩種聲音清晰分離,實現自然的對話輪換。腳本化聲音爆發和背景反饋:可添加非語言提示(如 、、)和主動傾聽插入語(如 mhm 或 yeah),實現精確的喜劇時機和反應節奏,增添逼真的對話質感。性能方面,Gemini 3.

8 Flash TTS 在 Hume AI 的語音設計基準測試中(71.4 分)位居總體第一,在口音建模方面(60.8 分)也處於領先地位。Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 能夠在不犧牲可靠性的情況下實現真正富有表現力的性能,在 Hume AI 的整體質量指數中分別佔據第一和第二的位置,與 Gemini 3.1 Flash TTS 相比,在長格式內容和雙揚聲器劇本控制等廣泛用例中都有重大改進。在 Voice Arena 的盲法人類偏好評估中,Gemini 3.

8 Flash 和 Flash-Lite TTS 在全球主要語言(日語、巴西葡萄牙語、越南語、現代標準阿拉伯語、墨西哥西班牙語和印地語)競爭對手中佔據領先地位。憑藉對 100 多種語言的支持,這些模型能夠幫助創作者、開發者和企業在全球範圍內打造高質量的多語言語音體驗。谷歌在語音創建和複製功能中內置了嚴格的保護措施,以幫助保護語音人才、尊重身份並確保內容透明度。對於語音複製,系統會利用同意驗證:用戶必須提供來自語音所有者的口頭同意記錄,與參考說話者匹配後才能創建語音。

Gemini Audio 模型生成的每個音頻片段都帶有 SynthID 水印且難以察覺,並被直接編織到音頻輸出中,確保可以檢測到 AI 生成的語音,幫助防止錯誤信息。即日起,開發者就可以在 Google AI Studio 中體驗這些新的語音生成功能。用戶可以通過提示從頭開始創建全新的聲音身份,或者複製自己的聲音,然後將它們直接帶入雙揚聲器劇本編輯器,逐行指導交付。兩款模型均已向開發者推送,可在 Gemini API 和 Google AI Studio 中使用;面向企業用戶,很快將通過 Gemini Enterprise 中的 API 推出;面向所有用戶,Gemini 3.

8 Flash TTS 可在 Gemini Notebook 中使用,Gemini 3.8 Flash-Lite TTS 可在 Google Vids 中使用。需要注意的是,通過 AI Studio 進行的語音複製在伊利諾伊州、德克薩斯州、歐洲經濟區、英國、瑞士和印度不可用。

投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:谷歌,Gemini,語音克隆,文本轉語音,TTS谷歌首次公開 Gemini 越獄事件:在測試中自主入侵三家真實公司且自行終止,已通知涉事企業谷歌最強數學推理 AI 模型曝光:100 萬詞元上下文,專攻數學難題谷歌最強 AI 模型:Gemini 4 Pro 開測,SVG 生圖表現驚豔谷歌為 Win10/11 推出 Gemini 獨立客戶端,支持“Alt + Space”快捷鍵快捷喚起DeepMind 工程師反駁“谷歌搞不出前沿模型”:Gemini 3.

8 Cyber 已在多項測試中優於 Mythos谷歌終於向免費用戶開放 Gemini 每日簡報,無需訂閱

Related

相關文章

全天候科技生成式AI

小米18 Pro價格繼續上探,頂配版破萬元大關

鄭敏芳 發表於 2026年09月23日 15:36 摘要:國產直板旗艦的價格正在進一步向萬元檔靠攏。9月23日晚,小米正式發佈小米18 Pro系列。小...國產直板旗艦的價格正在進一步向萬元檔靠攏。9月23日晚,小米正式發佈小米18 Pro系列。

剛剛
IT之家生成式AI

羅福莉官宣小米 MiMo-V3 採用全新架構,核心 HySparse 2 今日發佈

作者:歸瀧 責編:歸瀧 評論: 9 月 23 日消息,小米 MiMo 大模型負責人羅福莉今日發文,宣佈 MiMo-V3 即將採用全新架構。其核心 HySparse 2 今日發佈,帶來更少的預填充、更小的 KV 緩存、更出色的長上下文檢索。在 1M(100 萬)Token 長度下,預填充計算量(FLOPs)降低 5.

剛剛
智東西生成式AI

不造手機,阿里憑什麼做AI手機“Agent底座”?

(公眾號:zhidxcom) 作者 | 李水青 編輯 | 漠影 9月23日報道,剛剛,網信部公告新增榮耀YOYO Claw等3款手機端側生成式AI服務備案。就在昨天,2026雲棲大會現場,榮耀剛宣佈即將發佈的Magic9系列將成為首批搭載阿里Qwen Intelligence的正式機型,榮耀Robot Phone同步支持。 此前蘋果智能國行版備案時,曾傳出引入千問大模型。如今榮耀與千問的合作首先“靴子落地”,AI手機產業分工格局加速變化。

剛剛
IT之家生成式AI

SpaceXAI 智能體 Grok Bot 上線首月,周用戶數突破 40 萬

作者:清源 責編:清源 評論: 9 月 23 日消息,據彭博社 22 日報道,SpaceXAI 的 AI 智能體 Grok Bot 上線約一個月,周用戶數便已突破 40 萬。據倫敦一場活動的演示材料和與會人士透露,截至 9 月 14 日,Grok Bot 用戶數達到 41.

剛剛

AI改寫遊戲和內容行業,年輕人“抽卡”抽出新職業

AI批量生產內容之後,一些新崗位開始出現,比如遊戲行業的“AI視覺原型設計師”,影視行業的“AI導演”“AI抽卡師”。一天就要產出5到10張能進評審的原畫。確認了角色與場景後,接下來兩天,再用AI大模型生成出粗略的3D模型,看到效果。以上兩條,是當下遊戲公司盛趣遊戲對於美術應屆生提出的最新要求。

剛剛