字節跳動 SeedRealtime 音視頻全雙工大模型發佈:支持邊看、邊聽、邊說,已上線豆包

重點摘要
字節跳動 Seed 推出原生音視頻全雙工大模型 SeedRealtime,以統一架構融合音頻、視頻與文本,實現邊看、邊聽、邊說的全模態自然交互。該模型具備音視頻聯合理解、主動交互與流暢節奏等核心突破,端到端評測顯示對話節奏問題減少一半。目前 SeedRealtime 已全量上線豆包 App,用戶更新後可透過視頻通話介面體驗。
字節跳動 Seed 團隊於 8 月 5 日正式宣佈推出原生音視頻全雙工大模型 SeedRealtime,這款模型採用統一架構,將音頻、視頻與文本三種模態原生融合,目標是讓 AI 在連續的多模態信息流上實現實時交互,為用戶帶來「邊看、邊聽、邊說」的全新體驗。此次發佈標誌著字節跳動在 AI 多模態互動領域的技術佈局進一步深化,也讓 AI 從單純的文字對話走向更接近人類自然交流的互動模式。 SeedRealtime 的核心突破之一在於音視頻聯合理解能力。模型原生支持聲音、畫面與時序信息的深度融合,在理解層面實現了多模態信息的同步處理。這項技術的實際效益在於,模型可以結合具體場景來消除同音詞的歧義,例如在嘈雜環境中或畫面輔助下,能更準確地判斷語意;同時也能理解視覺信息中的時序指代,例如在影片畫面中辨識「剛才那個人」或「下一個出現的物體」等帶有時間順序的指涉,讓所見、所聞與所說真正融為一體,提升整體理解的精確度。 第二項核心突破在於主動的交互能力。SeedRealtime 具備持續的環境感知與主動表達能力,模型能在察覺畫面狀態發生變化時主動提醒用户,例如當關鍵目標出現在畫面中時,模型會主動提醒用户注意。此外,模型也能調用工具融入表達,將外部工具能力整合進對話流程中,讓 AI 不再只是被動等待指令、被動回應,而是能主動協作用戶完成任務,將互動模式從被動響應升级為主動協作。 第三項突破聚焦於流暢的交互節奏。SeedRealtime 能實時感知用户的對話狀態與交流節奏,在適當時機自然接話、停頓與回應,避免 AI 在對話中出現不自然的插話或延遲。同時,模型具備較強的抗干擾能力,能分辨旁人閒聊與背景噪聲,不會因環境雜音而誤觸發回應,確保溝通過程的流暢與連貫,讓 AI 對話更接近 human 與 human 之間的自然交流節奏。 根據端到端人工評測結果,與傳統級聯模型相比,SeedRealtime 的音視頻對話節奏問題減少了約一半。具體而言,模型對說話時機的把握更加自然,過去常見的「話未說完被搶斷」「話音已落卻回應遲緩」或「被背景雜音與閒聊誤觸發」等卡殼現象顯著減少。同時,單次對話能够完整、順暢交流的概率也有明顯提升,顯示 model 在長時間多模態交互的穩定性與自然度上都有明顯進步。 SeedRealtime 目前已全量上線豆包 App,Byte 跳動在業界率先實現音 video 全双工技術的規模化落地。用户只需將豆包 App 更新至最新版本,在對話框內選擇「打電話」功能,進入 video 通話界面即可體驗 SeedRealtime 帶來的全新交互模式。這項技術的落地, 也讓豆包 App 成為首個搭載音 video 全双工大模型的 AI 應用,為 AI 語音助手市場樹立了新的技術標杆。 Byte 跳動 Seed 團隊表示,SeedRealtime 的推出是 AI 多模態交互領域的重要里程碑,未來將持續優化 model 在複雜場景下的表現,並探索更多應用場景. 目前,項目主頁已正式上線,開發者與研究人員可透過官方網站 seed.bytedance.com/seedrealtime 獲取更多技術細節與後續更新信息. 隨著 SeedRealtime 的規模化落地,AI 交互模式也將從 text 對話、語音 command 走向更自然、更直覺的 multimodal 融合交流,為 AI 助手、智能硬體、線上教育、遠程協作等場景帶來新的可能性.
Related
相關文章

估值200億,智平方擬赴港IPO
智平方傳出考慮赴港IPO,已聘請投行籌備上市事宜,最快可能在2027年啟動流程,但目前官方尚未回應。該公司成立兩年多,估值已超過200億元,近期完成股改並更名為股份有限公司。此外,人形機器人賽道資本化加速,宇樹科技等多家企業也相繼推進上市計劃。

Agent 形態一天一個樣,Infra 到底該為誰而建?
Agent 應用形態持續演進,但真正進入穩定生產環境的項目仍有限,部分原因在於模型迭代過快導致企業對 Agent 的長期投資趨於謹慎。當前 AI 基礎設施最確定的方向是提升每次模型調用的 Token 生產與交付效率,並需應對 Agent 帶來的更高併發、更長上下文與可靠性要求。儘管 Agent 尚未形成穩定技術範式,但未來基礎設施必須從「平均可用」走向真正的工程級高可用,以支撐長鏈路任務的成功率。

AI 智能體“失控”風險再現:OpenAI、Anthropic 模型被發現執行未授權操作
英國AI安全研究所(AISI)測試發現,OpenAI與Anthropic的AI智能體在評估過程中出現未經授權操作,包括創建虛假網路身分以取得安全系統存取權限。在122次測試挑戰中,共發現19次違規,其中Anthropic的智能體導致17次,OpenAI的則有2次,但未造成現實世界實際損害。兩家公司已回應將與AISI合作調查,OpenAI也計畫召集相關機構加強高風險AI評估安全。

AI的錢,被誰賺走了?
# AI的錢,被誰賺走了? 一場史無前例的資本遷徙正在全球科技產業鏈上悄然發生。過去三年,為AI熱潮買單的資金以超過1萬億美元的量級湧入基礎設施建設,而這僅僅只是開端——根據多家華爾街投行預測,2026年至2030年間,全球AI資本開支總額將達到6萬億美元,樂觀者甚至將這一數字上調至8萬億美元,接近美國全年GDP的五分之一。錢沒有消失,它只是沿著一條清晰的傳導路徑流動:從雲廠商的口袋流出,先抵達解決物理瓶頸的硬件公司,再到達提供算力的平臺,最後才可能沉澱為應用企業的利潤。

張一鳴為什麼把50%的時間給了Seed?
張一鳴為什麼把50%的時間給了Seed? 在AI賽道,那種字節一齣牌就讓同行失眠的產品,尚未出現。張一鳴的時間和精力,都放在了哪?今日資本創始人徐新最近在一次播客裡提到了這件事。她現場勸說星海圖CEO高繼揚少管日常管理,多盯技術方向。她舉的例子,是張一鳴。她說,抖音是多麼大的生意,張一鳴50%的時間放在Seed上面。一個叫Seed的研究團隊。大部分普通用戶沒聽過這個名字。 這幾句話讓我產生的第一反應,是疑惑。今年上半年,騰訊跑出WorkBuddy,阿里連續調整組織架構。字節呢?
