字節 Seed 甩出 SeedRealtime:音視頻全雙工大模型上車豆包,邊看邊聽邊說不再"卡拍"
重點摘要
字節 Seed 團隊推出 SeedRealtime,這是一個統合音視頻與文本的全雙工大模型,已在豆包 App 上線。該模型採用端到端架構,能同時處理感知與表達,大幅減少對話中的搶話與停頓問題,實現更自然的即時互動。
字節跳動旗下 Seed 團隊近日發表全新全雙工大模型 SeedRealtime,採用統一架構原生整合音訊、視訊與文字,目標實現「邊看、邊聽、邊說」的即時自然互動體驗。這項技術已不再停留於實驗階段,而是直接搭載於豆包 App 全量上線,成為業界率先將音視訊全雙工能力推向大規模應用的案例。SeedRealtime 最核心的突破在於架構設計。傳統的級聯方案通常依循「聽取—轉寫—思考—表達」的線性流程,感知與表達分屬不同模組,導致對話節奏容易出現斷層,使用者經常感受到搶話、停頓突兀或答非所問的割裂感。
SeedRealtime 則將音視訊的感知與表達統一整合至同一個端到端模型,讓模型能同時接收畫面與聲音,並直接生成回應,省去中間轉換與拼接的步驟。這種原生融合帶來的直接效益,是音視訊對話中的說話節奏問題顯著減少約一半。具體而言,過去常見的搶話、停頓不自然或回應偏離語境的狀況大幅改善,對話流暢度明顯提升。更關鍵的是,SeedRealtime 在即時互動中展現出類似真人對話的「分寸感」——它能夠主動打斷提醒,也能自然停頓,在語句之間留下適當的呼吸間隙,而非一股腦將所有話說完,讓對話體驗更貼近人與人之間的自然交流。
對全模態智慧助手而言,SeedRealtime 的出現代表一條全新的技術路線:不再依賴將多個單模態模型以管線方式串接,而是讓單一模型同時具備視覺、聽覺與口語表達能力,從根本上解決多模態互動中的延遲與不協調問題。這項技術的落地,也為 AI 助手的即時互動場景樹立了新標竿。豆包 App 作為字節跳動旗下重要的 AI 產品,近期不斷擴充功能模組。除了 SeedRealtime 帶來的即時對話升級,豆包也在今年六月推出內建「豆包導航」功能,底層採用百度地圖技術,實現端內原生導航體驗,並根據步行、騎行、駕車等不同場景提供差異化服務,進一步拓展 AI 大模型在日常生活出行中的應用邊界。
根據市場消息,豆包的日均活躍用戶已超過 2 億,但每日收入卻不足百萬,主要依賴電商佣金變現,商業化結構相對單一。截至今年五月,豆包的日均算力成本已達數千萬元,收入遠無法覆蓋營運支出,經營壓力不容小覷。這也使得字節跳動的 AI 資源配置可能逐漸向企業端傾斜,以尋求更穩定的商業模式。除了即時對話與導航,豆包 App 近期也在視覺推理能力上迎來重大升級。圖片分析功能現已支援深度思考模式,使用者只須拍攝或上傳一張圖片,豆包便能自動進行放大、裁剪等精細處理,並結合圖片搜尋功能,實現「邊想邊搜」,進一步提升搜尋結果的準確性,為用戶提供更智慧的視覺互動體驗。
在底層技術研發方面,字節跳動今年六月也發布了創新圖像合成技術 XVerse,能夠對多個獨立個體進行精確控制,實現高保真度的多主體圖像生成。這項技術採用獨特的 DiT 調製方法,在不影響整體圖像潛在特徵的條件下,分別調控每個主體的身分與語義屬性,使用者只需簡短的文字描述,即可產出符合預期的高品質圖像,為個性化內容創作提供更靈活的工具。此外,字節跳動在 AI 影片生成領域亦有所進展,今年八月發表了全新 AI 影片模型 Waver 1.0,支援文字與圖像轉換為影片,功能全面。該模型在生成品質與效果上超越現有開源及閉源模型,在 Waver-Bench 1.
0 與 Hermes Motion Testset 測試中表現優異,尤其在運動品質、視覺品質與提示跟隨性方面獲得顯著成績。整體而言,SeedRealtime 的問世不僅是字節跳動在即時多模態互動技術上的重要里程碑,也為整個 AI 助手產業提供了新的發展方向。隨著豆包 App 持續整合更多感知與表達能力,使用者與 AI 的互動將愈發自然、即時且流暢,不再受限於傳統對話系統的延遲與結構性限制。未來,這項技術有望廣泛應用於教育、客服、娛樂、遠距協作等場景,推動 AI 助手從工具型角色向真正的智慧夥伴邁進。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。