字節 Seed 甩出 SeedRealtime:音視頻全雙工大模型上車豆包,邊看邊聽邊說不再"卡拍"

2026年8月5日 06:014900 次瀏覽

重點摘要

字節 Seed 團隊推出 SeedRealtime,這是一個統合音視頻與文本的全雙工大模型,已在豆包 App 上線。該模型採用端到端架構,能同時處理感知與表達,大幅減少對話中的搶話與停頓問題,實現更自然的即時互動。

站內 AI 整理稿

字節跳動旗下 Seed 團隊近日發表全新全雙工大模型 SeedRealtime,採用統一架構原生整合音訊、視訊與文字,目標實現「邊看、邊聽、邊說」的即時自然互動體驗。這項技術已不再停留於實驗階段,而是直接搭載於豆包 App 全量上線,成為業界率先將音視訊全雙工能力推向大規模應用的案例。SeedRealtime 最核心的突破在於架構設計。傳統的級聯方案通常依循「聽取—轉寫—思考—表達」的線性流程,感知與表達分屬不同模組,導致對話節奏容易出現斷層,使用者經常感受到搶話、停頓突兀或答非所問的割裂感。

SeedRealtime 則將音視訊的感知與表達統一整合至同一個端到端模型,讓模型能同時接收畫面與聲音,並直接生成回應,省去中間轉換與拼接的步驟。這種原生融合帶來的直接效益,是音視訊對話中的說話節奏問題顯著減少約一半。具體而言,過去常見的搶話、停頓不自然或回應偏離語境的狀況大幅改善,對話流暢度明顯提升。更關鍵的是,SeedRealtime 在即時互動中展現出類似真人對話的「分寸感」——它能夠主動打斷提醒,也能自然停頓,在語句之間留下適當的呼吸間隙,而非一股腦將所有話說完,讓對話體驗更貼近人與人之間的自然交流。

對全模態智慧助手而言,SeedRealtime 的出現代表一條全新的技術路線:不再依賴將多個單模態模型以管線方式串接,而是讓單一模型同時具備視覺、聽覺與口語表達能力,從根本上解決多模態互動中的延遲與不協調問題。這項技術的落地,也為 AI 助手的即時互動場景樹立了新標竿。豆包 App 作為字節跳動旗下重要的 AI 產品,近期不斷擴充功能模組。除了 SeedRealtime 帶來的即時對話升級,豆包也在今年六月推出內建「豆包導航」功能,底層採用百度地圖技術,實現端內原生導航體驗,並根據步行、騎行、駕車等不同場景提供差異化服務,進一步拓展 AI 大模型在日常生活出行中的應用邊界。

根據市場消息,豆包的日均活躍用戶已超過 2 億,但每日收入卻不足百萬,主要依賴電商佣金變現,商業化結構相對單一。截至今年五月,豆包的日均算力成本已達數千萬元,收入遠無法覆蓋營運支出,經營壓力不容小覷。這也使得字節跳動的 AI 資源配置可能逐漸向企業端傾斜,以尋求更穩定的商業模式。除了即時對話與導航,豆包 App 近期也在視覺推理能力上迎來重大升級。圖片分析功能現已支援深度思考模式,使用者只須拍攝或上傳一張圖片,豆包便能自動進行放大、裁剪等精細處理,並結合圖片搜尋功能,實現「邊想邊搜」,進一步提升搜尋結果的準確性,為用戶提供更智慧的視覺互動體驗。

在底層技術研發方面,字節跳動今年六月也發布了創新圖像合成技術 XVerse,能夠對多個獨立個體進行精確控制,實現高保真度的多主體圖像生成。這項技術採用獨特的 DiT 調製方法,在不影響整體圖像潛在特徵的條件下,分別調控每個主體的身分與語義屬性,使用者只需簡短的文字描述,即可產出符合預期的高品質圖像,為個性化內容創作提供更靈活的工具。此外,字節跳動在 AI 影片生成領域亦有所進展,今年八月發表了全新 AI 影片模型 Waver 1.0,支援文字與圖像轉換為影片,功能全面。該模型在生成品質與效果上超越現有開源及閉源模型,在 Waver-Bench 1.

0 與 Hermes Motion Testset 測試中表現優異,尤其在運動品質、視覺品質與提示跟隨性方面獲得顯著成績。整體而言,SeedRealtime 的問世不僅是字節跳動在即時多模態互動技術上的重要里程碑,也為整個 AI 助手產業提供了新的發展方向。隨著豆包 App 持續整合更多感知與表達能力,使用者與 AI 的互動將愈發自然、即時且流暢,不再受限於傳統對話系統的延遲與結構性限制。未來,這項技術有望廣泛應用於教育、客服、娛樂、遠距協作等場景,推動 AI 助手從工具型角色向真正的智慧夥伴邁進。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

38 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前