字節跳動發佈全雙工大模型SeedRealtime,國產算力產業鏈景氣度獲強化

2026年8月6日 01:305100 次瀏覽

重點摘要

字節跳動Seed發佈原生音視頻全雙工大模型SeedRealtime,採用統一架構融合音頻、視頻與文本,實現“邊看邊聽邊說”的實時交互,推進全模態自然交互。同時,國產大模型如DeepSeek等集中迭代升級,市場分析認為國產算力邏輯持續加強。

站內 AI 整理稿

字節跳動旗下 Seed 團隊近日正式發表原生音視頻全雙工大模型「SeedRealtime」,這款模型以統一的架構設計,將音訊、視訊與文本三種模態深度融合,實現「邊看邊聽邊說」的即時交互能力。這項發表被視為全模態自然交互的重要進展,也讓外界再次看到國產大模型在即時多媒體理解與回應上的技術突破。SeedRealtime 的關鍵特色在於其全雙工能力。不同於傳統模型需要先將語音或影像轉換為文字、經過運算後再轉換回語音或影像輸出,SeedRealtime 可以直接同時接收並處理多種感官資訊,在毫秒級延遲內生成對應的回應。

這代表使用者與機器之間的對話不再需要等待「聽完、想完、再說」的線性流程,而是更接近人與人之間自然對話的節奏,大幅提升人機互動的自然度與流暢度。這款模型的架構設計也備受關注。Seed 團隊選擇以統一的模型架構來處理三種不同模態的資訊,讓音訊、視訊與文本不再是各自獨立的處理管道,而是共享同一套表徵空間與推理機制。這種做法有助於模型在理解畫面的同時、掌握聲音的情緒與語意,也能結合文字脈絡做出更完整的判斷,從根本上強化多模態資訊之間的關聯性。從應用場景來看,SeedRealtime 的即時交互能力開啟了更多可能性。

舉例來說,未來的 AI 助理不再只是接收文字指令,而是可以透過鏡頭看到使用者的表情與環境,透過麥克風聽到語氣的細微變化,並在同一時間以語音或影像方式回應。這種互動模式也讓 AI 在遠距教學、視訊會議、即時翻譯、智慧客服等情境中,展現出更接近真人服務的體驗。就在字節跳動發表 SeedRealtime 的同時,包括 DeepSeek 在內的多家國產大模型團隊近期也密集推出迭代版本,在參數效率、推理速度與多模態理解等面向持續突破。這些模型升級並非單一事件的孤立發展,而是反映出整個本土 AI 技術社群正在加速推進模型能力與應用落地,彼此之間的競爭與相互啟發也讓整體進展更加快速。

其中,參數效率的提升是這波升級的重要方向之一。過去大模型往往以龐大參數量換取能力表現,但隨著訓練與推理技術的成熟,新一代模型開始在更精簡的參數規模下維持甚至超越既有效能,這不僅降低訓練成本,也讓模型更容易部署在實際產品中。推理速度的改善同樣關鍵,尤其對於即時互動應用而言,回應延遲直接影響使用者體驗,能在毫秒級別完成運算,才有機會支撐真正流暢的對話服務。多模態理解則成為各家模型團隊競逐的焦點。從純文字問答走向圖片、語音與影片的綜合理解,代表了 AI 能力的邊界正在擴大。

SeedRealtime 正是這種趨勢下的具體成果,而其他團隊的迭代版本也在不同程度上加入了多模態支援,讓整體國產大模型的能力版圖更加完整。市場分析指出,這波國產大模型的集中升級,不僅顯示本土技術路線的成熟度提升,更進一步強化國產算力產業鏈的景氣預期。過去各界對於國產模型是否能在國際競爭中站穩腳步仍有疑慮,但如今多家團隊在短時間內接連推出具競爭力的模型版本,從技術驗證的角度提供了更明確的訊號,也讓供應鏈業者對後續需求更具信心。值得注意的是,模型能力的提升正在帶動算力需求的結構性轉變。

相較於純文字模型,即時音視頻互動需要更密集的運算資源,尤其是同時處理多路感官輸入並即時生成回應,對晶片效能、記憶體頻寬與雲端基礎設施都提出了更高要求。當應用場景從文字擴展到即時音視頻互動,高效的國產晶片與雲端基礎設施需求也將同步攀升。這對於國產算力產業鏈而言,是一個明確的成長動能。晶片設計、伺服器製造、資料中心營運到雲端服務平台,每一層環節都將受惠於模型升級所帶來的算力需求。特別是在國際供應鏈仍存在不確定性的背景下,本土模型與本土硬體的協同發展,更有機會形成完整的生態體系,進一步降低對外部技術的依賴。

從整體產業格局來看,SeedRealtime 的發表不只是一款新產品的亮相,更象徵著國產大模型正式邁入全模態即時交互的階段。當模型能夠真正「邊看邊聽邊說」,人機之間的界線也變得更加模糊。而這背後的算力需求,則為相關供應鏈打開了長期的成長空間。未來隨著更多應用場景落地,國產算力產業鏈的景氣度可望持續獲得支撐。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

剛剛

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

剛剛

內部賽馬暫停,騰訊、阿里、字節AI辦公產品“合兵”對陣

過去半年,騰訊、阿里巴巴、字節跳動等大廠在AI辦公產品領域經歷內部賽馬後,近期紛紛收攏資源,推出整合方案。騰訊將QClaw業務調整至雲產品六部,與WorkBuddy統一管理;阿里整合三款產品推出千問辦公;字節則將飛書團隊併入豆包。市場數據顯示,6月國內AI辦公智能體平臺月訪問量突破6000萬次,顯示此領域競爭日益激烈。

1 小時前