快手把直播字幕延遲砍到 500 毫秒內:自研端到端工程範式,把電商直播的字幕打成"實時"

2026年9月21日 11:12
快手把直播字幕延遲砍到 500 毫秒內:自研端到端工程範式,把電商直播的字幕打成"實時"
站內 AI 整理稿

AI資訊AI新聞資訊正文快手把直播字幕延遲砍到 500 毫秒內:自研端到端工程範式,把電商直播的字幕打成"實時"發佈於AI新聞資訊發佈時間 :2026年9月21號 11:09閱讀 :1分鐘快手電商直播技術團隊端出了一套名為 Live Captioning Engineering 的實時字幕工程範式,把直播字幕這件事從"能出字"推進到了"實時出、準出字"。最直接的數字是:主播發聲到字幕具備展示條件的端到端延遲,從過去的1.5到2秒壓到了400到500毫秒,字符錯誤率(CER)從7.81% 降到3.

51%,背後還要撐住千萬級的持續併發——這在以高併發、強實時著稱的電商直播場景裡,第一次有了一套成體系的工程打法。這套範式的核心,是把字幕的交付拆成四段接力。第一段是語音識別(ASR),模型把主播的聲音流實時轉成文字;第二段是 PTS 對齊,把識別出的文本和音視頻的時間戳對上,確保字幕和畫面嘴型不脫節;第三段是級聯分發,識別結果經過服務鏈路推送到海量觀眾端;第四段是端側渲染,由用戶手機上的播放器把字幕畫出來。四段串起來,才算完成"說話—出字"的閉環,任何一段拖沓都會直接體現在觀眾看到的延遲上。最考驗功力的是流式修訂機制。

直播語音是連續的,模型邊聽邊改,前一句話的識別結果很可能在聽到後半句時被推翻重來,所以系統必須能區別"哪句話、第幾次修訂、該排在時間軸的哪個位置"——這正是 sentenceId、revision 和播放器時間線三件套存在的意義。sentenceId 鎖定一句完整的話,revision 標記這句話被修訂到第幾版,播放器時間線則決定修訂後的字幕該在哪一幀刷新,三者配合才能在不閃爍、不串行的前提下,把不斷修正的字幕穩穩貼在畫面上。對想搭建高併發實時 AI 系統的團隊來說,這套把"流式、修訂、對齊"講透的工程經驗,比單純的識別準確率更有參考價值。

相關推薦阿里語音大模型霸榜國際權威榜單,奪得國產語音 AI“三冠王”2026年5月28日,全球AI評測平臺Artificial Analysis發佈語音排行榜,阿里巴巴的Fun-Realtime-TTS-Preview語音大模型以1190分獲全球第五、國產第一。該模型在ASR等三大核心語音賽道均居國內榜首,展現全面領先實力。2026年5月28號 14:01265.2kWispr再獲 2500 萬美元B+輪融資:年用戶增長 100 倍,擬自研ASR把錯誤率壓至10%語音AI公司Wispr完成2500萬美元B+輪融資,總融資額達8100萬美元。

其產品Flow Dictation上線三個月後,50%字符通過語音輸入,已服務270家財富500強企業及125家付費機構。用戶年同比增長100倍,12個月留存率70%,月環比增速穩定在40%。自研ASR錯誤率僅10%,技術表現突出。2025年11月21號 11:21246.3k羅永浩數字人直播即將首秀百度電商,再探“AI+IP”帶貨新模式知名電商主播羅永浩於6月12日通過微博宣佈,其數字人形象將於6月15日在百度電商平臺開啟直播帶貨,並歡迎“老朋友們”屆時前來充當“人肉驗真儀”,引發業界關注。

此前,羅永浩已於5月23日在百度電商進行了首次直播,短短4小時內,GMV(商品交易總額)突破5000萬元,觀看人數超過千萬人次,顯示出其強大的號召力。據瞭解,羅永浩是首位嘗試使用數字人進行直播帶貨的頭部主播。此次數字人直播的推出,得益於百度在高說服力數字人等關鍵技術方面的突破,為頭部主播與數字人技2025年6月13號 10:31358.8k豆包App推出新語音模式,搶先GPT-4o實現唱歌和角色扮演2025年1月20日,豆包 App 正式發佈了其最新的 “端到端” 語音大模型,並對實時語音通話功能進行了重要更新。

這一進展標誌著豆包在語音交互領域的又一次飛躍,超越了之前的 ASR(自動語音識別)、LLM(大語言模型)和 TTS(文生音頻)的級聯方案,將語音識別、理解和生成整合在同一個模型中。經過《智能湧現》的測試,新版豆包的最大亮點在於其具備了人類般的表達能力和情感輸出,提升了對話的流暢度與智能水平。尤其是 “靈魂歌手” 和 “百變大咖” 模式,讓豆包不僅能夠進行唱歌,2025年1月21號 9:38428.

1k騰訊雲推出語音識別系統 ASR,大模型上線["騰訊雲 ASR 升級,更好處理方言和噪聲","ASR 支持 23 種方言識別和噪聲過濾","使用大語言模型提升識別準確率","產品廣泛應用於內外部企業客戶","騰訊雲 ASR 已達百億次單日調用量"]2024年1月5號 9:02282.9k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

阿里 70 億參數圖像模型Qwen-Image-2. 1 開源發佈,號稱以瘦身之軀叫板閉源巨頭

最讓人意外的是它的身板——視覺生成組件僅用70億參數,卻在自家的評測基準上壓過了市面上絕大多數閉源模型。團隊放話底氣十足,不過第三方獨立評測尚在趕來的路上,這份成績單還需時間檢驗。更接地氣的是,它不挑設備,一塊像RTX3090這樣的主流消費級顯卡就能托起它跑起來。

剛剛
量子位生成式AI

開源Top2!實測階躍Step 5 Preview,真有點猛啊…

。 昨天,階躍星辰毫無預兆地端出了最新一代旗艦基座模型——Step 5 Preview。 MoE架構,600B總參數、激活參數僅27B,1M上下文。 Agent能力大幅提升,在Artificial Analysis的最新評測中,Step 5 Preview取得44分,直接衝到全球開源Top 2。 要知道,其他拿到這一分數的大模型,大多都是萬億參數級別。

剛剛
鈦媒體生成式AI

最火啞巴模型Jev加上微信,直接治好了我的低情商

字母AI2026.09.21 11:44 · 來自北京全文3770字00:00 / 10:28Jev微信插件爆火,根據對方消息直接揣測對方想法。文 | 字母AI谷歌的啞巴模型Jev突然爆火。它不聊天,不寫代碼,不寫文案,也不解釋,你問它什麼,它一個字都不生成。它只做一件事——判斷。發佈沒幾天,從Hacker News,再到中文技術社區,幾乎所有人都在討論它。但大家討論的不是它有多聰明,而是它有多反常。誠然,一個不會說話的模型能火,這事本身就已經夠反常的了。大家最先討論的,是它的落地場景。

剛剛

特斯拉得州超級工廠鋼結構接近完工,Optimus產線建設加速

X平臺博主Joe Tegtmeyer近期通過無人機拍攝顯示,工廠主體鋼結構已接近建築北側邊緣,距離北側外圍梁約剩5個柱網;廠房上方三層結構正在進行混凝土澆築,其他區域也在持續進行澆築準備工作。Tegtmeyer認為,特斯拉得州Optimus工廠規劃年產能達1000萬臺,預計生產工作將在2027年晚些時候啟動。

剛剛

微軟Copilot桌面版新增內置瀏覽器,支持多標籤與全屏瀏覽

目前該功能已面向管理員開放測試,但需通過設備管理系統啟用BrowsingEnabled策略,更廣泛的自動推廣預計將在11月底進行。微軟表示,9月21日還將發佈補充更新,為側邊欄網頁標籤增加右鍵菜單,可直接選擇在外部瀏覽器中打開鏈接。此前用戶點擊Copilot回答中的參考鏈接通常需要跳轉至外部瀏覽器,新功能則允許網頁直接加載在Copilot內部,關閉頁面後即可繼續對話。

剛剛