潛推理推薦模型實現大幅提速
重點摘要
研究團隊提出潛在推理推薦框架WhisperRec,將教師生成的鏈式思考壓縮為可學習的潛在推理token,避免顯式推理的延遲瓶頸。實驗顯示,WhisperRec在工業級快手資料集與公開基準上,其SID@64指標較顯式CoT方法提升17.44%,且線上推論吞吐量提升超過10倍。
大規模語言模型(LLM)在推理能力上的突破,讓學界與業界開始嘗試將其作為基礎推薦模型(FRM)的骨幹架構。過往的主流做法採用「先思考、再回答」(Think-then-Answer)的範式,透過顯式的思維鏈(Chain-of-Thought, CoT)來強化推薦品質。然而,這種方法在生成冗長推理過程時會帶來巨大的計算開銷,同時固定模板的CoT也難以捕捉使用者興趣的多樣性、動態性與情境依賴性。為了解決這個瓶頸,來自快手等機構的研究團隊提出了一種名為 WhisperRec 的高效潛推理框架,讓推薦模型能在不產出繁複文字推理的前提下,保留關鍵推理資訊,從而實現驚人的速度提升。
WhisperRec 的核心概念是「潛在推理後回答」(Latent-Reason-then-Answer)。它不再強迫模型逐字產生推理步驟,而是將教師模型生成的CoT壓縮成一系列可學習的潛在推理 token。這些 token 在潛在空間中完成推理,避開了自迴歸生成冗長推理文字的延遲瓶頸。研究團隊表示,這種設計既能保留決策相關的推理資訊,又能大幅降低推理延遲,讓模型在線上環境中獲得超過十倍的吞吐量提升。為了建構高品質的推理監督訊號,WhisperRec 引入了多視角自適應 CoT(Multi-View Adaptive CoT, MV-ACoT)。
這項技術從互補的使用者興趣視角出發,為每個樣本動態調整推理複雜度:對於意圖明確的簡單案例,採用輕量分析;對於挑戰性較高的案例,則進行有針對性的多因素推理。這種自適應策略不僅讓推理過程更貼近真實使用者行為,也為後續的潛推理訓練提供了多元且高品質的標註資料。在模型訓練方面,WhisperRec 採用三階段的潛推理對齊流程。研究團隊以預訓練好的基礎推薦模型為起點,逐步將教師模型的CoT知識內化到潛在表示中。第一階段學習初步對齊,第二階段強化推理 token 的語意,第三階段則微調潛在推理能力。透過這種循序漸進的蒸餾方式,模型能夠有效吸收外部推理知識,同時保持原有的推薦性能。
為了確保模型在實際推薦任務中能順利啟用潛推理,WhisperRec 還設計了課程式後訓練(curriculum-based post-training)。這個階段混合了標準推薦任務與潛推理任務,讓模型在保有基礎推薦能力的同時,學會在需要時透過潛在 token 進行推理。研究團隊強調,這種設計避免了傳統 CoT 方法在推理時「全開或全關」的缺點,讓模型可以根據情境決定是否啟動推理。實驗結果顯示,WhisperRec 在工業級規模的快手資料集以及公開的 Kuaishou LLM-Rec 基準上,均一致優於傳統的顯式 CoT 方法與無推理的基線模型。
與顯式 CoT 的 Think 變體和 No-Think 變體相比,WhisperRec 在 SID@64 指標上分別提升了 17.44% 和 9.33%。更重要的是,在線上推理場景中,WhisperRec 的吞吐量是傳統顯式 CoT 方法的 10 倍以上,這意味著在相同硬體資源下可以服務更多使用者,或大幅降低延遲。這項研究由 Hao Jiang、Peiru Du、Pengfei Yao 等超過十二位研究人員共同完成,論文已於 2026 年 7 月 29 日提交至 arXiv 預印本平台,並於次日更新(arXiv:2607.26621)。
目前該論文已被歸類於資訊檢索與人工智慧領域,並提供 PDF 與 HTML 版本供學術界參考。WhisperRec 的提出,為基礎推薦模型在效率與推理能力之間找到了新的平衡點。它不依賴於冗長的文字生成,卻能保留推理的優勢,這對於必須在毫秒級內回應使用者請求的推薦系統而言,具有相當大的實用價值。未來,這項技術有望進一步拓展到更多需要即時推理的應用場景,例如廣告排序、內容推薦、個人化搜尋等,讓大語言模型的推理能力真正落地於工業級系統。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。