何夕2077生成式AI

潛推理推薦模型實現大幅提速

2026年8月1日 00:00

重點摘要

研究團隊提出潛在推理推薦框架WhisperRec,將教師生成的鏈式思考壓縮為可學習的潛在推理token,避免顯式推理的延遲瓶頸。實驗顯示,WhisperRec在工業級快手資料集與公開基準上,其SID@64指標較顯式CoT方法提升17.44%,且線上推論吞吐量提升超過10倍。

站內 AI 整理稿

大規模語言模型(LLM)在推理能力上的突破,讓學界與業界開始嘗試將其作為基礎推薦模型(FRM)的骨幹架構。過往的主流做法採用「先思考、再回答」(Think-then-Answer)的範式,透過顯式的思維鏈(Chain-of-Thought, CoT)來強化推薦品質。然而,這種方法在生成冗長推理過程時會帶來巨大的計算開銷,同時固定模板的CoT也難以捕捉使用者興趣的多樣性、動態性與情境依賴性。為了解決這個瓶頸,來自快手等機構的研究團隊提出了一種名為 WhisperRec 的高效潛推理框架,讓推薦模型能在不產出繁複文字推理的前提下,保留關鍵推理資訊,從而實現驚人的速度提升。 WhisperRec 的核心概念是「潛在推理後回答」(Latent-Reason-then-Answer)。它不再強迫模型逐字產生推理步驟,而是將教師模型生成的CoT壓縮成一系列可學習的潛在推理 token。這些 token 在潛在空間中完成推理,避開了自迴歸生成冗長推理文字的延遲瓶頸。研究團隊表示,這種設計既能保留決策相關的推理資訊,又能大幅降低推理延遲,讓模型在線上環境中獲得超過十倍的吞吐量提升。 為了建構高品質的推理監督訊號,WhisperRec 引入了多視角自適應 CoT(Multi-View Adaptive CoT, MV-ACoT)。這項技術從互補的使用者興趣視角出發,為每個樣本動態調整推理複雜度:對於意圖明確的簡單案例,採用輕量分析;對於挑戰性較高的案例,則進行有針對性的多因素推理。這種自適應策略不僅讓推理過程更貼近真實使用者行為,也為後續的潛推理訓練提供了多元且高品質的標註資料。 在模型訓練方面,WhisperRec 採用三階段的潛推理對齊流程。研究團隊以預訓練好的基礎推薦模型為起點,逐步將教師模型的CoT知識內化到潛在表示中。第一階段學習初步對齊,第二階段強化推理 token 的語意,第三階段則微調潛在推理能力。透過這種循序漸進的蒸餾方式,模型能夠有效吸收外部推理知識,同時保持原有的推薦性能。 為了確保模型在實際推薦任務中能順利啟用潛推理,WhisperRec 還設計了課程式後訓練(curriculum-based post-training)。這個階段混合了標準推薦任務與潛推理任務,讓模型在保有基礎推薦能力的同時,學會在需要時透過潛在 token 進行推理。研究團隊強調,這種設計避免了傳統 CoT 方法在推理時「全開或全關」的缺點,讓模型可以根據情境決定是否啟動推理。 實驗結果顯示,WhisperRec 在工業級規模的快手資料集以及公開的 Kuaishou LLM-Rec 基準上,均一致優於傳統的顯式 CoT 方法與無推理的基線模型。與顯式 CoT 的 Think 變體和 No-Think 變體相比,WhisperRec 在 SID@64 指標上分別提升了 17.44% 和 9.33%。更重要的是,在線上推理場景中,WhisperRec 的吞吐量是傳統顯式 CoT 方法的 10 倍以上,這意味著在相同硬體資源下可以服務更多使用者,或大幅降低延遲。 這項研究由 Hao Jiang、Peiru Du、Pengfei Yao 等超過十二位研究人員共同完成,論文已於 2026 年 7 月 29 日提交至 arXiv 預印本平台,並於次日更新(arXiv:2607.26621)。目前該論文已被歸類於資訊檢索與人工智慧領域,並提供 PDF 與 HTML 版本供學術界參考。 WhisperRec 的提出,為基礎推薦模型在效率與推理能力之間找到了新的平衡點。它不依賴於冗長的文字生成,卻能保留推理的優勢,這對於必須在毫秒級內回應使用者請求的推薦系統而言,具有相當大的實用價值。未來,這項技術有望進一步拓展到更多需要即時推理的應用場景,例如廣告排序、內容推薦、個人化搜尋等,讓大語言模型的推理能力真正落地於工業級系統。

Related

相關文章

何夕2077生成式AI

深度求索發佈閃電模型更新

Ad Skip to content All Topics AI and society AI in practice AI research Frontier Radar Short News Read full article about: Google Deepmind unveils Gemini Robotics 2 to power robots of all shapes from tabletop arms to humanoids Google Deepmind has introduced Gemini Robotics 2, which it calls its most advanced vision-language-action (VLA) model yet. VLA models combine image recognition, language processing, and action control to help robots operate in physical environments. Deepmind says the model can control systems ranging from tabletop arms to full-body humanoid robots. The company describes Gemini Robotics 2 as an "intelligence layer" for a new generation of adaptive robots. It can manage full-body movement, perform fine motor tasks, and coordinate multiple robots, according to Deepmind.

4 小時前
何夕2077生成式AI

新型控制器優化大模型搜索成本

大型語言模型的應用場景持續擴張,除了聊天與程式生成之外,愈來愈多科學與演算法研究開始借助模型在推論階段進行自動化搜索,從大量候選結果中尋找最佳解答。然而,這類搜索過程往往需要消耗大量運算資源,尤其在不同提示長度、重試次數與引導呼叫的組合下,每次行動所付出的 token 成本並不相同,讓成本控管成為實際部署時的重要挑戰。一篇近期發表於 arXiv 的研究論文,針對此問題提出了一套全新的控制器機制,試圖在有限預算下,讓模型搜索既能維持品質,又不讓成本失控。

4 小時前
何夕2077生成式AI

前特斯拉大牛探討編程範式轉變

前特斯拉大牛探討編程範式轉變。 專家聲稱傳統編程正被大模型徹底顛覆。用戶在紅迪討論貼中可細讀現場觀點。他認為上下文窗口已成了新的控制槓桿。很多開發者仍用老標準衡量自身價值。這一趨勢讓不少資深程序員 ��� 感到焦慮。

4 小時前
雷峰網生成式AI

誰在訓練 Kimi K3 ? 深挖貢獻者名單,這有一份最全檔案

起底 K3 背後核心極客天團,人均扛起 7 億估值! 作者丨高允毅 樊天驕 編輯丨馬曉寧 7 月 27 日,月之暗面拿出全部誠意,直接把滿血版 2.8T 模型 Kimi K3 全部開源了。在技術報告的最後,他們首次公佈了Kimi K3背後的實際貢獻者名單,我們細數了一下,有401位成員,可以說,這是月之暗麵人才團隊的一次全面亮相。

17 小時前
雷峰網生成式AI

AI 正在變成一門製造業 | WAIC 2026 Agent 產品觀察

國內 Agent 產品當前主要是供給側繁榮,不是需求側繁榮。 作者丨李 娜 編輯丨馬曉寧 2026 年的 WAIC 真是太熱鬧了,人潮擁擠,在地鐵站排著隊進入 WAIC 場館的時候, 我看見地鐵站廣告牌上的百度智能體“百度搭子”的廣告,這場關於智能體沒有硝煙的戰爭,從入口處就拉開了帷幕。

17 小時前
MarkTechPost AI生成式AI

JetBrains Open-Sources KotlinLLM: Smart Macros That Generate Kotlin Source Code at Runtime and Hot-Reload It Through JDI

JetBrains Research 開源 KotlinLLM,這款 IntelliJ IDEA 外掛為 Kotlin/JVM 專案加入 Smart macros 語言功能,可在執行階段產生 Kotlin 原始碼並透過 JDI 熱重載。根據測試,在改寫的 Spring Petclinic 專案中 24 個情境全部成功,熱重載成功率 100%,編譯與重定義僅增加約 1% 執行開銷。此專案屬研究原型,採用 Apache License 2.0,需搭配 IntelliJ IDEA 2025.2.x、JDK 21 與 OpenAI API 金鑰。

17 小時前