英偉達讓AI學會"抄作業":KV緩存可跨模型遷移,推理速度暴增25倍

2026年8月11日 02:31
站內 AI 整理稿

AI資訊AI新閒資訊正文英偉達讓AI學會"抄作業":KV緩存可跨模型遷移,推理速度暴增25倍發布於AI新閒資訊時間 :Aug 11, 2026閱讀 :1分鐘英偉達的研究團隊取得了一項突破:他們找到了讓KV緩存在不同模型之間遷移的方法。目標模型可以直接跳過預填充階段,轉換速度比重新處理上下文快2.7 到 25 倍。要理解這個突破的意義,需要先了解KV緩存的作用。在使用ChatGPT或Claude時,你會發現第一個詞的生成總是明顯更慢,然後後面的內容幾乎是瞬間湧出。這背後是一個刻意設計的機制——模型在生成第一個詞之前,需要處理整個輸入上下文,把中間結果存儲為KV緩存。

之後的每個詞都可以複用這些緩存,所以速度快得多。問題在於,KV緩存一直是"一次一模型"的。如果你切換到另一個模型,或者升級了模型版本,之前計算好的緩存就全廢了,新模型必須從頭開始處理整個上下文。對於長文本場景,這意味著大量的重複計算和時間浪費。英偉達的方案讓KV緩存變得可遷移。一個模型計算出的緩存,經過轉換後可以被另一個模型直接使用,目標模型完全跳過預填充階段。轉換過程本身也比重新處理上下文快得多——速度提升在2.7 倍到 25 倍之間,具體取決於模型和上下文的複雜度。這對AI行業的影響是深遠的。當前LLM API的使用成本中有相當一部分來自上下文處理,尤其是長對話和長文檔場景。

如果KV緩存可以在模型之間遷移,意味著用戶在切換模型時不必承擔重複計算的成本,模型升級時也不必丟棄已有的對話上下文。這項研究可能會改變AI推理基礎設施的設計方式,讓模型之間的切換變得更加流暢和經濟。相關推薦英偉達聯合六大金融機構籌集超5000億美元,建設AI算力融資平臺英偉達聯手阿波羅、貝萊德等六家金融機構共建算力融資平臺,擬撬動逾5000億美元第三方資本,加速AI基礎設施建設。雙方已簽署諒解備忘錄,將通過專門資金池,以優惠利率向企業及雲服務商提供融資支持。Aug 11, 2026123.

6k英偉達首款開源全雙工語音模型VoiceChat 11B正式發佈英偉達發佈首款開源端到端全雙工語音對話模型NemotronLabs VoiceChat11B,用單一網絡直接完成流式語音理解與生成,取代傳統ASR、LLM、TTS分步架構,實現實時語音交互突破。Aug 10, 2026214.5k英偉達牽頭OSAA成立SAFE工作組,推動AI安全事件共享與開源協作英偉達牽頭的開放安全人工智能聯盟成立僅一週成員已超120家,其SAFE工作組啟動AI安全事件處理提案徵集,由Linux基金會管理。聯盟在黑帽大會完善方案,聚焦保密報告、通知機制與無責覆盤,推動AI安全行業共享。

Aug 5, 2026192.1k英偉達拿下蘇茨克維:投資SSI實驗室,算力版圖再添一枚重磅棋子據《華爾街日報》報道,英偉達已對前OpenAI首席科學家兼聯合創始人伊爾亞·蘇茨克維的保密實驗室SSI完成實質性投資,金額未公開。核心以大量旗艦GPU換取算力提升一個數量級,此前該實驗室主要依賴谷歌TPU。這標誌著英偉達罕見直接押注前沿AI安全研究。Jul 28, 2026178.1k英偉達擬向Ilya Sutskever創辦的SSI投資50億美元,深化AI算力合作英偉達將向伊爾亞·蘇茨克維創立的安全超級智能實驗室SSI投資50億美元,雙方達成長期合作,強化AI算力與模型研發。

這是英偉達首次在深入瞭解其進展後投資,財務細節未公佈。SSI未來將大規模採用英偉達算力。消息於週一公佈。Jul 28, 2026188.2k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛