何夕2077生成式AI

Jet-Long長文本技術發佈

2026年7月11日 00:00

重點摘要

**Jet-Long長文本技術發佈:零樣本動態雙焦點RoPE實現高效的長上下文擴展** 隨著大型語言模型(LLM)在檢索增強生成(RAG)、倉庫級代碼理解與智能體工作流程中的廣泛應用,輸入上下文長度頻繁突破預訓練階段的序列窗口限制。零樣本(zero-shot)上下文擴展因此成為部署開源模型的主流技術路線——它無需額外訓練,直接通過調整位置編碼或注意力機制使模型處理更長的文本。

站內 AI 整理稿

**Jet-Long長文本技術發佈:零樣本動態雙焦點RoPE實現高效的長上下文擴展**

隨著大型語言模型(LLM)在檢索增強生成(RAG)、倉庫級代碼理解與智能體工作流程中的廣泛應用,輸入上下文長度頻繁突破預訓練階段的序列窗口限制。零樣本(zero-shot)上下文擴展因此成為部署開源模型的主流技術路線——它無需額外訓練,直接通過調整位置編碼或注意力機制使模型處理更長的文本。然而現有方法普遍採用固定的縮放因子,導致「顧此失彼」:過於激進的因子雖能支撐長文本,卻會嚴重損害短序列上的表現;保守的因子雖保留短上下文質量,卻在長上下文場景中迅速失效。這種矛盾已成為制約LLM實際應用的關鍵瓶頸。

針對這一挑戰,來自NVIDIA及相關機構的研究團隊(Haozhan Tang, Zerui Wang, Yuxian Gu, Song Han, Han Cai)提出一種名為**Jet-Long**的零樣本無需微調方法,通過動態雙焦點RoPE(Dynamic Bifocal RoPE)在局部與長距離注意力之間取得平衡。其核心設計包含兩個並行的注意力窗口:一個「局部忠實窗口」完整保留原始RoPE旋轉編碼,確保模型在短序列場景下與基座模型行為完全一致;另一個「長距離窗口」則根據當前序列長度自適應調整縮放因子,從而乾淨地外推到更長上下文。

兩者的協作使得Jet-Long在短輸入時能完美還原基座模型,在長輸入時則實現流暢的長程依賴捕獲。為了將這兩個異構注意力頭高效融合,研究人員設計了**包含–排除注意力合併機制**(inclusion-exclusion attention merge)以及**即時RoPE校正旋轉**(on-the-fly RoPE correction rotation)。前者確保兩個窗口的注意力分數在合併時既不重疊也不遺漏,後者通過輕量級旋轉操作消除因縮放因子不同帶來的角度偏差。這些計算全部在推理過程中即時完成,無需預先計算或存儲冗餘狀態,幾乎不引入任何額外延遲。

得益於精心設計的算子融合,Jet-Long可以編譯為單一的CuTe內核,充分發揮NVIDIA Hopper架構的硬體潛力。實測結果顯示,在H100 GPU上,長上下文預填充(prefill)階段的吞吐量可達標準FlashAttention-2的**1.39倍**,性能甚至接近目前僅Hopper支援的FlashAttention-4;而在單批次生成(generation)模式下,每一長度步長的額外開銷均控制在**4%以下**。這意味著Jet-Long不僅提升了精度,還同時帶來了實際的推理加速。Jet-Long在主流長上下文基準測試上表現出顯著優勢。研究人員在Qwen3系列模型(1.

7B、4B、8B)上進行了最高**128K**上下文長度的評估。在RULER測試集中,Jet-Long分別超越最強基線**+4.79、+2.18、+2.03百分點**,全面刷新該榜單。在HELMET-RAG(被HELMET組織認定為最能預測下游長上下文任務表現的指標)上,Jet-Long取得**最佳整體準確率**。語言建模能力方面,在PG-19資料集上它達到了**最低困惑度**,證明長上下文處理並未以語言理解為代價。除標準架構外,Jet-Long還可無縫泛化至混合注意力(hybrid attention)模型,例如結合局部滑動窗口與全局稀疏注意力的**Jet-Nemotron**。

對於此類既有架構,Jet-Long無需重新訓練即可進一步提升其長上下文效能,顯示出優異的兼容性。此外,該方法對超參數選擇十分魯棒——即使縮放因子或窗口大小在一定範圍內變動,性能波動極小,這極大降低了實際部署中的調試成本。長上下文能力是LLM從文本生成走向複雜任務執行的核心門檻。Jet-Long提出的動態雙焦點策略,在不增加訓練負擔的前提下,同時緩解了短上下文保真度與長上下文外推能力之間的矛盾。加上其高效的注意力合併內核,該技術有望成為未來長上下文LLM部署的標準模組之一,尤其適用於RAG系統、多輪對話、代碼理解以及需要長期記憶的智能體場景。

有趣的是,論文公開後,有研究者提出了一個自然的擴展問題:**「為什麼止步於兩個焦點?」** 確實,雙焦點RoPE本質上是一個可擴展框架,理論上可以引入更多具有不同縮放策略的注意力窗口,以適應更極端的長度動態。這也為後續工作留下了豐富的探索空間。目前,Jet-Long的論文(arXiv:2607.07740)已在arXiv上公開,並同步在GitHub發佈代碼與模型。該工作獲得NVIDIA社群8個點讚,並已有6個模型引用該方法,2個Space應用基於此技術,顯示出業界對其潛力的高度關注。

隨著更多公開如Qwen、Llama等系列對該方法的整合,Jet-Long或將成為零樣本長文本擴展領域的重要里程碑。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前