NVIDIA 發佈 Nemotron 3 Embed 系列,8B 版本登頂 RTEB 檢索基準

2026年7月17日 09:337400 次瀏覽

重點摘要

AI資訊AI新閒資訊正文NVIDIA 發佈 Nemotron 3 Embed 系列,8B 版本登頂 RTEB 檢索基準發布於AI新閒資訊時間 :Jul 17, 2026閱讀 :1分鐘NVIDIA 近日發佈了 Nemotron3Embed 系列嵌入向量模型,專為生產級 RAG、智能體檢索、代碼檢索及智能體記憶等場景設計。

站內 AI 整理稿

NVIDIA 近日正式發表 Nemotron 3 Embed 系列嵌入向量模型,專為生產級檢索增強生成(RAG)、智能體檢索、程式碼檢索以及智能體記憶等場景打造。其中 8B 參數版本在檢索嵌入基準測試 RTEB 上奪下第一名,成為當前該領域性能最強的開源模型,引起業界高度關注。該系列共釋出三個開放檢查點:Nemotron-3-Embed-8B-BF16(精度優先版本)、Nemotron-3-Embed-1B-BF16(輕量化版本)以及 Nemotron-3-Embed-1B-NVFP4(針對 NVIDIA Blackwell 架構優化的 4 位元版本)。

三款模型均採用雙向注意力遮罩訓練的 Transformer 編碼器,最大序列長度同為 32,768 個 token,並支援 34 種語言,且皆採用 OpenMDW-1.1 許可協議開源。值得注意的是,這些模型的基礎架構均源自 Mistral 系列:8B 版本以 Ministral-3-8B-Instruct-2512 為基礎,兩個 1B 變體則基於 Ministral-3-3B-Instruct-2512。在 RTEB 基準的 16 項公開任務測試中,8B-BF16 版本以平均 NDCG@10 得分 78.46 位居榜首;1B-BF16 版本得分 72.

38,相較上一代基線 llama-nemotron-embed-vl-1b-v2 提升了 10.4 分。而針對 Blackwell 優化的 1B-NVFP4 版本僅損失 0.38 分,相當於保留了 99.5% 的精度,同時在 Blackwell 架構上的吞吐量比 BF16 提升 2 倍。在模型建構路徑上,1B 模型並非從頭小規模訓練,而是採用壓縮策略。研發團隊先使用 NVIDIA ModelOpt 的神經架構搜索,將 3B 基礎模型剪枝至 2B,再從微調後的 8B 嵌入向量教師模型中,透過餘弦距離損失和均方誤差損失進行知識蒸餾,最終迭代至 1.14B 參數。

NVFP4 版本則在此基礎上加入量化感知蒸餾,使用 512 個樣本校準、2 萬個樣本訓練,在長輸入場景下成功恢復精度。部署層面,三個版本支援的框架略有不同。8B 和 1B 的 BF16 版本支援 Transformers 與 Sentence Transformers 框架;而 1B-NVFP4 僅支援 vLLM 0.25.0 的 /v2/embed 接口。微架構覆蓋方面,NVFP4 版本相容 Ampere、Hopper、Lovelace 與 Blackwell,BF16 版本則主要面向 Ampere、Hopper 與 Blackwell。

NVIDIA 也同步推出針對 1B 模型的優化版 NIM 微服務,基於 Rust 建構,在 GB200 與 RTX PRO6000 上達到或超越了 vLLM 檢查點的性能。應用場景方面,該系列模型涵蓋多語言企業搜尋,可實現跨語言檢索;同時支援程式碼檢索,訓練資料包含 SWE-bench 等程式碼數據集;以及智能體記憶,32K token 長上下文足以應對較長對話摘要的嵌入需求。對於成本敏感的場景,NVIDIA 建議採用「1B-NVFP4 處理高容量召回 + 8B 處理困難查詢」的分層 RAG 策略,在效能與資源之間取得平衡。

為方便開發者快速上手,NVIDIA 提供了完整的程式碼範例,涵蓋基於 Sentence Transformers 的本地推理和基於 vLLM 的服務端部署。查詢與文件分別透過 `query:` 和 `passage:` 前綴區分,嵌入向量經 L2 歸一化處理後,點積即等於餘弦相似度。這項設計讓開發者能夠更直觀地將模型整合至既有檢索流程中,進一步降低採用門檻。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

1 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

2 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前