NVIDIA 發佈 Nemotron 3 Embed 系列,8B 版本登頂 RTEB 檢索基準
重點摘要
AI資訊AI新閒資訊正文NVIDIA 發佈 Nemotron 3 Embed 系列,8B 版本登頂 RTEB 檢索基準發布於AI新閒資訊時間 :Jul 17, 2026閱讀 :1分鐘NVIDIA 近日發佈了 Nemotron3Embed 系列嵌入向量模型,專為生產級 RAG、智能體檢索、代碼檢索及智能體記憶等場景設計。
NVIDIA 近日正式發表 Nemotron 3 Embed 系列嵌入向量模型,專為生產級檢索增強生成(RAG)、智能體檢索、程式碼檢索以及智能體記憶等場景打造。其中 8B 參數版本在檢索嵌入基準測試 RTEB 上奪下第一名,成為當前該領域性能最強的開源模型,引起業界高度關注。該系列共釋出三個開放檢查點:Nemotron-3-Embed-8B-BF16(精度優先版本)、Nemotron-3-Embed-1B-BF16(輕量化版本)以及 Nemotron-3-Embed-1B-NVFP4(針對 NVIDIA Blackwell 架構優化的 4 位元版本)。
三款模型均採用雙向注意力遮罩訓練的 Transformer 編碼器,最大序列長度同為 32,768 個 token,並支援 34 種語言,且皆採用 OpenMDW-1.1 許可協議開源。值得注意的是,這些模型的基礎架構均源自 Mistral 系列:8B 版本以 Ministral-3-8B-Instruct-2512 為基礎,兩個 1B 變體則基於 Ministral-3-3B-Instruct-2512。在 RTEB 基準的 16 項公開任務測試中,8B-BF16 版本以平均 NDCG@10 得分 78.46 位居榜首;1B-BF16 版本得分 72.
38,相較上一代基線 llama-nemotron-embed-vl-1b-v2 提升了 10.4 分。而針對 Blackwell 優化的 1B-NVFP4 版本僅損失 0.38 分,相當於保留了 99.5% 的精度,同時在 Blackwell 架構上的吞吐量比 BF16 提升 2 倍。在模型建構路徑上,1B 模型並非從頭小規模訓練,而是採用壓縮策略。研發團隊先使用 NVIDIA ModelOpt 的神經架構搜索,將 3B 基礎模型剪枝至 2B,再從微調後的 8B 嵌入向量教師模型中,透過餘弦距離損失和均方誤差損失進行知識蒸餾,最終迭代至 1.14B 參數。
NVFP4 版本則在此基礎上加入量化感知蒸餾,使用 512 個樣本校準、2 萬個樣本訓練,在長輸入場景下成功恢復精度。部署層面,三個版本支援的框架略有不同。8B 和 1B 的 BF16 版本支援 Transformers 與 Sentence Transformers 框架;而 1B-NVFP4 僅支援 vLLM 0.25.0 的 /v2/embed 接口。微架構覆蓋方面,NVFP4 版本相容 Ampere、Hopper、Lovelace 與 Blackwell,BF16 版本則主要面向 Ampere、Hopper 與 Blackwell。
NVIDIA 也同步推出針對 1B 模型的優化版 NIM 微服務,基於 Rust 建構,在 GB200 與 RTX PRO6000 上達到或超越了 vLLM 檢查點的性能。應用場景方面,該系列模型涵蓋多語言企業搜尋,可實現跨語言檢索;同時支援程式碼檢索,訓練資料包含 SWE-bench 等程式碼數據集;以及智能體記憶,32K token 長上下文足以應對較長對話摘要的嵌入需求。對於成本敏感的場景,NVIDIA 建議採用「1B-NVFP4 處理高容量召回 + 8B 處理困難查詢」的分層 RAG 策略,在效能與資源之間取得平衡。
為方便開發者快速上手,NVIDIA 提供了完整的程式碼範例,涵蓋基於 Sentence Transformers 的本地推理和基於 vLLM 的服務端部署。查詢與文件分別透過 `query:` 和 `passage:` 前綴區分,嵌入向量經 L2 歸一化處理後,點積即等於餘弦相似度。這項設計讓開發者能夠更直觀地將模型整合至既有檢索流程中,進一步降低採用門檻。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。

內部賽馬暫停,騰訊、阿里、字節AI辦公產品“合兵”對陣
過去半年,騰訊、阿里巴巴、字節跳動等大廠在AI辦公產品領域經歷內部賽馬後,近期紛紛收攏資源,推出整合方案。騰訊將QClaw業務調整至雲產品六部,與WorkBuddy統一管理;阿里整合三款產品推出千問辦公;字節則將飛書團隊併入豆包。市場數據顯示,6月國內AI辦公智能體平臺月訪問量突破6000萬次,顯示此領域競爭日益激烈。