黃仁勳力挺開源AI後,英偉達甩出兩大開源利器!輸出速度快4倍、成本砍至1/3

2026年8月12日 17:26
黃仁勳力挺開源AI後,英偉達甩出兩大開源利器!輸出速度快4倍、成本砍至1/3
站內 AI 整理稿

(公眾號:zhidxcom) 編譯 | 茄子 編輯 | 程茜 8月12日消息,昨日,英偉達發佈開源大語言模型Nemotron 3.5 Lightning,以及面向Agent的開源智能路由庫NeMo Switchyard。前者總參數量為300億,推理時僅激活約30億參數,輸出速度最高達到同等規模模型的4倍;後者可以在多款模型之間自動分配任務,英偉達內部測試顯示,其任務完成成本可降至全部使用Claude Opus 4.8時的1/3。▲Nemotron 3.5 Lightning和NeMo Switchyard開源(圖源:Hugging Face、Github) Nemotron 3.

5 Lightning是英偉達7月24日簽署支持開源AI模型的聯名公開信後,首次推出的開源模型。英偉達創始人兼CEO黃仁勳稱,Nemotron 3.5 Lightning適用於持續運行和長時間工作的Agent,並將其概括為“智能、快速、高效且開源”。▲黃仁勳轉發Nemotron 3.5 Lightning發佈消息(圖源:X) 大模型測評機構Artificial Analysis對總參數量低於400億的開放權重模型進行了比較。Nemotron 3.5 Lightning綜合能力得分為24分,輸出速度約為670 token/s,是圖中唯一進入高速度、高得分區域的模型。▲Nemotron 3.

5 Lightning在Artificial Analysis的評測結果(圖源:X) 英偉達稱,Nemotron 3.5 Lightning主要承擔Agent執行長程任務時的工具調用、結果檢查、格式整理和代碼操作等高頻工作。在技術上,Nemotron 3.5 Lightning結合多token預測、推測解碼和低精度量化等技術提高推理效率。為了進一步降低整個Agent工作流的運行成本,英偉達還推出NeMo Switchyard路由庫,對不同模型進行統一調度。

據技術博客稱,NeMo Switchyard會路由庫根據任務難度、模型能力、成本和延遲選擇模型,將複雜規劃交給能力更強的前沿模型,把工具調用、結果檢查和格式整理等高頻操作交給速度更快、成本更低的模型。在LangChain完成的145項多輪Agent任務測試中,Switchyard僅將7%的請求交給前沿模型,整體成本降低74% 此外,據外媒The Information昨日報道,英偉達正在研發更大規模的Nemotron 4系列,其最大版本預計至少擁有1萬億參數,目標是達到全球領先開源模型的水平。不過,該模型尚未完成最終訓練,具體規格及發佈時間均未確定。目前,Nemotron 3.

5 Lightning已全面開放至Hugging Face、ModelScope、OpenRouter以及英偉達官方開發者平臺,供開發者下載與調用,NeMo Switchyard也已在GitHub開源。Nemotron 3.5 Lightning開源鏈接: https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 NeMo Switchyard開源鏈接: https://github.

com/NVIDIA-NeMo/Switchyard 一、300億參數每次激活30億,1萬項Agent任務完成速度比Qwen 3.6快30% Nemotron 3.5 Lightning採用混合專家架構。該模型包含300億參數,但處理每個token時,路由器只會調用少量專家模塊,因此每次推理激活約30億參數。這種設計使模型在保留300億參數總體容量的同時,減少每次推理實際參與計算的參數量,從而降低計算開銷。英偉達將Nemotron 3.5 Lightning定位為Agent執行長程任務中的工作模型,主要負責工具調用、檢查工具返回結果、整理輸出格式和運行代碼命令等高頻操作。

在這套模型分工中,Nemotron 3 Ultra等前沿推理模型負責複雜規劃和任務編排,Nemotron 3.5 Lightning則執行數量更多、流程相對固定的具體任務。英偉達認為,如果每一步都調用前沿模型,會增加成本和延遲。Artificial Analysis測試顯示,Nemotron 3.5 Lightning處於同類開源模型的能力—速度“帕累託前沿”,即目前沒有其他參測模型能在綜合能力和輸出速度兩項指標上同時超過它。▲Nemotron 3.

5 Lightning在準確率與輸出速度方面的表現(圖源:英偉達) 在更關注Agent實際任務完成效率的PinchBench測試中,Nemotron 3.5 Lightning以86%的準確率完成1萬項任務。在準確率相近的情況下,其任務完成速度比Qwen 3.6 35B快30%。▲Nemotron 3.5 Lightning與同類模型的Agent任務完成效率對比(圖源:英偉達) 英偉達稱,該模型的輸出速度最高可達到同等規模模型的4倍。不過,這一數據主要反映特定部署環境下的生成速度,並不代表Nemotron 3.5 Lightning在綜合智能方面超過所有同規模模型。

目前,網絡安全廠商CrowdStrike、法務AI平臺Harvey、代碼審查工具商CodeRabbit正分別探索將該模型用於網絡安全、法律服務和代碼審查;科研平臺Lila Sciences參與提升其物理及生命科學任務的推理能力,垂直微調服務商Fastino Labs則針對軟件開發、金融和醫療場景進行了定製。▲多家企業針對專業任務定製Nemotron 3.5 Lightning(圖源:英偉達) 技術方面,Nemotron 3.5 Lightning在訓練中加入多token預測能力,可以提前預測後續多個token,再對預測結果進行驗證。

英偉達還為其提供DSpark和DFlash兩款草稿模型,用於快速生成待驗證內容,以進一步提高推測解碼速度。該模型同時提供BF16和NVFP4版本,可運行在Jetson、GeForce RTX 5090和DGX Spark等本地設備上,也能部署至工作站、數據中心及雲環境。Nemotron 3.5 Lightning現已上線Hugging Face、ModelScope、OpenRouter和英偉達開發平臺。英偉達還開源了用於強化模型編程Agent能力的數據集Nemotron-RL Agentic Terminal Pivot。

二、Agent任務按難度分配模型,合作伙伴實測成本最高降低74% 英偉達稱,Agent執行長程任務時,通常要經歷規劃、檢索、工具調用、結果驗證和糾錯等多個環節,而不同環節對模型能力、響應速度和運行成本的要求並不相同。NeMo Switchyard因此會結合請求內容、上下文、模型能力、運行成本和延遲,為Agent工作流中的不同環節選擇模型。例如,複雜規劃可以交給能力更強的前沿模型,工具調用和結果整理等常規步驟則可以轉交給速度更快、成本更低的模型。該工具並不侷限於英偉達自己的模型,可以同時接入開源和閉源模型。開發者還可以根據準確率、速度和成本等目標調整路由策略。

NeMo Switchyard提供多種路由方式。其中,分類路由器根據任務所屬領域選擇模型;階段路由器結合Agent當前執行階段及工具使用情況調整模型;升級路由器則先調用成本較低的模型。如果當前模型無法可靠完成任務,NeMo Switchyard再交給能力更強的模型。▲NeMo Switchyard系統架構圖(圖源:英偉達) 英偉達內部測試顯示,與所有任務都使用Claude Opus 4.8相比,NeMo Switchyard可以在保持接近Claude Opus 4.8準確率的情況下,將任務完成成本降至約三分之一。

▲英偉達內部測試(圖源:英偉達) 在合作伙伴測試中,AI Agent開發基礎設施廠商LangChain在145項多輪Agent任務中進行了測試。Switchyard僅將7%的請求發送給Claude Opus 4.8,雖然準確率下降約6個百分點,但總體成本降低74%。▲NeMo Switchyard在LangChain測試中的表現(圖源:LangChain) 軟件研發Agent廠商Cognition將階段路由方法用於Devin Desktop後,平均成本比全部請求使用同一前沿模型降低28%。

金融與軟件工程AI服務商Ramp Labs在自研軟件工程評測基準Ramp SWE-Bench中完成英偉達 NeMo Switchyard調度工具實測,並稱,其測試成本降低58%,運行時間縮短33%。▲NeMo Switchyard在合作伙伴測試中的成本與運行效率表現(圖源:X) 英偉達還在與企業級AI網關服務商KongKong、開源多模型統一網關廠商LiteLLM、開源大模型與智能體研發機構Nous Research和西門子等企業合作,將路由能力接入AI網關、開發工具和企業Agent。

三、被曝研發萬億參數模型,目標之一是擴大GPU需求 據The Information昨日報道,Nemotron 3.5 Lightning只是英偉達擴大開源模型投入的一部分。該公司正在開發Nemotron 4系列,希望其性能達到全球領先開源模型的水平。多名員工預計,Nemotron 4最大版本可能擁有至少1萬億參數,規模約為Nemotron 3 Ultra的兩倍。英偉達已經確定了部分訓練數據和架構方案,但尚未完成最終訓練,發佈時間也沒有敲定。英偉達擴大模型投入,一方面可以用模型開發反向優化芯片和軟件,另一方面也希望降低企業使用AI的門檻,從而擴大GPU需求。

高質量開源模型越多,能夠訓練、微調和部署AI的企業就越多,英偉達硬件的潛在客戶範圍也會隨之擴大。不過,這也讓英偉達與客戶和投資對象之間的關係變得更加複雜。OpenAI和Anthropic等前沿實驗室是英偉達芯片的重要客戶,Reflection AI、Thinking Machines Lab等開源模型公司則獲得過英偉達投資。英偉達親自開發高性能模型,可能與這些企業形成直接競爭。結語:英偉達補齊Agent模型調度環節 Nemotron 3.

5 Lightning與NeMo Switchyard分別切入Agent的執行和調度環節:前者承擔調用頻繁、強調速度的具體任務,後者根據任務難度、模型能力、成本和延遲,在多款開源及閉源模型之間分配請求。這套方案的重點不是依賴一款模型完成全部工作,而是通過多模型協作控制長程Agent的運行成本。隨著Agent從一次性問答轉向持續執行搜索、編程和企業流程等任務,模型調用量及推理成本隨之增加。模型路由由此成為新的基礎設施環節,雲廠商、模型平臺和Agent開發工具都在嘗試將不同模型接入同一套工作流,競爭重點也從單一模型能力延伸至任務分配效率和整體成本。

英偉達此次同時佈局執行模型、模型路由和被曝在研的萬億參數模型,正在將業務從GPU進一步延伸至Agent技術棧。若開源模型和多模型協作得到更廣泛採用,新增的訓練、微調和推理需求也可能繼續帶動其計算平臺的使用。來源:英偉達、The Information

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛
全天候科技生成式AI

企業AI最後一公里:三路人馬在此交鋒

鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。

剛剛