從賣芯片到賣整個AI工作流:英偉達發佈Nemotron 3.5與模型路由器

硅谷Tech news2026.08.12 08:57 · 來自北京全文2738字00:00 / 06:57輸出快4倍,任務提速30%。英偉達新模型Nemotron 3.5給企業AI補上“調度層”。企業選模型的標準正在從“哪個最強”轉向“哪個夠用、哪個快、哪個划算”。當AI智能體成為企業應用的標配,它們承擔的任務從成批的簡單小任務,一路延伸到需要跨深度知識領域的複雜推理。前者交給能快速處理批量小任務的輕量模型即可,後者才需要高智能、強推理的前沿模型。問題已經不再是誰的算力更強,而是哪一個任務該交給哪一個模型。英偉達今天的兩個發佈,是對這條邏輯的直接回應。
它推出了一款高度可定製、主打高效率的新模型Nemotron 3.5 Lightning,以及一個名為NeMo Switchyard的智能體模型路由器。前者補上“執行型”模型的位置,後者則解決“模型足夠多之後,誰來調度”的問題。一款為“執行”而生的輕模型Nemotron 3.5 Lightning是一個總參數約300億的混合專家模型,單次推理只激活約30億參數。英偉達稱,相比同類模型,它的輸出速度最高提升約4倍,智能體任務完成速度提升約30%。它的定位不是取代最強的前沿模型,而是成為多智能體系統裡的“執行型”模型。
在一個複雜的企業AI系統裡,大模型負責任務規劃和複雜推理,Lightning則承擔大量代碼審查、安全監控、數據處理、告警分析這類專業化工作。混合專家架構的價值正在於此,總參數不小,但每次推理只激活其中一小部分,單次token計算成本隨之下降。這裡需要釐清一個落差,輸出快4倍,並不意味著整個任務能快4倍。模型推理只是智能體工作流的一環,工具調用、API響應、多智能體之間的任務編排都會形成新的瓶頸,實際任務提速被壓縮到約30%。這也是英偉達在同一個節點端出Switchyard的原因,只解決“單個模型跑得快”遠遠不夠,還要解決“每一步該用哪個模型”。
第三方評測機構Artificial Analysis的數據印證了Lightning的執行能力。它的Intelligence Index得分為24,比上一代小尺寸型號Nemotron 3 Nano高出9分,與OpenAI的gpt-oss-120b相當,僅落後於規模約為其4倍的Nemotron 3 Super 2分。在代理任務相關的GDPval-AA v2評測上,它的Elo達到824,超越Nemotron 3 Super和gpt-oss-120b;在Terminal-Bench v2.1上拿到24%的成績,而Nemotron 3 Nano只有7%。
在預發佈測試中,其輸出速度接近每秒670個token。模型足夠多之後,路由成為新軟件層Lightning的另一重差異化在於它開放且易於定製。企業可以在自己的硬件上,用NeMo針對專有領域數據、工具和工作流進行二次訓練。“我們聽到的是,Lightning極易定製。”英偉達生成式AI副總裁Kari Briski說。據她介紹,CodeRabbit用英偉達的標準模型配方訓練了一個epoch,約兩小時、花85美元就產出了一個路由智能體。另一個夥伴把Lightning直接放進已有的後訓練棧,“無需任何改動”。還有一個公司用單張H100卡就完成了訓練,另一個乾脆晚上跑訓練任務,早上來取結果。
“這正在把後訓練和微調變成把碗放進洗碗機、然後按下啟動鍵。”Briski說。英偉達同時放出了它的數據集、後訓練數據集,以及訓練模型所用的配方和框架。開發者可以把英偉達的後訓練數據與企業自有數據混在一起,做出“取兩家之長”的混合模型。“這就是為什麼我們看到人們很快得到很好的結果。”Briski說。NeMo Switchyard是一個開源的模型路由庫。它會考慮當前有多少模型可用、各自能力如何,在智能體工作流的每一步,把請求路由到當時最合適、最高效的模型。開發者可以根據質量、延遲、成本等優先級,自定義路由策略。
對未來的多智能體系統而言,真正重要的或許已經不是“哪個模型最好”,而是哪個任務該由哪個模型完成。企業不必讓每一個任務都用最貴的模型。英偉達與Boomi、Cadence Design Systems、Classmethod、Cognition、Kong、Langchain、Nous Research、Siemens等一批生態夥伴合作,把智能路由接入開發者已在使用的工具。把Lightning和Switchyard放在一起看,英偉達的判斷清晰可見,隨著模型數量越來越多,模型之間的調度和協同會成為新的軟件層。從Nemotron 4到與OpenAI的微妙關係這兩次發佈只是英偉達開源模型戰略的局部。
Nemotron 3家族去年12月推出,當時有三個尺寸,Nano、Super、Ultra。據The Information報道,英偉達正在開發下一代Nemotron 4,目標參數量至少1萬億,約為其現有最大模型Nemotron 3 Ultra的兩倍,旨在與全球頂尖開源模型比肩。它還組建了一個包含Reflection、Cursor、Thinking Machines、Mistral等在內的“Nemotron聯盟”,多方在推進自身模型的同時,向Nemotron 4貢獻訓練數據、評估支持和設計方案。這背後是英偉達微妙的處境。
其芯片需求高度集中於OpenAI、微軟、SpaceX等少數前沿實驗室和雲服務商,而英偉達已向OpenAI投資300億美元;另一邊,Nemotron 4恰恰定位為企業提供成本更低的替代方案,與這些前沿實驗室形成競爭。它一邊給客戶供芯片,一邊下場造模型,邊界正在變得模糊。不過對英偉達而言,這未必是零和遊戲。AI模型評測機構Arena的首席執行官Anastasios Angelopoulos的一句話點破邏輯,“無論哪家公司做出優秀的開源模型,英偉達都是贏家。”開源生態越繁榮、參與主體越多元,GPU的整體需求就越旺盛。英偉達的角色正在從賣芯片的,變成賣整個AI工作流的。
只要模型跑在英偉達的路由、推理和部署體系裡,無論企業最終選擇誰的模型,它都能從整個工作流中獲得價值。這才是Switchyard與Nemotron 3.5放在一起發佈的真正含義。(本文首發APP,作者 | 硅谷Tech_news,編輯 | 秦聰慧)
Related
相關文章

王興興“錯配”梁文鋒?
王興興“錯配”梁文鋒?字母榜2026.08.24 17:44 · 來自河北全文4818字00:00 / 13:21關於世界模型,宇樹和DeepSeek理念分歧明顯。文 | 字母榜宇樹科技的股價還在持續下跌。市值從上市首日的4449億元高點,跌至2400億元,截至8月24日收盤,市值較最高點蒸發了2000億元。然而比股價更值得關注的是,宇樹接下來要怎麼走。8月20日,也就是宇樹上市第二天,王興興出現在北京世界機器人大會論壇。十多分鐘的分享裡,AI成為了高頻詞彙。他談到AI實時生成、實時識別,也談到AI模型投入,更透露了宇樹正在預研的一件事:讓物理AI機器人實現“自進化”。王興興講的每一件事,最後都指向一個關鍵要素:AI大模型。特別是最後一點,王興興說,要實現“物理AI自進化”,要用目前最前沿、最頂尖的AI大模型來驅動。而這恰恰是宇樹目前不太擅長的部分。不過,宇樹找到了DeepSeek。今年8月,兩家公司已經達成合作,圍繞AI大模型與具身智能相關技術展開合作。說到具身智能公司和AI大模型公司的合作,就不得不提當年Figure AI和OpenAI的合作。2024年,OpenAI在投資Figure AI後,雙方簽署了三年合作協議,合作開發人形機器人AI模型。但是僅一年後,FigureAI終止合作,轉向自研。於是問題來了:王興興和梁文鋒,會不會重走Figure AI和OpenAI的老路?01為什麼宇樹需要DeepSeek?對於宇樹來說,過去幾年,模型研發已經有了一些積累,但顯然投入不足,進展緩慢,所以找到一個頂尖的AI大模型公司合作,是一個比較自然的選擇。先來看宇樹目前的模型研發進展。當前,具身智能大模型沒有一個統一的技術路線,但VLA和世界模型,是行業重點探索的兩個方向。行業甚至也在探索兩者融合的技術路線。宇樹也在摸索,採取了“兩條腿走路”的策略,並行研發兩種模型。所謂VLA(視覺

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。