黃仁勳最新訪談:下一代軟件公司的操作系統是 Harness

重點摘要
黃仁勳在最新一次公開訪談中,與 LangChain 創辦人 Harrison Chase 進行了 26 分鐘的對談。令人意外的是,這位 NVIDIA 創辦人全程沒有提起 GPU、算力或新的模型參數,而是將焦點完全放在一個主題上:當 AI Agent(智能體)開始真正為人類調用工具、執行工作流程時,企業的工程資源應該投注在何處。他的答案非常直接——與其重複撰寫大量程式碼,不如專注於打造能夠確實完成任務的 Agent。 黃仁勳將寫程式碼比擬為打字。他指出,打字能力雖然重要,但並非作家的全部工作。
黃仁勳在最新一次公開訪談中,與 LangChain 創辦人 Harrison Chase 進行了 26 分鐘的對談。令人意外的是,這位 NVIDIA 創辦人全程沒有提起 GPU、算力或新的模型參數,而是將焦點完全放在一個主題上:當 AI Agent(智能體)開始真正為人類調用工具、執行工作流程時,企業的工程資源應該投注在何處。他的答案非常直接——與其重複撰寫大量程式碼,不如專注於打造能夠確實完成任務的 Agent。黃仁勳將寫程式碼比擬為打字。他指出,打字能力雖然重要,但並非作家的全部工作。同樣地,能夠寫出一段 Python 程式碼依然重要,但這並不等於完成了一個 Agent 系統。
工程師還需要決定 Agent 能夠看到什麼、能夠調用哪些工具、失敗後該如何恢復,以及最終的輸出結果由誰來驗收。生成程式碼只解決了「寫出來」的問題,而 Agent 工程則必須解決「跑得動、做得對、出錯能停、過程可追溯」等更複雜的挑戰。在訪談中,黃仁勳反覆強調一個詞:Harness。這不是一個產品名稱,而是一個概念,涵蓋了提示詞(Prompt)、工具說明、記憶、上下文管理、任務拆分、重試機制、評測方法以及權限控制。模型負責推理,而 Harness 的責任則是將推理組織成可以被驗收的工作成果。
根據公開資料,LangChain 團隊讓 Nemotron 3 Ultra 模型運行 Deep Agents 評測,過程中沒有重新訓練模型的任何權重,僅僅調整了系統提示詞、工具描述和中間件配置。結果令人震驚。在調整 Harness 之後,評測成績從原始狀態一舉追到 0.86 分,而目前最高分的閉源模型成績為 0.87 分,兩者差距僅有 0.01。更驚人的是成本變化:單次評測的成本從原來的 43.48 美元,大幅下降至 4.48 美元,便宜了將近十倍。這項數據清晰地展示,同一個模型放進不同的 Harness 系統中,能夠釋放的能力天差地遠。
未來在比較 Agent 系統時,只看模型榜單已經遠遠不夠。黃仁勳進一步指出,成本的大幅下降不僅僅是讓帳單變得更漂亮,更會從根本上改變開發方法。由於 Agent 完成一次任務往往需要進行多輪推理、調用多個工具,甚至可能並行嘗試不同路徑。當每一次試驗都非常昂貴時,團隊自然會減少評測與探索。但當成本變低,開發團隊就能獲得三項新能力:第一是「多試」,可以同時比較不同的模型、提示詞、工具和重試策略;第二是「常測」,將評測融入日常開發與生產監控;第三是「多部署」,將過去只能服務少數高價值任務的 Agent,擴展到更多細分的工作流程。
這也引發了合理的推測,當開放模型的 Harness 調優成本足夠低廉時,企業傾向於「先用前沿模型探路,再將高頻任務專門化」。在問題剛出現、邊界還不清楚時,前沿模型適合用來探索上限;當任務反覆出現且驗收標準逐漸穩定後,就可以將其收斂為成本更低的專用 Agent。而這個「專門化」的過程,不只發生在模型權重裡,真正拉開競爭差距的,是公司自己的工具說明、業務詞彙、權限邊界、歷史軌跡與驗收數據,這些元素共同決定了一個 Agent 是否真正理解這家公司。黃仁勳更進一步拋出一個激進的判斷:未來的公司會把越來越多的能力建立在 Harness 之上。
過去,企業將流程寫入 ERP、CRM 或一串固定的審批規則中;而在 Agent 時代,部分流程會轉變為「給定目標、工具、權限和驗收標準,再由系統自行規劃路徑」。Harness 正是承接這些業務規則的新容器。這也是為什麼開放技術棧被反覆強調,因為企業希望掌握自己的記憶、軌跡、評測集與調優數據,並決定它們運行在什麼樣的基礎設施上。然而,當 Agent 能夠調用終端、資料庫與內部 API 時,它已經不僅僅是一個聊天機器人,而是擁有行動能力的軟體進程。
在 NVIDIA 提出的 NemoClaw 藍圖中,Deep Agents Code、Nemotron 3 Ultra 與 OpenShell 運行時被組合在一起。模型負責推理,Harness 負責組織任務,而 OpenShell 則將程式碼執行放進沙箱,並對網路、憑證、檔案與日誌分別施加安全策略。黃仁勳的底線非常明確:Agent 不應該直接拿到長期憑證。更合理的方式是由運行時根據當前任務與策略,臨時注入權限,讓 Agent 只在必要時間、必要範圍內,訪問必要的資源。
Harrison Chase 在訪談中也提出了一個敏感問題:當 Agent 使用自然語言協作、表現得越來越像人類時,我們該在多大程度上將其擬人化?黃仁勳的回答相當冷靜。他認為自然語言雖然讓互動更順暢,但不應模糊責任邊界。Agent 可以擁有角色與名字,但不能因為語氣自信就被預設為正確,也不能因為「像同事」就跳過權限與驗收。判斷 Agent 是否完成任務,必須依賴外部證據:測試是否通過、程式碼變更是否符合預期、資料是否寫入正確位置、審批記錄是否完整。Agent 說「已經完成」,只是一個待驗證的輸出,而非最終結論。最後,黃仁勳也談到了對就業的影響。
他認為,當生產一項數位服務的成本下降,社會不會只滿足於原來的數量,而是會產生更多過去做不起、排不上優先級的需求。對程式設計師來說,真正改變的不是「還有沒有程式碼」,而是工作清單的重新排列。樣板程式碼、格式轉換與重複性的除錯工作會更多交給 Agent,而任務定義、系統設計、評測構建、權限治理與異常處理則會變得更加重要。個人能否受益,取決於能否跨越這次職責的遷移。將黃仁勳的整場訪談拼湊起來,可以描繪出一張完整的工程藍圖:模型負責推理,Harness 負責計畫、記憶與工具,運行時負責隔離與執行,評測與護欄(Guardrails)則負責判斷結果能否交付。
少了任何一層,Agent 都可能只停留在展示階段。這套結構也為團隊給出了實施順序:先用真實任務建立評測,再讓模型與 Harness 運作起來;隨後補足沙箱、身份、日誌與人工接管機制;最後才討論規模化部署與成本優化。模型會持續變強,但企業真正需要長期經營的,是模型周圍那一套與自身數據、工具和責任邊界緊密綁定的工程環境。黃仁勳口中的 Harness,或許正是下一代軟體公司最核心的一層基礎設施。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。
TutorMoments:AI 家教何時該出手,何時該放手?
今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。