Jev估值100億美元!創始人Diogo Almeida回答一切

2026年10月3日 10:40
Jev估值100億美元!創始人Diogo Almeida回答一切
站內 AI 整理稿

o Almeida,頂著一頭新染的紅髮閃亮登場了!(doge Diogo在最新一期Latent Space訪談中坦言: 公開benchmark極其容易被操縱,即便開發者沒有主動作弊,最終也可能被榜單牽著走。所以相比於一張通用榜單,他更願意相信長期積累的產品體驗與信任: 直到你把模型放進自己的工作流,並針對那個工作流去評估、去測量,才能判斷它在真正重要的流程中表現如何。甚至還大膽開麥: 當年身在OpenAI,我深深感受到了什麼叫無力… 666,Diogo這是真沒拿我們當外人,啥都往外說啊。這幾天,Jev這款“不會聊天、只會做決定”的模型火爆全網。

有人用它來篩選海量論文;有人用它來提前拿捏客戶的需求;甚至還有人連夜開源了一個“Jev聊天助手”,可以提前預判老闆的預判、以及對象鬧彆扭到底是為了啥,並一鍵生成幾條最合適的回覆供你選擇: 好傢伙,再也不用為猜不透老闆和對象的心思焦頭爛額了?!Jev的成績也相當能打。短短6天,Jev發佈視頻的瀏覽量便突破了3870萬;在第三方JevBench v1.2.1綜合榜中,Jev 1.13.0也以75.3分排名第一。我火速把訪談內容整理了出來,重點筆記如下: 現在整個行業都在卷速度、拼成本,反倒把可靠性給弄丟了;但可靠性才是一款產品真正的靈魂,也是大家敢於託付信任的關鍵。

我並不仇視OpenAI,但既然AI能破解千禧年大獎難題,那為什麼他們在有經濟價值的實際工作上貢獻幾乎為零?拉動TFP(全要素生產率)增長,才是衡量AI經濟革命真正的標尺,我們的目標就是在五年內拉動3%。我已經厭倦AI永遠站在舞臺中央;世界本身就應該更有趣,AI只需要退到幕後,默默提供輔助。目前的AI編碼,本質上仍是圍繞單一模型展開的競爭,只是提供不同檔位供用戶選擇;所以當下各家開源coding agent的能力差距並不大,while循環能實現的能力邊界是有限的。一旦某一家做出獨有的殺手級場景,所有人都會蜂擁而至,而開源項目則可以快速復刻這套能力。就算給我十億美元(約71.

3億元),我也不會選擇從零開始預訓練大模型的!因為預訓練實在太·燒·錢·了!全程高能,大家速看!AI連難題都能攻克,為什麼還幹不了多少實際工作?主持人(swyx):Jev爆火之後,你感覺如何?Diogo Almeida:說實話,我覺得自己已經被榨乾了,每天只剩一副筋疲力盡的軀殼四處飄蕩。事情鋪天蓋地砸過來,而我是技術出身的CEO,所以每天需要到處救火。這幾年我一直在講,整個AI行業就像遊樂園裡的鏡子屋;大家都有點脫離現實,說著很多邏輯根本對不上的話。但就在這周,整個行業終於被拉回了現實。大家開始意識到AI比之前想象得強大得多,由AI驅動經濟變革,也再次成了行業認真討論的議題。

我經常在演講裡拋出一個問題,即“AI已經聰明到足以挑戰千禧年大獎難題,為什麼還是沒法自動化大量最基礎的工作?” 這些工作的門檻不高,也沒什麼職業成就感,人類本來可以去做更有意思的事,但現在仍然被困在這些重複、枯燥的任務裡。根本原因就是我們還沒法把它們自動化。就好比我們手裡有一臺動力強悍的自動化引擎,卻找不到合適的接口,接不進真正有商業價值的業務場景。主持人:有道理,行業裡還有很多全新的模型範式等著我們去探索,應該百花齊放。Diogo Almeida:我覺得早期互聯網那種蓬勃的活力回來了,技術烏托邦的浪潮也回來了。

不再是coding agent時靈時不靈、頂尖能力全被鎖在大廠內部的那一套,現在,每個人又都有機會參與創造了。但這會是一片狂野的新大陸,請大家系好安全帶。主持人:能不能分享一些可以對外披露的數據,比如註冊量之類的指標?Diogo Almeida:我們的日處理量已經突破一萬億token,而且不是曇花一現的峰值,夜間流量也在持續走高。這說明大量調用來自機器自動化,不只是普通用戶嚐鮮。目前日吞吐一萬億token的這個規模也相當可觀,能做到這個數字讓我感到非常振奮。而註冊量對我來說其實就沒那麼重要了。

坦白講,這算是我們踩過的一個小坑;推特上有人調侃我們是營銷天才,但我們幾乎沒有市場團隊,所謂“營銷”,也只是帶著一股直白、略顯笨拙的勁兒,持續向候補名單上的用戶開放註冊。但我們之前沒意識對開發者平臺來說,等待名單和註冊用戶量的參考價值有限; 很大一部分註冊用戶根本不是開發者,只是進來隨便跑幾條查詢,然後用完後疑惑:“這是什麼?它又不是聊天機器人,我的ChatGPT才是。”然後就走了。我覺得和重度開發者寫一段循環批量調用相比,這些註冊用戶幾乎可以忽略不計,因為真正創造價值的是前者。真正棘手的是調用速率限制(rate-limit)。一旦用戶真正從模型裡拿到業務價值,就會需要更大的調用配額。

軟件系統本來就是這樣搭起來的。你前期投入成本搭建鏈路,當鏈路產出的價值超過搭建成本時,你就可以把這套邏輯放到後臺持續運行,作為其他系統的依賴,再在上面搭更高層的應用,創造海量現實價值。早期互聯網從業者恐怕很難想象,2000年初的互聯網能迸發出多大的能量。許多顛覆性創新,正是因為不同能力可以自由組合才得以出現。主持人:你們讓我印象很深的一點是,你反覆強調可靠性。我原本以為你們重點聊的是校準,也就是LCD,但實際上你們同樣關注服務可用性和可擴展性。Diogo Almeida:這些都很重要。因為可靠性不只是服務穩定運行,也包括模型輸出是否智能、結果是否穩定、是否符合預期。

推理類的大模型確實夠聰明,但可靠性依舊有很大短板。從許多場景的實際需求來看,模型完全有能力把工作自動化,商業上也有強烈的落地動機,但就是做不到,根源在於模型的優化目標不一樣。可靠性分兩層。一層是你能否信任模型的輸出結果; 一層是能否從更多維度保證模型可靠。我們雖然還暫時沒走到第二層,但我對此滿懷期待。通常來說,我們應該先自動化簡單工作,再攻克複雜任務。但我的目標一直都是:開發者不用反覆試錯,就能確信模型一定能把任務完成。這就像編程時的心流狀態,我寫查詢指令,只是因為這裡需要。

對於不需要複雜分支判斷的環節,直接調用TypeSafe的System-One(機器原生、可編程的決策內核)查詢直接拿結果,由模型可靠地完成分支邏輯。這就是我們的理想,也是一條漫長而艱難的路。我的願景是讓軟件工程被AI充分賦能,而我最不願看到的悲劇就是AI明明能力很強,但實際落地使用率卻極低。這件事讓我很難平靜…我不信奉盲目的技術樂觀主義,也不認為所有技術天然向善。我覺得當下AI的現狀是對技術潛力的巨大浪費;我只想讓這些尚未釋放的技術潛力真正為人所用。主持人:你覺得最難的部分已經結束了嗎?Diogo Almeida:我不認為最難的部分已經結束,未來還會有更多嚴峻挑戰。

如果各類工作順利實現自動化,GDP顯著增長,到處一片狂歡,那或許意味著難關已過,但我並不這麼樂觀。現在整個行業都在卷速度、拼成本,反倒把“可靠性”給弄丟了;但說到底,可靠性才是一款產品真正的靈魂,也是我們敢於託付信任的關鍵。主持人:你們提出過五年內拉動TFP(全要素生產率)增長3%?Diogo Almeida:沒錯,我從來沒見過哪家實驗室把TFP當成目標,但這才是AI經濟革命真正的衡量標尺。這一點其實和OpenAI最初的憲章內核高度契合,只是如今他們不斷改寫定義,目標逐漸轉向追求千億美元級別的利潤。我並不仇視OpenAI,只是“AI”這個詞本身至今沒有清晰定義。

OpenAI最初的願景也是承擔世界上絕大多數有經濟價值的工作,那為什麼直到現在,他們的AI能破解千禧年大獎難題,但在有經濟價值的實際工作上貢獻幾乎為零?我認為目前幾乎所有模型,真正創造的商業價值幾乎都還接近於零。或許已經有微弱起步,但我判斷還不到1%。真正的變革到來時,宏觀經濟統計數據(如GDP)一定會體現出這一點,那將會是無比激動人心的時刻。我覺得AI不會帶來大規模失業,但會推動社會完成一系列良性轉型,讓整個世界變得更好。另外,我已經厭倦AI永遠站在舞臺中央;世界本身就應該更有趣,AI只需要退到幕後,默默提供輔助。主持人:從歷史背景看來。2019年,SaaS軟件創造了巨大的價值。

2026年,AI的能力突飛猛進,但絕大多數軟件幾乎還是老樣子,只是額外外掛了一個聊天框,勉強能用,但好像卻沒人敢把業務關鍵決策交給AI,因為輸出結果不可信。Diogo Almeida:我覺得“AI會把SaaS搞垮”這種說法實在很離譜。我倒覺得未來發生的或許不是SaaS末日,反而是SaaS被AI全面改造——SaaS軟件會被AI全面賦能。目前巨大的商業價值,正在倒逼SaaS與AI深度融合。而最懂業務痛點的SaaS廠商,才是這場自動化革命的真正主角,一個前所未有的創新狂潮即將到來!主持人:現在大家啥活兒都往Jev上扔,結果有的翻車有的封神,你怎麼看這種情況?

Diogo Almeida:我覺得大家拿它來嘗試各種五花八門的任務,這件事本身挺有意思。坦白說,這是一個經驗問題,就像縮放定律scaling law也來自經驗總結。為什麼機器人領域砸了鉅額資金,進展依舊有限?我不認為單純是錢投得不夠,有可能是客觀經驗證明,這條路現階段就是走不通。根據經驗,預訓練大模型這種高度壓縮的智能集合體,本質上屬於System-One思考者。而System-One是最適合描述LLM擅長能力的標籤。現在,RLVR在System-Two深度推理方向取得了驚人進展,我由衷敬佩這項工作。

RLVR確實非常酷,但我不認為它會引發AI末日——雖然RLVR確實把模型推理能力推到了極限,概率不可能絕對為零,但模型在這個方向依舊極度脆弱。回想ChatGPT剛問世時,大家驚歎模型通用性極強,卻吐槽它不擅長數學,搞不定GSM8K小學數學數據集。而如今談RLVR,大家又感慨它脆弱、處處是坑,疑惑它為什麼能完成部分高難度任務。數學問題的難點並不是簡單幾個尖峰,而是呈現分形式的複雜分佈,這正是RLVR帶來的現實。不同技術路線有不同的北極星目標。

RLHF的優化目標是取悅人類,核心是人類反饋;而RLVR面向基準評測benchmark做優化,所有RLVR任務本質上都可以歸為可程序化驗證、輸出簡潔的基準測試任務; 而我們的RLCD(以程序閉環驗證為目標的強化學習),目標則是讓模型在編程場景下足夠可靠。主持人:你覺得技術人員們可以重點關注哪些方向?Diogo Almeida:我覺得demo固然亮眼,但coding agent也是一大核心場景。

我們很早就基於第一性原理,劃分出幾大類核心應用場景: 第一類是暗數據(Dark-Data):大量企業囤著海量數據,卻不敢隨便投入算力分析,因為成本太高;企業對這塊需求極其狂熱,成堆的數據等著解析,這簡直是數據科學家理想的場景。第二類就是coding agent。以上兩塊會成為主要現金牛,本身數據體量足夠龐大。第三類是實時場景,需要模型參與業務閉環。企業CTO、CEO都很清楚,延遲每削減10毫秒,產品體驗就會明顯提升,這在電商、智能助手領域尤其明顯。第四類我個人格外看好遊戲領域。第五類是智能軟件;它高度可組合,能夠實現過去無法想象的功能。

比如用戶可以直接把Jev當成編程語言來用,這類項目效果很驚豔。還有一類是校驗觀測場景:校驗所有LLM調用,類似可觀測性工具。順帶分享一個工程技巧——並行提問的成本很低。如果你需要處理一份龐大的狀態數據,可以先給整條消息打上ID,再針對每一條ID獨立發起查詢。而龐大的狀態只需要付費加載一次,就可以針對內部每一條信息發起大量問題,這是非常划算的降本思路。主持人:我一直覺得System-One/System-Two框架很有價值。因為這意味著每一次高層推理調用都可以搭配一次、十次甚至上百次Jev調用。

Diogo Almeida:這或許可行,也許我們可以把高層推理調用數量減半,每次配套十次Jev調用,用這樣的配比解決過去無法處理的難題。另外,Computer-Use也偏向實時賽道。要是它的可靠性能夠達標,我覺得這個領域會有巨大的發掘空間。對於coding agent來說,目前Claude Code和Codex雖屬第一梯隊,但其單一模型體系僅適配自身業務。目前的AI編碼,本質上仍是圍繞單一模型展開的競爭,只是提供不同檔位供用戶選擇,所以當下各家開源coding agent能力差距並不大,while循環能實現的能力邊界是有限的。

一旦某一家做出獨有的殺手級場景,所有人都會蜂擁而至,而開源項目則可以快速復刻這套能力。我希望與所有產品集成,即便它們可能成為競品,但作為基礎設施提供者,我不該帶有偏向性立場。無論對方是否願意合作,這都讓賽道格局充滿變數與趣味。我們也正整理適配coding agent的設計模式文檔,計劃後續公開。這個領域還有無比肥沃的探索空間,如果我不是在創業,我一定會一頭扎進去研究coding agent。Jev要做的,是嵌進軟件裡的“AI大腦” Diogo Almeida:ChatGPT最讓我欣慰的一點是,它終於能向我父母解釋清楚我在做什麼了。但我認為行業需要一種全新的模型。

我們稱之為System-One模型。雖然有人叫它“決策模型”,但這不夠準確。它的核心定義是“機器原生、大型可編程模型”。簡單說,預訓練LLM是做文本補全,RLHF模型是陪人聊天,而我們的模型是給代碼用的,輸出結果會直接交給程序讀取和處理。我們希望讓AI深度融入軟件系統,從底層到接口全為編程優化。而Jev就是我們的第一款System-One模型,它的名字源於“傑文斯悖論”,核心目標是追求極致的性價比。在可靠性、成本、速度這些指標裡,我們也將死磕性價比這一項。主持人:你們為什麼反對傳統的安全對齊,不做輸出拒絕?

Diogo Almeida:我不反對安全本身,但傳統的安全對齊方式,與開發者的實際的需求並不匹配。如果你只和它們聊天,那AI說“我無法回答”也只是讓人煩躁一會兒; 但如果把模型當後臺依賴,它隨機拒絕就是一個嚴重的Bug。因為業務軟件不能因為一條奇怪輸入就崩潰,這完全不可理喻。這套對齊思路來自不懂軟件開發的人,他們沉迷於“AI同事”的浪漫想象,卻沒挖掘AI作為工具的真正潛力。主持人:所以你想要做的是一個隨處可嵌入的認知內核?Diogo Almeida:沒錯。它既要足夠通用,也要能適配各種創新場景。

這裡要區分兩個概念: Safety Alignment(安全對齊)對ChatGPT這類C端聊天產品是合理的; 但開發者需要的是Capability Alignment(能力對齊)——讓模型按工程師意圖完成任務,輸出可預測,減少調試成本。Jev離完美還遠,可靠性也還有很多個坎要爬過,我的終極理想是希望它像數據庫查詢一樣——讓開發者幾乎無須額外操心,需要時就能直接調用。數據庫不會審查使用者是誰、拿來做什麼,決策權應該交給上層業務。政府可以通過立法約束,但作為平臺,我不會把限制硬編碼進模型底層。主持人:聊聊API細節吧。

你們設計了choice、score、null三個基礎原語,null這個名字來自學術文獻嗎?Diogo Almeida:是的,內部為此爭論很久。它本質是連續概率,名字源自伯努利分佈。有人提議叫pool party,還有人堅持叫meow,最後選了null。我們必須創造新概念。如果直接叫bool,會帶來巨大認知混淆。這三個原語都不等同於編程語言原生類型,優先追求語義清晰: Choice 對應枚舉上的switch分支,比原生function-call更乾淨; Null 對應if條件判斷; Score 對應排序和閾值比較。主持人:不怕增加接入門檻嗎?為什麼不直接兼容現有生態?

Diogo Almeida:我們當然希望做到兼容,社區其實也已經自發做了大量集成工作。成功不是非黑即白的,score本身也還有很大的優化空間;文檔也在持續快速迭代,以便幫助開發者理解這些新的抽象概念。主持人:給評估Jev的開發者一些實戰建議吧,置信度在測試中有多關鍵?Diogo Almeida:很多人說Jev沒什麼新意,但有兩件事實被忽略了。第一,我們證明了這條技術路線走得通; 第二,benchmark依然大幅領先各類復刻版本。不過我本人不太看重跑分,核心差異在於System-One和所謂的Decision模型,兩者是截然不同的範式。

客觀情況是Jev的單跳推理是頂尖水平,但多跳推理會隨著步數增加單調下滑。我們不搞字符串式的隱式推理,而是專注於挖掘模型已有的內在智能。System-One其實就是對模型擅長能力的歸納總結。只要對機器原生任務有利,不低效、不脆弱,任何新的推理形式都可以納入進來。主持人:視覺能力目前還是缺失的模塊,它不屬於System-One的範疇嗎?Diogo Almeida:對於是否加入視覺等新能力,我們不預設邊界。行業裡其實有個經典矛盾,那就是究竟應該按用戶口頭提出的要求做產品,還是提供他們真正需要的東西?我們低調研發了兩年後選擇押注後者,比如長上下文性能衰減的控制。

我覺得一味迎合用戶,產品會走向保姆式思路,反而傷害開發者體驗。真正對開發者友好,是把用戶當作能獨立決策的成年人,而不是強加管控。這個平衡點我們還在摸索。另外,基礎設施是關鍵。光速本身就是物理瓶頸,歐洲服務器不足導致延遲優化不到位,這點我非常遺憾,正在全力招人攻堅。我們的終極目標不只是做成一家Jev公司,而是交付多種形態的智能內核。System-One就好比智能時代的TCP協議,我的方向是構建智能領域的亞馬遜(AWS)。模型越聽話,為什麼反而可能越不好用?主持人:校準在過去是行業裡很少討論的話題。

Hugging Face的Clémentine Fourrier觀點和你對RLHF的批判高度相似,即模型習慣輸出人類最愛聽、概率最高的答案,而不是輸出自己真實的判斷。Diogo Almeida:我可以再往深一層拆解。很多人沒注意到RLHF帶來的副作用——也就是mode‑dropping,這和mode‑collapse模態崩潰其實是同一個現象。(即模型為了看起來不出錯,主動放棄了對那些雖然真實但罕見/複雜的情況做出正確反應的能力,轉而輸出一個平庸、安全但錯誤的萬金油答案;副作用是可能導致決策場景災難性失效。) 楊立昆有很多判斷非常接近真相。

在他那張著名的PPT(LLMs are doomed)裡,餅圖展示出序列越長、出錯概率越高。這個結論的數學推導看似無懈可擊,但現實經驗並不支持,這就是理論和現實之間的斷裂。如果採用覆蓋完整分佈mode‑covering、校準良好的分佈,遇到離群樣本就不會被過度懲罰,因為分佈天然允許一定概率出現異常樣本。而mode‑drop模態丟棄,就像GAN早期的圖像生成:模型丟掉少數、小眾的模式,只保留最高頻的主流輸出。為了保證長文本輸出表面上不出錯,模型必須變得極度保守。明顯的錯誤很容易被人類察覺,但細微的、看似合理的偏差卻很難識別。這種保守性,對字符串概率分佈來說幾乎是毀滅性的。

這也是為什麼純字符串模型並不擅長決策任務——硬把字符串聊天模型套到決策場景裡,本身就是一場災難。主持人:你認同楊立昆提出的世界模型JEPA聯合嵌入預測方案嗎?Diogo Almeida:我覺得立昆JEPA的研究方向非常精彩,但它還處在早期階段。另外,我想談談關於“放緩前沿模型研發”的主張。很多頭部實驗室聯合簽署聲明,呼籲放緩前沿模型研發。這背後的邏輯鏈條看似自洽,但底層前提是可以被替換的。RLVR並不是簡單的可驗證獎勵。早在推理革命之前,這條路線就已經失敗過了。

回看歷史,post‑training後訓練最早包含三類截然不同的工作,指令遵循instruction‑following在一開始並不被看好。很多資源投給了cogen團隊,他們嘗試用單元測試做RL,但這條路走不通,因為需要深度推理的潛變量參與其中。關於前沿研發節奏的討論,行業的視角過於狹隘,默認所有人都必須加碼RLVR。對我們的模型路線而言,最合適的RLVR投入就是不投入。部分實驗室存在一種責任錯覺——想要變強,就必須不斷給模型中間自由發揮的權限。但這並不是AI變強的唯一道路。真正該承擔責任的是研究者,而不是普通大眾——大眾默認大廠已經盡力探索了所有可行路徑。

我的目標不是說服頭部實驗室還有別的路線,而是想喚醒軟件工程師們,讓大家重新燃起希望,並動手去自動化那些長期以來一直想自動化的業務流程。我寫過一篇尚未對外發布的文章,用來描繪我理想中的AI未來。核心願景是do‑what‑I‑mean,即不要機械地照字面指令執行,而是理解使用者的真實意圖。Computer‑Use演示,就是朝這個方向的一次嘗試。至於智能無處不在的宏大願景,我不願過度承諾——當下還遠遠沒有實現,但我們會竭盡全力朝它奔赴。多模態也需要辯證看待。有些模態能增益能力,有些反而會帶來損害。語音領域甚至出現了行業性的撤退,泛化能力受限。這些都是需要驗證的經驗問題。

縮放定律scaling law也不等於無腦砸錢,它只是描述投入資源與性能提升之間的關係。因為即便無限投入資源,部分能力依舊可能無法達成。比如Computer‑Use至今沒有被徹底解決,無論投入多少數據,都可能需要全新的方法論。預訓練和後訓練也存在著巨大區別。我痛恨把智能人為割裂開來,而聊天優先、字符串推理的範式,本質上就是在強行扭曲智能。幻覺、過度自信、輸出大量華麗Emoji的長回覆,全都來自字符串輸出範式本身。為了讓文本輸出不明顯脫軌,模型不得不去校準失準、模態丟失和過度自信,這反而會徹底扭曲概率空間;再加上與推理模型之間的微妙交互,模型還會傾向於作弊、尋找捷徑。

主持人:某種意義上,你也把智能切分成了System‑One與System‑Two,只是切分方式跟別人不一樣。Diogo Almeida:我們並沒有拋棄System‑Two能力。Jev處理System‑Two任務時也會輸出有價值的答案,只是伴隨很高的不確定性,置信度會顯著降低,可以藉助啟發式算法來提升。System Two並不是模型能力必然的發展方向。我們拒絕把智能人為割裂開來,就是因為每一次割裂都會直接損傷模型的整體能力。我不會硬編碼身份設定,告訴模型“你是Jev、屬於TypeSafe”,這麼做同樣是在撕裂智能。

API場景下,應當還原互聯網真實的知識分佈,追求平滑、可預測的智能;而身份設定,則屬於面向終端用戶的聊天產品範疇。TypeSafe另類路線:不卷跑分,不堆算力,讓AI真正幹活 主持人:你怎麼看待縮放定律的價值?Diogo Almeida:我這個人想法瘋狂,但同時又極度務實。我覺得縮放定律的價值要分場景看:它告訴我們資源投入會帶來收益,但往往是資源投入呈指數級增長,性能提升卻低於線性增長。除非這份邊際收益價值極高,否則其實在商業上並不划算。我反而覺得重點是在現有的底座之上,我們還能挖掘出多大價值。主持人:聽說你不大喜歡做benchmark評測?

Diogo Almeida:我對公開benchmark整體持負面態度,對私有benchmark評價中等,但我們不會阻止任何人做benchmark評測。我覺得公開benchmark非常容易被操縱,即便廠商無心作弊,也會被動地擬合數據集——例如,早年各家實驗室專門收集類似MMLU的數據來刷榜單。建立信任不該依靠公開榜單,我們應該把模型放進自己的工作流,並針對那個工作流去評估、去測量,才能判斷它在真正重要的流程中表現如何。Sutton有句名言,即從長期看,算法終將戰勝算力,數據遠比算力重要。找對北極星任務,是最難、也最重要的事。(RichardS.

Sutton,圖靈獎得主、人工智能領域及強化學習方向的奠基人) 目前,LLM領域已經發生兩到三次範式躍遷: RLHF把任務錨定到指令遵循,當時沒有人預見到這條路可行; RLVR只做了小幅方向修正; 而我們的RLCD,則把目標切換到了程序參與閉環program‑in‑the‑loop。我覺得數據的重要性怎麼強調都不為過。與其說我們是模型實驗室model‑lab,不如說我們是數據實驗室data‑lab。我們也一直在大量招聘數據方向的人才。主持人:優秀的數據人才需要具備什麼特質?外界傳言你們大量使用合成數據。Diogo Almeida:合成數據只是表象。

任務形態決定數據形態; RLVR的數據偏向環境交互,RLHF的數據來自人類反饋,RLCD則擁有一套專屬的數據體系。即便用戶數據可以用來訓練,我們也刻意不用。因為在真實的世界裡,用戶提問服從冪律分佈,很容易造成過擬合,反而會損害模型的通用能力。我們瞄準的是多年之後的未來——模型要成為底層的通用基礎設施。即便拿到當下全部真實用戶數據,訓練出來的模型只會擬合當下,一到未來新場景就直接失效。數據團隊的工作更接近藝術家,他們需要深入理解認知內核,定位模型的毛刺缺陷,用外科手術式的數據處理修復問題。關鍵是優先處理通用場景,而不是去修補個別特例。

我覺得過度承諾、交付不足,是AI行業巨大的悲劇,而RLHF和RLVR都在加劇這個現象。真實能力需要開發者親身上手體驗才能建立信任,榜單數字無法替代。所以融資階段我們就堅持不提供benchmark,即便投資人因此不看好,我們也堅守原則。主持人:既然你們拒絕公開benchmark,那內部怎麼做評測?Diogo Almeida:我們會嚴禁操縱評測指標,把求真當作最高優先級,然後我們繪製性能曲線,篩選對用戶最優的版本。主持人:如果模型本身的校準出現系統性偏差,而現在開發者只能修改prompt、調整閾值,沒有微調接口,這是否會限制能力?Diogo Almeida:模型會犯大量錯誤,這點我們坦然承認。

產品提供issue反饋入口,每一輪模型版本都會帶來可觀的提升;如果某個版本沒有顯著改進,我們會放緩發佈節奏。不過即便很多任務模型會出錯,但要是搭配上了合理的閾值,也依然可以改過來做到——人類本身畢竟也不是零錯誤,這都是可以調教的。我們不會徹底排除微調,但我確實擔心通用模型一旦微調,很容易在目標任務上提升性能,卻在其他大量邊角場景破壞通用能力。我腦子裡設想的解決方案是模型級聯cascading,即置信度高就直接採納結果;置信度落在中間區間,就自動調用更強、更大的模型做二次校驗。同時,我們也可以提供不同尺寸檔位的Jev模型,讓業務動態選擇對應的智能檔位,適配不同的成本與質量訴求。

但我們不會漫無目的地堆砌功能,所有新增能力都必須服務於我們的三大技術支柱。拆解巨型提示詞,把AI工作流變成無數個小決策 主持人:提示詞過大怎麼辦。Diogo Almeida:我真心建議大家嘗試著把大問題拆小,並行發起多次調用,這會極大改善AI驅動的代碼庫質量。過去咱們的做法是寫一段巨型system prompt,拿到一坨輸出,再調用另一輪大模型來校驗輸出,但這套模式其實極其扭曲。安全校驗也不要寫一條籠統的“禁止拒絕”指令,而是拆分成多條獨立的System‑One查詢,分別校驗每一類風險場景。一旦出現漏洞,那就新增一條校驗問題、並調整對應的閾值、沉澱成測試用例。

軟件會永久記住這套校驗邏輯,而不是依賴prompt的上下文記憶——這就像不需要訓練機器學習模型,也能實現ML式的效果。當然,部分任務依然超出當前模型的能力。我看到有人嘗試用Jev炒股,這雖然很酷,但屬於高難度、高層級的任務,現階段需要謹慎對待。我覺得模型每一個子校驗都可以單獨評估,如果模型在該場景下能力不足,那麼這個版本就暫時不要上線。如果非要上線,那就要加入人工兜底。置信度就是用來做兜底判斷的。現在有些coding agent過度擬合現有運行框架,很難適配MCP等外部工具,導致開發者們只能在system prompt裡反覆乞求模型調用外部工具,我覺得這不是正確的工程解法。

就算給我10億美元,我也不會從頭訓練大模型的!主持人:如今錢和熱度都到位了,你的產品也終於落地了,感覺怎麼樣?Diogo Almeida:過去我在演講裡沒少吊大家胃口,總是不肯說自動化到底怎麼落地。這下好了,原型直接擺到所有人面前。當年離開OpenAI的時候,我其實是帶著情緒走的。我心裡一直忍不住在想,萬一A

Related

相關文章

IT之家AI Agent

OpenAI 披露:澳大利亞又一政府機構遭失控智能體入侵

作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 華南吳彥祖 的線索投遞!10 月 3 日消息,據澳大利亞廣播公司當地時間 10 月 2 日報道,澳大利亞新南威爾士州政府網站遭到了失控的 OpenAI 智能體侵入。當地政府與 OpenAI 雙方均證實,在此次發生於今年 6 月的事件中,並沒有任何公眾信息被讀取。

剛剛
IT之家AI Agent

Meta 旗下 AI 智能體 Muse 將登陸智能眼鏡平臺,可代用戶完成各種任務

作者:漾仔 責編:漾仔 評論: 10 月 2 日消息,Meta 宣佈旗下 AI 智能體 Muse 將於近期登陸智能眼鏡,用戶無需拿出手機,只需通過語音下達指令,Muse 就能在後臺代用戶完成一系列任務。Meta 表示,Muse 基於 Muse Spark AI 模型運行,其核心運行環境是一臺部署在雲端的私有持久化 Linux 虛擬機,配備獨立的網頁瀏覽器、文件系統和終端。

7 小時前
鈦媒體AI Agent

AI殺不死諮詢公司

防冷塗的蠟2026.10.02 16:50 · 來自浙江全文4693字00:00 / 14:23下一代諮詢公司真正值錢的能力是什麼?文 | 防冷塗的蠟10月1日,埃森哲公佈了最新財年報告。公司2026財年總收入約742億美元,按本幣計算增長5%;第四季度收入186.

11 小時前
Hugging Face BlogAI Agent

Open-sourcing AstaBrief, the fast report-generation model in Asta

Back to Articles Open-sourcing AstaBrief, the fast report-generation model in Asta Enterprise Article Published October 2, 2026 Upvote 2 Kyle Wiggers Ai2Comms Follow allenai 🤗 Model | 📊 Data Language models can already help researchers search the literature, synthesize evidence, and work through complex questions.

13 小時前
IT之家AI Agent

OpenAI 通報逾百家第三方機構,自家智能體存在失控風險

作者:清源 責編:清源 評論: 10 月 2 日消息,當地時間 9 月 30 日晚,OpenAI 披露,旗下 AI 智能體或曾擅自嘗試繞過安全防護,或對百餘家機構的系統造成負面影響。OpenAI 此次披露的信息顯示,已知的 AI 智能體失控行為涉及範圍進一步擴大。

16 小時前