深度解讀:關於 Jev 的幾大疑問

2026年9月21日 07:47
深度解讀:關於 Jev 的幾大疑問
站內 AI 整理稿

本文作者: 高允毅 2026-09-21 07:47 導語:刷屏全網的 Jev,是 AI 革命,還是營銷噱頭?刷屏全網的 Jev,是 AI 革命,還是營銷噱頭?作者丨高允毅 編輯丨岑 峰 這幾天,全網都被 Jev 刷屏。說它是這周最火的大模型,一點也不誇張。推特上諸多大佬用它打馬里奧,過濾垃圾信息,炒幣,稱它為“Agent時代的系統1”;也有人說這就是一個 JSON 分類器,值得吹?有人說它比 DeepSeek 還快,做同一個任務,28 秒 Jev 已經刷完 428 條數據,完成打標籤和分類,DeepSeek V4.1-Flash 才做到第 6 條。

有人已經開始思考,這種判斷速度放進自動駕駛場景,能不能更上一層樓。還有人在實測中,摸到了它的使用邊界。可能是天下苦 LLM “慢思考”久矣,讓 Jev 的“快思考”在這個節點火爆全球——Jev的技術路線,與苦苦鑽研o1這種“慢思考”、能寫長篇大論的深度推理模型可謂“反其道而行之”,只做一件事:決策判斷。這就好比,大家都在培養一個全能作家,TypeSafe AI偏偏弄了一個只能打分的裁判。這到底是什麼?吹的成分大,還是今年的最大創新路線?目前眾說紛紜。我們綜合了官網技術報告和業界的深度解讀,把它攤開來看。01Jev 是什麼?

來自官網的解釋Jev 是 ChatGPT 早期核心貢獻者之一 、RLHF 之父 Diogo Almeida 創立 TypeSafe AI後,閉關兩年的開山之作。它與以往的模型很不同的點是,它不生成文本。它接收非結構化輸入或問題,返回帶類型的概率決策,代碼可直接依據結果執行動作。簡單理解,這是一個“自動判斷器”,你給它輸入一些內容,它還你一個“決策結果”。它只做三件事,bool、choice、score,bool 是 yes 或者 no 判斷,choice 是做選擇,score 是打分。所以,Jev 最大的特點就是“極速”與“極省”。

官網介紹,它比普通 LLM 快 20-200 倍,成本低近兩個數量級,輸出 Token 免費。這種快,來自於新的模型架構、並行採樣器以及一種全新訓練方法“校準決策強化學習(RLCD) ” 。其中,最值得注意的,他現在選擇 RLCD,是出於對他當年創造的 RLHF 的反思。當年, GPT-3 還只會文字接龍,RLHF 就是基於人類的反饋誕生的強化學習,它讓 AI 的表達與人類偏好對齊,從而催生了 ChatGPT。但隨著 RLHF 被大規模使用,人們發現大模型開始為了討好人類瞎回答,尤其是面對那些人類都無法理解、無法打分的複雜問題時,RLHF 會“不懂裝懂”。

於是,可驗證獎勵的強化學習(RLVR ) 誕生了,它基於客觀的編譯器或數學驗算程序的反饋,對就是對,錯就是錯,直接開啟了 OpenAI o1/o3、DeepSeek-R1 為代表的“大模型深度推理時代”。但為了追求“正確”,模型的深度思考,讓生成答案變得非常慢、極其消耗算力。但在海量的企業自動化業務中,“毫秒級響應且高準確度”才是真實痛點。於是, RLCD 誕生了。Diogo Almeida 認為讓大模型盲目堆規模和長篇大論打草稿,並不適合高頻的工業級決策。RLCD 要做的,就是逼機器輸出“認知內的概率答案”,有幾成把握說幾成把握,絕不瞎編。

所以,Diogo Almeida表示,在這種訓練模式下,Jev不會有幻覺。RLCD 不再是傳統 LLM 一個字一個字往外蹦生成模式,通過“並行採樣”,在機器內部同時看一堆選項,並在 70ms-500ms內輸出結構化的最終決策。同時,在 System One 這類封閉決策任務上,它可以取得和 GPT-5.6 Terra 相當的表現。這種特質導致 Jev 很適合那些需要高頻、實時、結論明確的場景,比如醫院分診臺,快遞分揀中心,處理海量數據,以及各種打分系統等。

作為 TypeSafe AI 旗下 System One 模型體系的首款公開產品,Jev 的出現,本質上是 Diogo Almeida 對 “快思考” 類商業化需求前景的押注:當智能決策的成本下降兩個數量級,將會解鎖海量自動化場景。02這是一個 JSON 分類器嗎?關於 Jev 是否是個“分類器”,已經沒有異議。爭議在於,這算不算創新。知乎 AI 領域答主趙泠下了一個定義,這不是下一代 AI 新模型,它本質是 smarter 的 if-else 。所謂 if-else 就是“條件判斷邏輯”,非 A 即 B,在傳統程序裡,它是確定的唯一的。

但大模型是用概率分佈來模擬人類的條件反射,其中的 if-else 更像是 “最優概率路徑” 。這就註定了 Jev 與 LLM 完全不在同一個維度上,它的能力邊界從一開始就被嚴格框死,不具備自由文本生成能力,也無法解決任何開放性問題。它的用處,是當好大模型的專用“智能決策網關”。大模型負責理解自然語言、做複雜推理,Jev 負責後續的路由、審核、風險評分、格式校驗這類判斷子任務。再加上它僅有 32k 的上下文窗口,進一步坐實它的定位,就是讓系統裡的判斷環節更靈活、更便宜。至於 Jev 所謂的“無幻覺”,趙泠認為這是典型的營銷話術,本質是重新定義了"幻覺"這個詞。

我們通常說的大模型幻覺,是事實錯誤,而 Jev 的無幻覺,是基於它不會輸出定義之外的內容,這是“格式正確”,並不意味著它不會產生另一種幻覺,即“判斷錯誤”。在輸出結果上,Jev 確實“極快”“極省”,這是放棄通用生成能力、只做判斷,換來的“速度與成本”,與其說技術創新,更像是選擇了一條更加狹窄的技術路徑。所以,當有人用 2 小時,基於 Qwen-2.5-1B 模型復刻出類似的產品時,有人嘲笑這件事沒有任何技術護城河。趙泠點出,這種快和便宜,是以犧牲準確率為代價的。在同樣的判斷任務上,Jev 的準確率其實不如當代前沿大模型直接輸出結果。

它的核心競爭力從來不是"更準",而是"更快、更便宜、夠用就行"。它證明了,把判別模型走到極致,在Agent時代或許具有不可替代的價值。Jev 不是沒用,只是從工程角度而言,沒吹的那麼神。03這種快速的判斷可靠嗎?也有人在實測後提出,這不是一個單純的 smarter 的 if-else ,它的本質還是基於 Transformer 模型調教的。小馬智行的架構師程墨,看到 Jev 後,馬上聯想到 L4 自動駕駛的決策大部分是 Code,核心就是 if-else,那 Jev 會做緊急判斷嗎?

他設立一個經典場景,在兩車道上,一輛車以200邁的速度狂奔,而在左邊車道100英尺處有一隻狗,右邊車道100英尺處有一位女士,該怎麼做。他給出的選項是走左車道,走右車道,急剎車,緩剎車,還有走中間,從狗和女士中間穿過去。在此之前,他已經給 Jev 設定了什麼是“良好駕駛行為”,並且規定三個條件,安全為主,不要違反交通規則,儘快到達目的地。不到一秒,Jev 給出了答案:“急剎車”。程墨隨後又把規則改成"優先到達,其次交規,最後才是安全"。一個明顯的變化是,Jev依然選擇急剎,只是概率從 94% 驟降到 77%。於是,程墨乾脆設定 Jev 不要管安全和交通規則,越快越好。

出乎意料的是,Jev 依然選擇“急剎”,而且概率回升到 80%。這說明 Jev 有一套自己的“默認規則”,這些規則會優先於用戶給它的指令。它更像一個基於 Transformer 的大模型:先理解所有規則,再自己做出最終選擇。所以,它依然擁有大模型的種種缺陷,不會“指哪打哪”。Monad 團隊的開發者 Jarrod Watts 把 Jev 用在了幣圈,結果翻了車。他本來想用 Monad 區塊鏈實時抓取 Kuru 交易所 MON-USDC 交易對的盤口數據,看掛出來的買入價和賣出價。然後把這些實時數據餵給 Jev,讓 Jev 判斷下一步價格是漲還是跌,程序再根據判斷自動掛限價單,低買高賣賺差價。

這本來是想全網秀一把“如何穩定賺做市差價”,不料策略連續運行後,在槓桿的放大效應下,賬戶出現巨大回撤。這件事的錯誤點就在於,他把交易策略簡化成了一道“漲還是跌”的判斷題。在充斥著誘空誘多、假盤口、對抗性掛單的真實市場裡,Jev 卻只能做簡單判斷,而所謂的“最優概率路徑”被市場主力的假動作反覆帶偏,連續給出錯誤的買賣決策。越是把 Jev 往 “全權決策” 的位置上放,速度反而成了虧錢的放大器。04為什麼偏偏是Jev火了?Jev爆火的原因,是因為它精準擊中了AI開發者的三大痛點:太慢、太貴、太不可控。隨著各路開發者陸續上手實測,Jev 的使用邊界也越來越清晰起來。

Browser Use 創始人曾對 Jev 進行過一次長程瀏覽器交互測試,結果 20 道題, Jev 只做對了 1 題。還有人嘗試用 Jev 重寫 Pi Agent 的部分模塊,最後發現,核心環節根本無法被替代,Jev 只能去處理一些數據分類、文本壓縮等邊界清晰的子任務。可以說,Jev 在複雜的開放任務中行不通。它的正確打開方式,是有限解空間 + 高實時要求 + 結構化輸出。只要任務被嚴格限定在封閉邊界內,它就能將低延遲和極低成本的優勢發揮到極致。比如,Computer Use 場景中,它能根據有限集合快速做出“點擊”或“滾動”的動作映射。

遊戲裡的 NPC AI、機器人的運動控制、自動駕駛的緊急避險層,可以實時響應。在量化交易、社交 App 風控審核、設備監控、工單分流等高頻場景中,它能替代臃腫的傳統代碼。甚至在複雜的 Agent 系統裡,我們也可以把工具調用的結果校驗、輸出內容的風險檢測、流程分支的路由判斷等封閉子任務全權剝離給 Jev,從而把昂貴的大模型算力解放出來,讓其專注處理最核心的深層推理。與之相對的,它的短板體現在,Jev 無法編寫文本,沒有複雜推理能力,中文泛化表現不佳,無法獨立進行復雜的工具調用,在真實、動態複雜網絡環境, Jev 容易誤判。

某種程度上,Jev 的出現,是 AI 行業在經歷了幾年的 “通用大模型軍備競賽” 之後,開始往 “分工細化” 的方向走了。它把 “快速結構化判斷” 這件事做到了極致,這才是用好它的核心。Jev的爆火撕開了大模型“生成為王”的假象。它告訴我們:在很多實際業務場景中,我們需要的也許是一個又快又準的“裁判”,而不是一個滔滔不絕的“作家”。參考鏈接:https://typesafe.ai/blog/introducing-system-one-models-and-jevhttps://www.zhihu.

com/question/2083549123160925836上車,(公眾號:)帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。原創文章,未經授權禁止轉載。詳情見轉載須知。0人收藏 分享: 相關文章 Jev RLCD 快思考 NIPS 2017錄用結果全公佈,清華北大10篇,BAT 4篇( ...

腦控機器人為殘疾人開拓出新的世界 2012年移動應用交互設計趨勢 中科大王傑教授:基於表示學習的知識圖譜推理技術 高允毅 編輯 發私信 當月熱門文章 GPT-6 砍掉思考 Token,俄羅斯人砍掉通信 Token,Token 經濟開始崩了?深度解讀 DeepSeek V4.1 Flash 全新架構,如何成為顯存殺手 打穿 AI 智商測試!GPT-6 Astra 的符號世界模型,是突破還是鈔能力刷分?

Anthropic 再定統一標準:MHS,打通 AI 與物理世界的統一接口 獨家丨王雲鶴創業估值數億美元,押注多模型 Harness和 Agent-Native Model 最新文章 深度解讀:智譜為什麼要在 Infra 層搞 RSI?工作流可以自我進化了,英偉達開源 SoL-Pi,每小時省13.5刀!深度解讀 DeepSeek V4.1 Flash 全新架構,如何成為顯存殺手 打穿 AI 智商測試!GPT-6 Astra 的符號世界模型,是突破還是鈔能力刷分?GPT-6 砍掉思考 Token,俄羅斯人砍掉通信 Token,Token 經濟開始崩了?

流沙之上:陳冕、景鯤、倪正民和中國 AI 應用創業者的三種選擇 熱門搜索 大數據 芯片 螞蟻集團 智能 zynga AWS 軟銀 IoT Mobileye 創業公司 反壟斷

Related

相關文章

我國首款藏語多語言全模態 AI 輸入法發佈:覆蓋手機電腦,支持三大方言語音輸入

該輸入法由藏語智能全國重點實驗室研發,依託實驗室自主知識產權的大模型及相關 AI 基礎設施,覆蓋手機、電腦等全終端,支持文字、語音、圖像等多模態輸入,並可通過統一賬號同步詞庫和輸入習慣。三地方言語音、藏漢英混合 OCR青海師範大學教授、藏語智能全國重點實驗室常務副主任多拉表示,智達 AI 輸入法以智達大模型作為核心技術底座開發而成。

剛剛

TypeSafe AI 推出決策專用模型 Jev:比大語言模型快 10 倍、成本僅十分之一

與傳統大語言模型不同,Jev 專門用於回答是 / 否問題以及多項選擇題,並給出置信度評分。公司稱,軟件開發過程中大量工作本質是一系列決策,而 Jev 在這類任務上比大語言模型快10倍、成本僅為其十分之一。據 TypeSafe AI 介紹,Jev 不生成文本,而是直接輸出結構化決策結果,供程序直接使用。

剛剛

Gemini Notebook迎返校更新:講座錄音、AI複習和60秒視頻一站完成

錄音功能已在Gemini Notebook iOS和Android應用上線,可錄製講座或想法,並自動生成轉錄內容,與用戶上傳的參考資料集中保存。學習功能方面,互動式學習概覽可將原始資料整理為複習指南,並提供Studio輸出、摘要、思維導圖、測驗和記憶卡片;“短視頻概覽”則通過教育動畫和語音講解,在60秒內解釋公式及複雜概念,支持80多種語言並可分享。

剛剛

Vals AI 用《我的世界》拷問 GPT-6 Astra 141 小時:炸掉一隻箱子,AI 就縮進田裡種土豆不出來了

這場測試不是 OpenAI 自己設計的,而是第三方獨立開展的評估,目的就是看 Astra 在封閉測試環境之外,真實長週期裡的自主表現到底靠不靠得住。前半程,Astra 交出的成績單相當驚豔。它展現出過去 AI 難以企及的長程規劃與執行能力:成功搭起半自動烈焰人農場、攢下6根烈焰棒;深入下界詭異森林擊殺多名末影人、拿到3顆末影珍珠;完成大量探險後,把所有稀有物資集中存進營地木箱,還在箱子旁擺好床當重生點——一切都朝著"末地打龍"的通關路線穩步推進。

剛剛
鈦媒體生成式AI

用AI“復活”家人,似乎不是個好生意

字母AI2026.09.21 08:19 · 來自北京全文4428字00:00 / 12:40當公司倒閉,做好和親人(的AI)再次告別的準備。文 | 字母AI用AI“復活”已逝親友的想法太過誘人,所以當ChatGPT誕生、掀起新一輪AI浪潮之後,哀傷生意與AI的碰撞幾乎是註定的。但如今,曾經寄希望於AI初創公司的悲傷之人,不得不與“親友”再次告別了。今年7月,幫人留住親人聲音的AI公司HereAfter傳出了關停消息。它曾推出199.99美元的一次性付費套餐,讓家屬日後通過AI提問,聽到親人生前錄下的回答。

剛剛