不寫字的 AI 憑什麼刷屏? Jev,把「判斷」做成了軟件零件

硅谷Tech news2026.09.25 09:41 · 來自北京全文5390字00:00 / 15:23它不會聊天、不寫文章,卻在發佈一週內讓硅谷排隊接入。AI 圈這幾天最受關注的名字,是一個不會聊天的模型,Jev。它不寫文章、不寫代碼,也不陪用戶聊天。有人問它「這封郵件緊急嗎」,它不會先寫三段分析再下結論,而是直接回答「緊急,概率 95%」。發佈才一週,創始人發佈的官宣帖在 X 上的瀏覽量衝上數千萬;主流 AI 模型網關 Vercel,上線 24 小時內就有近 13% 的付費團隊接入。
有人拿它打《毀滅戰士》,移動、瞄準、繞障一氣呵成,流暢得不像機器;有人讓它和 GPT-6 Astra 在《我的世界》裡用 8 分 43 秒打贏末影龍,總花銷不到 1 美元,其中 Jev 只佔 0.01 美元;還有開發者實測 6 個代碼 PR 後推算,審 1000 個只需 7 美分,而同等工作交給 Claude Opus 5 要 14.5 美元。一個不會聊天的模型,為什麼能引來整個技術圈集體關注?熱度從哪裡來先交代出身。Jev 來自美國創業公司 TypeSafe AI。
創始人 Diogo Almeida 是 OpenAI 老將,也是 InstructGPT 和 RLHF(基於人類反饋的強化學習)論文的共同作者,這兩項工作正是 ChatGPT 技術路線的重要前身。2024 年他離開 OpenAI,帶隊隱身研發兩年,直到 2026 年 9 月 15 日才正式亮相。資本早已押注,DCVC 領投了 4000 萬美元種子輪。Jev 這個名字本身也經過設計,取自 19 世紀英國經濟學家威廉·傑文斯。傑文斯用「傑文斯悖論」說明一個道理:效率提升,有時反而會帶來更大的總體消耗。一家 AI 公司拿一位經濟學家當名字,隱隱指向它對「效率」的執念,這正是 Jev 的立身之本。
發佈當天,它在 Hacker News 衝到 1800 多分、近 500 條評論;OpenRouter、Cloudflare、LangChain 等主流平臺先後接入;幾天之內,社區還出現了開源仿製版。發佈 36 小時,TypeSafe 收到的內測申請就涉及約 14 萬名開發者;9 月 21 日 Jev 向所有人開放,每位新用戶直接送 5 美元額度,約合 1.2 億 token。按官方口徑,一次判斷通常只燒幾百個 token,省著點夠個人嚐鮮幾十萬次。換句話說,它幾乎把「決策」這件過去很貴的事,做到了接近免費,熱度的含金量也在這裡。為什麼一個不會說話的模型能引爆這樣的熱度?
因為過去兩年,大家可能讓 AI 幹了太多它不擅長的事。看看社區都拿它幹了什麼。有人把它接進 Claude Code 做上下文清理,讓長對話不再越聊越笨;也有人因此翻車,用不做推理的分類模型去刪改 Agent 歷史,模型忘掉了試過的操作、陷入循環。還有人拿它實時判斷跑酷遊戲裡下一個平臺落點、給 Agent 驗收任務、在 40 秒內拆完 724 條實時廣告。這些用法有個共同點,都不是要它「說」,而是要它「判」。過去一年,Agent 概念正當紅,可真正落地時大家才發現:一個 Agent 跑起來,要做的不是「想」,而是無數次「判斷」,調哪個工具、留哪些上下文、這次操作有沒有風險、結果要不要人工複查。
這些高頻判斷題交給動不動就「深度思考」的大模型,既慢又貴。Jev 的走紅正踩在這個節點上,在最需要的時候遞上一把順手又便宜的刀。Jev 是什麼:把「判斷」做成零件做 AI 產品的人都熟悉一個困境:系統裡每天有海量瑣碎判斷,這封郵件算不算投訴,這筆退款該不該自動批,這條評論要不要刪。最常見的做法,是每次都請一個大模型來回答。但大模型的核心工作方式是「生成」:用戶要一個「是或否」,它可能先寫三段分析再給結論,按字數收費,還要等上幾秒甚至幾十秒,回來的文字還得讓程序拆解、校驗,格式不對就重來。更麻煩的是,大模型說「我很確定」時,這句話本身不附帶刻度。「很確定」到底是七成還是九成?
剩下那部分不確定性落在哪個方向?無從得知。於是大量本該由機器自動完成的判斷,卡在一種兩難裡:用大模型太貴太慢,靠寫死的規則又不夠靈活。TypeSafe 把這類模型命名為「System One」,借用了諾貝爾經濟學獎得主卡尼曼《思考,快與慢》裡的框架:人腦有兩套系統,System 1 負責不費力的直覺快判斷,System 2 負責緩慢的深度推理。GPT、Claude 這些主流模型全是「System 2」路線,逐字推演、組織語言、生成答案,能力強,但慢、貴、輸出不可控。Jev 則是第一個公開的「System One」模型。
它放棄文本生成,專做決策:給它一段狀態,比如一份文檔、一條工單、一段聊天記錄,再附上幾個預設好類型的問題,它一次並行返回所有答案,每個答案都帶概率和置信度。這個概念並非空穴來風,卡尼曼的理論本身就給出了依據:人腦在做大量瑣碎決策時,靠的正是那個不費力的系統一;只有在真正複雜的問題上,才啟動緩慢的系統二。TypeSafe 想做的,就是給軟件也裝一個「系統一」,讓高頻、明確、低風險的判斷變得又快又便宜,把寶貴的「系統二」留給真正需要深度推理的任務。
人腦的快慢思考,如何變成 AI 的兩種路線工作流程大致五步:先描述決策需求,系統生成問題集供用戶挑選;再從歷史標註數據裡選樣本餵給它,優化判斷邏輯;最終對每個輸入返回「決策結果+置信概率」,用戶可以設閾值,低於閾值的轉人工或交回大模型。要提醒一句:Jev 本身無狀態,不記憶歷史;所謂「複用」要靠外部配置層,把高置信度的判斷模式沉澱下來反覆調用。輸出形式只有三種,全是「強類型」:Choice(從選項裡選一個)、Score(在刻度上打分)、Noul(判斷一件事成立與否,返回 0 到 1 的概率)。
它不可能輸出類型之外的東西,也就從結構上杜絕了生成式模型那種「幻覺」:它不會編造一篇不存在的文章,最多隻是選錯一個選項。Jev 只輸出三種「強類型」結果:Choice、Score、NoulJev 的工作流程:把「判斷」做成軟件可直接使用的零件快 20–200 倍、省 40–400 倍:一次分工的勝利按 TypeSafe 官方數據:端到端響應時間 70 到 500 毫秒,傳統大模型要 3 秒到 300 多秒,快 20 到 200 倍;每百萬輸入 token 只要 0.042 美元,輸出免費,成本低 40 到 400 倍。這一設計帶來的數字相當誇張。
但這兩個區間的上限,是廠商在自家工作流裡跑出的最樂觀值,獨立實測通常達不到那麼多倍。一次請求還能並行回答多個判斷問題,問題多了延遲也基本不變。同一個判斷,兩種響應速度這裡不妨打個比方。過去請 AI 做事,像請一位作家替人寫報告,他文采飛揚,可用戶要的只是一個「是或否」,他還得先洋洋灑灑寫八百字。Jev 則像請了一位裁判,什麼都不寫,只在擺好的選項裡果斷亮分。同樣是做判斷,前者的強項在表達,後者的強項在決策。而軟件後端九成以上的調用,需要的恰恰是後者。TypeSafe 反覆強調的一個詞是「校準」,訓練方法叫 RLCD(面向校準決策的強化學習)。
這裡要打個折扣:讓「模型說有 95% 把握的答案,在真實世界裡大約 95% 是對的」,是 RLCD 的設計目標,並不是已經拿到驗證的結論,官方目前還沒公佈可靠性圖或 ECE(期望校準誤差)數據。而且官方文檔自己說明,「把握」衡量的是各選項之間的相對偏好,不等於答案的絕對正確率。TypeSafe 自評的四項業務工作流裡,Jev 準確率 67.8%,最強的基線模型是 74.1%;OpenRouter 用 3080 條真實客服語料(Banking77)實測,Jev 是 81.0%,Claude Opus 5 是 84.4%。也就是說,它並不「更準」,只是把速度和成本壓了下來。
準確率恰恰是最需要冷靜看待的一項,這也是為什麼高置信度要設閾值轉人工,在把判斷交給它之前,最好先用自己的數據測一測。另外提醒中文讀者:Jev 對中文的支持目前弱於英文,官方文檔明確標註 CJK 語言「可用但準確率不等同英文」,中文場景建議先用自有材料測過再決定。這個服務目前在中國大陸還無法直接使用,官方並沒有公佈地區限制名單,主要是服務節點集中在美國西海岸、尚未覆蓋亞太,想用的中文開發者得先想想接入渠道。置信概率的意義:一條輸入,兩條路徑這引出 Jev 真正的用法:完全信任模型,要擔出錯風險;完全人工審核,又效率低下。
現在可以按業務容錯率設一個閾值:高置信度直接自動化執行,低置信度轉人工或升級到大模型,既提升自動化比例,又守住風險底線。用一位開發者的比喻:以前的 LLM 像是返回一個自由格式的字符串,得自己寫正則、解析、異常處理、重試;Jev 像是直接返回一個強類型對象,字段類型確定、值域確定,連置信度都算好了。至於「快而可靠」裡的「可靠」,實際測試要打個問號。有媒體拿 190 次財報任務實測:第一輪 45 次全對,是因為增長率事先算好餵給了它,那一串「滿格把握」說明不了什麼;一旦把正確選項從列表裡拿掉,Jev 會把八成以上的置信度押在與事實矛盾的描述上,毛利率題連錯 10 次時,報出的把握也都在八成以上。
它真正的賣點是便宜,而不是這份「把握」。當然,官方也坦承,並非所有任務都能獲得同等提升,這些數字是基於自有業務自動化工作流跑出來的。橫向看,Jev 單次請求能並行處理多個判斷問題,數量增加而延遲基本不變,這讓它特別適合嵌入現有軟件:代碼繼續控制業務流程,Jev 只負責其中一個範圍明確的判斷,像是給程序加了一個只管判斷的專職模塊。JEV 與傳統大語言模型(LLM)在響應速度與調用成本上的對比(對數刻度)哪裡該用,哪裡別碰Jev 擅長的高頻固定判斷,恰恰是 Agent 落地時最拖後腿的部分。在一個真正的 Agent 裡,它至少能頂三個位置。
模型路由:判斷這次請求該調用哪個大模型,還是根本不用調用、直接走預設邏輯,能省下大把 token 錢。工具調用門檻:判斷該不該調工具、調哪個工具,不必每次都讓大模型做選擇,響應快得多。驗證與監督:對大模型生成的結果做校驗,看是否符合要求、有沒有風險,不必把輸出再餵給大模型審一遍。Jev 在 Agent 裡頂的三個位置落到具體業務上,客服工單分類、用戶意圖識別、內容合規校驗、商品打標、實時風控、查詢路由到知識庫,凡是「從幾個明確選項裡做決定」的活,都是它的主場。但邊界同樣清晰:如果要的是寫文案、生成摘要、創作故事、開放域問答這類「生成非固定結果」的場景,Jev 幫不上忙,還得回到大模型。
如果決策邏輯極其複雜、選項沒有固定邊界、或者樣本少得連判斷依據都沒有,也別硬用。它只支持文本輸入,選擇字段的候選上限是 255(官方文檔),評測也主要基於自有業務工作流,而非 MMLU 等公開基準。一句話:它是一把精密的扳手,不是瑞士軍刀。放對位置,它是利器;放錯位置,就成了隱患。更現實的用法,是把它當 Agent 架構裡的一層。過去一個 Agent 跑起來,判斷一次調一次 LLM,路由一次調一次,驗證一次再調一次,延遲、成本和不確定性層層疊加。把高頻判斷拆給 Jev 後,架構就變成「規則+決策模型+LLM+工具」的多層協同:LLM 繼續負責複雜推理,Jev 負責那些又小又急的判斷題。
這種拆法,可能是它在工程上最值錢的地方。熱鬧背後的真問題圍繞 Jev 的爭議不少,Redis 之父 antirez 就公開潑冷水:Jev 或許有一些很狹窄的應用場景,但圍繞它出現的炒作,恰恰說明 AI 泡沫裡的大多數人分不清什麼重要、什麼不重要。這種質疑不無道理,Jev 並沒有抬高 AI 的能力上限,它只是把「判斷」這件小事做得又快又便宜。也有人直接說它「不就是個 JSON 分類器嗎」。但大模型研究工程師 Sebastian Raschka 提醒別低估它:傳統分類器訓練完標籤就固定了,場景一變就要重訓;Jev 能在運行時接收自然語言標籤,結合上下文對動態選項做判斷,泛化能力完全不同。
2026 年 9 月 20 日,谷歌 Gemma 官方賬號發了條「DiffusionGemma as Jev」,把自家的擴散模型適配成 Jev 式決策接口,風向的變化比爭吵更說明問題。技術之外,Jev 真正觸及的,是行業一個長久的困惑:為什麼模型已經這麼能聊,大規模自動化卻沒有隨之而來?TypeSafe 的答案是,聊天形態的模型,天生不是軟件該依賴的接口。軟件需要的不是一篇篇「文章」,而是一個個確定、可靠、能插進控制流的判斷。把「判斷」單獨拆成一層,讓大模型專注複雜推理,這可能是 Agent 架構下一輪演進的起點。
質疑者擔心的是熱度跑在能力前面;支持者看重的是它把「判斷」做成了一種可複用的基礎能力。兩者其實並不矛盾,分野恐怕要等 Agent 真正大規模落地後才有答案。對普通讀者而言,比起記住這些數字,更值得留意的是這個信號:當判斷開始按件計價、按毫秒交付,軟件自動化的門檻,正在被一點點磨低。(本文首發APP,作者 | 硅谷Tech-news,編輯 | 焦燕)
Related
相關文章

為工作而生的 AI:微軟納德拉稱正將 Copilot 打造成全新工作操作系統
作者:故淵 責編:故淵 評論: 9 月 26 日消息,科技媒體 Windows Latest 今天(9 月 26 日)發佈博文,報道稱在微軟發佈 Copilot“超級應用”後,公司首席執行官薩蒂亞 · 納德拉(Satya Nadella)表示:“正在將 Copilot 打造成一個全新的工作操作系統”。

Edge AI Daily 早報(9月26日)
Edge AI Daily2026.09.26 07:59 · 來自北京全文8142字00:00 / 22:15Meta推AI掛件繞過模型大戰,OpenAI醞釀500美元套餐。Runway發佈WorldPrompt,Cursor推Project模式。

Meta 已經想清楚 Muse 靠什麼賺錢
AGI-Signal2026.09.26 07:53 · 來自河南全文4239字00:00 / 11:34眼鏡、鑰匙扣、電腦、手機的入口,可能都是同一個智能體。美東時間週五收盤,Meta 報751.66美元,單日下跌3.3%,總市值約1.9萬億美元。
本期AI資訊彙總2026年9月26日的產品更新、前沿研究、行業趨勢與開源項目,幫助讀者快速瞭解當天的重要動態
導航SecureDoc // EncryptionActive本期AI資訊彙總2026年9月26日的產品更新、前沿研究、行業趨勢與開源項目,幫助讀者快速瞭解當天的重要動態。" AI資訊 | 每日早讀 | 全網數據聚合 | 前沿科學探索 | 行業自由發聲 | 開源創新力量 | AI與人類未來 | 訪問網頁版↗️ | 進群交流🤙 今日摘要 谷歌Gemini 4進入細化階段擬提前發佈 小米MiMo登頂開源權重榜首成本僅為對手零頭 美團龍貓2.

暢銷小說被指用 AI 創作,法國最有名文學獎龔古爾獎將其移出初選名單
作者:清源 責編:清源 評論: 9 月 25 日消息,據路透社報道,當地時間 25 日,法國最負盛名的文學獎項 —— 龔古爾獎主辦方宣佈,將海地裔加拿大作家泰利森 · 奧雷利安的暢銷小說《C'etait Ca ou Mourir(要麼就這樣,要麼死)》移出初選名單,原因是有人指控奧雷利安使用 AI 創作該書。

“AlphaGo”殺進足球場!自我對弈140年,機器人成“梅西終結者”
美國具身智能獨角獸Skild AI推出人形機器人Messinator,其核心是旗艦機器人基礎模型S1,透過自我對弈的方法在虛擬環境中訓練了140年,成功學會帶球、護球和射門等足球技巧。該機器人能透過觀看影片示範來理解任務並執行,顯示AlphaGo的自我對弈策略在物理世界中也獲得了成功驗證。