最火啞巴模型Jev加上微信,直接治好了我的低情商

字母AI2026.09.21 11:44 · 來自北京全文3770字00:00 / 10:28Jev微信插件爆火,根據對方消息直接揣測對方想法。文 | 字母AI谷歌的啞巴模型Jev突然爆火。它不聊天,不寫代碼,不寫文案,也不解釋,你問它什麼,它一個字都不生成。它只做一件事——判斷。發佈沒幾天,從Hacker News,再到中文技術社區,幾乎所有人都在討論它。但大家討論的不是它有多聰明,而是它有多反常。誠然,一個不會說話的模型能火,這事本身就已經夠反常的了。大家最先討論的,是它的落地場景。一個不會說話的模型能放在哪裡?答案是微信。
微信要回消息、要管群、要盯風控,怎麼看都該交給一個“會說話”的大模型。怎麼想怎麼不合理的事情,卻就這麼合理地發生了。不過具體是什麼情況,還是得先從Jev本身開始說起。Jev到底是個什麼東西TypeSafe AI在2026年9月16日發佈了Jev。這是一家舊金山的公司,創始人是GPT-4論文共同作者,前OpenAI研究人員迪奧戈·阿爾梅達(Diogo Almeida)。公司隱身研發了兩年,出來時帶著DCVC領投的4000萬美元種子輪。Jev給自己貼的標籤叫系統一模型(System One Model)。這個名字來自卡尼曼的《思考,快與慢》。
其中,系統一指的是那種不過腦子的直覺判斷,系統二是慢下來一步步推理。TypeSafe的說法是,這幾年所有人都在造系統二,會思考、會寫長文、會解釋。可軟件裡真正需要的判斷,大多數是系統一。Jev和ChatGPT、Claude的區別在於,Jev只會答選擇題,其他模型會寫作文。Jev的用法是這樣的,你給它一段狀態,比如一封郵件、一行日誌、一條工單、一段程序狀態,然後再給它幾個事先定好類型的問題,它一次性把答案全部返回,每個答案附一個概率,外加一個“我有幾成把握”的置信度。它只會答三種題。Choice:從最多255個選項裡選一個。Score:在一個2到10級的刻度上給分。
Noul:給出一個0到1的是/否概率。三種題可以混在同一個請求裡,而且是並行算的。官方說,問一個問題還是問四個問題,延遲幾乎一樣。Jev的特點是快和便宜。普通大模型是一個字一個字往外寫,寫多久取決於要寫多長。Jev不寫字,答案的範圍事先就定死了,算一遍每個選項的概率就完事。根據Jev的官方數字,端到端響應70到500毫秒,輸入每百萬token收0.042美元,輸出免費。它上線Vercel的AI Gateway後,24小時內被接近13%的Vercel付費團隊都用上了Jev,是Vercel平臺採用速度最快的新模型。它不能聊天、不能寫代碼、不能寫文案、不能看圖、也不能解釋理由。
你問它“為什麼不選這個”,它不回答,它只給數。Jev還有個特點,幻覺率為0%。這指的是它絕不會給出你選項之外的答案,絕不會拼錯字段。但它完全可以選錯一個選項。這一點,TypeSafe的CEO迪奧戈自己也承認過。Jev這個名字來自傑文斯悖論。蒸汽機效率提高、每噸煤更便宜,煤炭的總消耗反而漲了,因為便宜的動力被用到了更多地方。以前用不起AI,是因為調一次大模型又貴又慢,為了一個芝麻大的小判斷去調一次,不划算。現在Jev把單次判斷壓到了萬分之一美元它的訓練方法叫RLCD,Reinforcement Learning for Calibrated Decisions。
RLHF追求“人類愛看”,RLVR追求“程序能驗證對錯”,RLCD追求“概率要誠實”。如果RLCD說有70%的把握,那就是在數學驗證上有70%的概率是對的。Jev成了微信的插件Jev爆火後,社區拿它用的最多的,便是作為微信的插件了。微信最難的地方就在於,如何精準觸達對方的想法。比如經典的“你看著辦”。那到底是該怎麼辦?是小改一下?是放著不管?還是大刀闊斧?於是Jev的作用就體現出來了。這條消息要不要回?要不要 @ 對方?這條是不是廣告?要不要把人踢出群?這條要不要轉人工?這個人是不是想退款?這段話有沒有違規?每一件,都是“從有限選項裡挑一個”,而且要在幾百毫秒內出結果。而這正好是Jev的形狀。
那為什麼不用大模型?三個原因。第一,慢。大模型回一條要3到30秒。微信群裡的消息是滾動的,你30秒後回覆,對方可能不耐煩了。Jev 70到500毫秒,夠你在消息還沒滾出屏幕之前接上。第二,貴。微信機器人通常跑在便宜的常開服務器或輕量服務器上,一次判斷的成本必須低到可以忽略。用大模型逐條判斷,幾十萬條消息就是一筆真金白銀。Jev輸入0.042美元每百萬token、輸出免費,把單條判斷壓到萬分之一美元的量級。第三,也是微信插件最怕的,它不能說錯話。一個自由生成的大模型塞進聊天框,隨時可能冒出一句不該說的話,輕則社死,重則觸發風控、直接封號。
Jev根本不生成文本,它只從你給的選項裡挑,從結構上就“說不出格”。微信插件的老大難,是“自動回覆”和“轉人工”之間那條線。全自動,內容控制不了;全轉人工,人扛不住。Jev給每個判斷配一個校準過的置信度,於是這條線變成了一道閾值,把握高就自動過,把握低就轉給人,或者轉給更貴的大模型。這套“高把握自動、低把握升級”的分流,本來就是微信客服和社群運營一直想要的結構。還有一個隱藏點,關鍵詞命中就回復,包含“廣告”就踢人,被@了就應答。這些都是關鍵詞匹配,對方換個說法,不使用這個關鍵詞,那麼自動回覆就會失效。Jev把“關鍵詞匹配”升級成了“語義判斷”。
同樣是回不回、踢不踢,但判斷依據並非關鍵詞,而是用戶的意圖。安裝起來也是非常簡單,對Codex說一句“npx skills add typesafe-ai/skills”,或者在Claude Code里加個插件市場就行。通過OpenRouter能立刻調用。網上已經有了許多成熟的產品,比如wechat-jev-hud,它就是跑在一個Windows上的微信HUD,通過截屏、定位聊天區域,來識別文字氣泡,把Jev接在OCR和疊加層中間做實時判斷。隨後就會呈現出圖片中的效果,對方的這條消息,有多少的概率是在說怎樣的事情。
從生成到判斷Jev火得這麼快,是因為它踩中了一個大的問題:Agent為什麼還是又慢、又貴、又脆。過去兩年的AI敘事,是更長的上下文、更聰明的推理、更漂亮的回答。可當你真把一個模型塞進每天要跑幾十萬次的系統裡,你會發現,其中絕大多數調用,根本不需要它“說話”,只需要它“判斷”。比如一條客服工單歸哪個部門,一次工具調用有沒有風險,一段AI的輸出有沒有跑偏,下一步該點頁面上哪個按鈕。這些問題從來都只有一個正確答案,而且答案的選項也早就寫在自己的代碼裡。讓一個會寫作文的模型先寫一段話,再由程序把它翻譯回一個判斷,繞了整整一大圈。Jev想省掉的,就是這一圈。
所以社區很多人評價Jev,說它像給軟件裝了一句“語義if語句”。如果(if)對方出現了哪種意圖,那就回應它對應的答案。其效果也是立竿見影,通過Browser Use把Jev用在瀏覽器Agent裡,一次請求同時選“做什麼”和“點哪個元素”,訂一張機票的時間能從9.5秒縮到7秒。以及在長程任務中,把Jev做成路由中間件,讓它替Agent挑該用哪個模型,也能節省很多時間。不過“Jev取代大模型”是個偽命題。正確的做法應該是,大模型幫你想清楚判斷規則,Jev在生產環境裡高頻、低價地執行。它真正值錢的地方,其實在於校準。把看似模稜兩可,沒有標準答案的問題給量化,一眼便知道答案應該選什麼。
微信插件的例子其實已經說明,它最先落地的地方,不會是那些“需要創造力”的場景,反而是那些高頻、低成本、不出錯的場景。判斷越頻繁、越瑣碎、越怕錯,它就越合適。一個猜想,當判斷這件事本身變得便宜,那不如干脆就別讓模型說話,只讓它做判斷。判斷層會像數據庫、像緩存一樣,變成一層默認的基礎設施,藏在每個應用的最底層。微信插件只是一個開始。但Jev的中文適配能力較差。官方文檔明確標註 CJK(中日韓)準確率偏低。英文短文本表現相對穩定。同時,Jev也沒有推理能力。Browser Use創始人實測的長程瀏覽器交互,Jev最終測試結果為1/20,落後於具備推理能力的GPT-5.6 Luna(17/20)。
瀏覽器操作涉及狀態空間搜索與路徑回溯,Jev不具備多步狀態推演能力。社區網友表示,Jev無法應付真實複雜的非沙盒網頁。面對真實網頁中未清洗的DOM、異步加載與突發彈窗,Jev缺乏應對能力。
Related
相關文章

阿里 70 億參數圖像模型Qwen-Image-2. 1 開源發佈,號稱以瘦身之軀叫板閉源巨頭
最讓人意外的是它的身板——視覺生成組件僅用70億參數,卻在自家的評測基準上壓過了市面上絕大多數閉源模型。團隊放話底氣十足,不過第三方獨立評測尚在趕來的路上,這份成績單還需時間檢驗。更接地氣的是,它不挑設備,一塊像RTX3090這樣的主流消費級顯卡就能托起它跑起來。

開源Top2!實測階躍Step 5 Preview,真有點猛啊…
。 昨天,階躍星辰毫無預兆地端出了最新一代旗艦基座模型——Step 5 Preview。 MoE架構,600B總參數、激活參數僅27B,1M上下文。 Agent能力大幅提升,在Artificial Analysis的最新評測中,Step 5 Preview取得44分,直接衝到全球開源Top 2。 要知道,其他拿到這一分數的大模型,大多都是萬億參數級別。

快手把直播字幕延遲砍到 500 毫秒內:自研端到端工程範式,把電商直播的字幕打成"實時"
最直接的數字是:主播發聲到字幕具備展示條件的端到端延遲,從過去的1.5到2秒壓到了400到500毫秒,字符錯誤率(CER)從7.81% 降到3.51%,背後還要撐住千萬級的持續併發——這在以高併發、強實時著稱的電商直播場景裡,第一次有了一套成體系的工程打法。

特斯拉得州超級工廠鋼結構接近完工,Optimus產線建設加速
X平臺博主Joe Tegtmeyer近期通過無人機拍攝顯示,工廠主體鋼結構已接近建築北側邊緣,距離北側外圍梁約剩5個柱網;廠房上方三層結構正在進行混凝土澆築,其他區域也在持續進行澆築準備工作。Tegtmeyer認為,特斯拉得州Optimus工廠規劃年產能達1000萬臺,預計生產工作將在2027年晚些時候啟動。

黃仁勳駁斥 AI 末日敘事:嚇唬人不負責任,2030 年是世界末日概率為 0%
他認為這類說法屬於被過度渲染的 AI 末日敘事。黃仁勳說:“2030 年不會是世界末日,2030 年即是世界末日的可能性為 0%。嚇唬人不負責任,也沒有必要。”回應考克森:這類預測沒有科學依據黃仁勳此番言論是在回應前 Anthropic 研究員雅各布·考克森的看法。

微軟Copilot桌面版新增內置瀏覽器,支持多標籤與全屏瀏覽
目前該功能已面向管理員開放測試,但需通過設備管理系統啟用BrowsingEnabled策略,更廣泛的自動推廣預計將在11月底進行。微軟表示,9月21日還將發佈補充更新,為側邊欄網頁標籤增加右鍵菜單,可直接選擇在外部瀏覽器中打開鏈接。此前用戶點擊Copilot回答中的參考鏈接通常需要跳轉至外部瀏覽器,新功能則允許網頁直接加載在Copilot內部,關閉頁面後即可繼續對話。