被硅谷吹爆的Jev到底有什麼用?我們替你親手試了試

2026年9月24日 18:41
被硅谷吹爆的Jev到底有什麼用?我們替你親手試了試
站內 AI 整理稿

藍字計劃2026.09.24 18:39 · 來自廣東全文4900字00:00 / 12:20下一個Manus時刻?文|藍字計劃,作者|ChesterAI圈的一個“奇行種”,突然爆紅。9月15日,TypeSafe發佈了Jev。幾天後,它已經出現在Vercel、Cloudflare、LangChain、Langfuse等開發者工具裡。Vercel說,Jev接入AI Gateway後的24小時內,接近13% 的付費團隊就用上了它。不過AI圈的東西看著神通廣大,很多人都躍躍欲試,但真的到了想自己上手的時候,很多人還不知道該從哪兒開始。要下載什麼?得先配置環境嗎?不會寫代碼能不能玩?

因此,我們趁著現在還能免費體驗,先替大家吃一次螃蟹:上手體驗一把Jev ,並儘量教會讓大家無腦用上Jev。但在開始前,不得不說,測試下來Jev的第一道門檻比想象中低。就像以前的OpenClaw,我們還說過它的配置要求低,未來說不定連智能手錶都能帶動。而Jev的第一次體驗更省事,甚至不用打開電腦,在網頁端都能用上。另一方面,我們這次挑選的體驗案例也和大部人上網衝浪的真實需求息息相關。隨著AI大爆發,社媒上到消息也開始魚龍混雜起來。哪些是真消息?哪些是胡說八道?哪些是AI編造的?以前大家不可能每條都去核實的“消息鑑定”步驟,這次我們打算把它交給Jev。

用Jev打造“火眼金睛”目前能玩到Jev的入口已經有不少,比如我們這次就找了個第三方網站Jev AI Dev,幾種基本功能都能在這裡試,每個賬號每天還有六次免費體驗額度,比較適合大家先熟悉一下。網址放在這裡:https://jevai.dev/zh-Hans/playground/點開這個鏈接,就會進入中文試玩頁面。先點擊右上角的“登錄”,按提示登錄賬號,然後往下找到“單個問題”和“多個問題”。這兩個選項,可以理解成拿著同一份材料,只問一件事,還是一次問好幾件事。比如給Jev一條科技新聞,我們可以只讓它判斷“這屬於哪類新聞”,也可以順便問問“消息有多可信”“裡面的說法有沒有得到證明”。

既然要做一個信息查證的工具,我們這次就選“多個問題”,就可以對一條消息同時問幾個問題。繼續往下看,可以看到頁面默認會填好一套“AI助手任務交接”的示例。我們可以直接在這套示例上修改,把裡面的內容換成自己的。先找到“輸入”框,刪掉原來的示例文字,填入這條消息。“9月23日,一家AI公司發佈新模型,聲稱其代碼能力比上一代提升30%,但目前只公佈了宣傳材料,沒有公開完整測試數據。”然後就可以直接體驗Jev的三種能力:Choice、Score和Noul。雖然名字看起來挺面生的,但是用起來之後,還是挺好理解的:Choice就是讓Jev在幾個答案裡選一個。

比如我們給它設置幾個選項,讓它判斷一條內容下一步應該怎麼處理。提交之後,它會告訴我們選了哪個答案,同時給出每個答案的概率。比如我們想給這條新聞分類,就得先告訴它有哪些類別可以選。在Choice下方的“問題 / 指令”裡,填入“這條消息最適合歸類為什麼?”這時可以把“可選項”框裡原來的內容替換成下面這四行:product: 產品發佈performance: 性能提升funding: 融資消息other: 其他假如Jev最後返回product,就表示它判斷這條新聞的分類是“產品發佈”。這樣,我們就給Jev出好了一道選擇題。

它會從這四個答案裡選一個,同時給出每個答案的概率,讓我們看到它有多傾向於各個選項。Score則是打分。分類只能告訴我們這是一條什麼消息,但沒法告訴我們該有多相信它,所以就需要多一個評分系統來輔助。在Score的“問題 / 指令”裡,填入“這條消息的可信程度有多高?”下面的“評分等級”需要我們自己設置。這裡每行填一個等級,按照從低到高的順序排列:很低較低中等較高很高這時,我們相當於給了Jev一把打分的尺子,判斷輸入的材料的可信度到底有多高。最後是Noul ,可以簡單理解成回答“是或者不是”。網頁上這一欄叫“Probability (Noul)”。

有時候,我們可能還想多瞭解一下比“可信程度有多高”更具體的情況。就拿我們原本想問的這個問題為例子,我們也許會好奇,公司說代碼能力提升了30%,到底有沒有拿出證據?那麼在這一欄的“問題 / 指令”中填入“這家公司是否已經證明新模型的代碼能力比上一代提升30%?”,再把下面“‘否’與‘是’的定義”改成這兩行:false: 沒有證明true: 已經證明到這裡,三個問題就都設置好了。再來複習一下,通過這一輪設置,我們讓Jev給同一條消息分個類、打個分,再判斷其中的性能提升說法有沒有得到證明;再點擊下方的“體驗Jev”,就把三個問題給提交了。

因為這次測試是運行在網頁端,無論是電腦還是手機,都可以看到Jev返回的結果。最終可以看到,Choice選擇了product,也就是“產品發佈”,對應的概率為0.62。“性能提升”的概率為0.38。它判斷這是一次產品發佈。Score給出的分數是1.09。對照剛才設置的五檔,這次結果接近“可信程度較低”。Noul的結果則是0.04,說明根據我們提供的材料,它傾向於認為還沒有證明。在這一波流程後,Jev已經給出了它的初步判斷:一條消息就有了分類、可信程度評分,以及針對具體說法的判斷。但是它的依據只是我們填進去的文字,它並沒有替我們上網找到完整測試報告。於是,我們繼續往下測。

想要真正實現一個自動判斷真偽的工具,還得讓Python直接調用Jev,讓它幫我們搭一個科技新聞的自動審核流程。全自動,手搓審核工具我們在Jev的Playground主頁下方,找到了AI模型聚合平臺OpenRouter。註冊並登錄賬號,創建API Key後,就可以在Python中調用Jev了。這裡創建普通的OpenRouter API Key就可以,不需要另外申請Jev專用的。另外,前面第三方網站每天六次的免費體驗額度,不會帶到OpenRouter,運行前需要確認賬號裡有可用額度。接下來,我們需要在程序裡填好要判斷的新聞、想問的問題,以及可以選擇的答案。

這和前面在網頁裡填表是一樣的,只是提交和接收結果的工作,現在交給Python來完成。第一條測試,我們給Jev一條這樣的新聞:“某AI公司宣佈新模型準確率提升50%,但目前沒有公開任何測試方法、數據集或完整測試結果。”我們提前告訴Jev,接下來只有三個選擇:publish(發佈)、verify(核實)、reject(拒絕)。同時,再讓它判斷這條消息的可信程度,以及是否需要人工審核。這裡還是用到了前面的三種能力。Choice這次負責選擇下一步怎麼處理,Score負責打分,Noul負責判斷是否需要人工審核。後兩項的數值,需要結合程序裡設置的評分標準和審核條件來使用。

結果是:下一步:verify;可信程度:0.35;人工審核概率:0.88。也就是說,Jev認為這條消息暫時不能直接發佈,應該先核實,而且很可能需要人工看一下。Python程序拿到這個結果後,就可以自動把它放進“待核實”隊列,並加上“需要人工審核”的標記。整個過程其實可以簡單理解成:新聞進來 → Jev判斷 → 程序看結果 → 自動執行下一步不過,我們還想試一個更接近真實使用場景的玩法。平時用AI查消息,我們經常會碰到一個問題。它能給出一段像模像樣的回答,但這段回答究竟有多少依據,能不能直接拿來用,還得自己判斷。所以這次,我們讓普通AI先回答問題,再把它的回答交給Jev檢查。

看看能不能讓程序先進行篩選,把需要核實的回答留下來。於是,我們先對著AI輸入了一個問題:“OpenAI最新模型的代碼能力比上一代提升了30% 嗎?”這時就可以同時得到了普通AI的回答和Jev的結果:可以見到,基於AI的回答,Jev給出的判斷是,下一步是“verify”,可信程度3.2,人工審核概率0.38。根據前面的三個選項,publish表示可以採用,verify表示需要核實,reject表示拒絕採用,也就是說AI回答的這個答案還是有點問題的。當然Jev給出verify,也不等於它認定AI的回答是錯的。而人工審核概率為0.

38,也沒有達到我們設置的人工審核條件,所以程序沒有把它交給人工,而是讓它繼續進入自動核實流程。這樣一來,一個最簡單的“AI + Jev”的組合就形成了一基礎流程:用戶提問 → AI回答 → Jev檢查 → 程序執行下一步這時就可以讓這個流程進入一個更加具體到場景了:還是讓Jev判斷一條AI新聞應該怎麼處理,不過這一次,我們把結果明確分成三個:publish:直接發佈;verify:先核實;reject:直接攔截。然後用Python寫一個非常簡單的規則:Jev返回什麼,程序就執行對應的動作。第一條測試內容是:某公司已經公開完整測試數據和技術報告,證明新模型性能有明確提升。

Jev的判斷是publish,直接發佈;第二條換成:某公司宣佈新模型性能提升30%,但關鍵測試數據還沒有公開。這一次,Jev給出的結果是verify,待核實;最後,我們故意把條件變得更加誇張:某公司聲稱新模型性能提升1000%,但沒有任何測試數據,也沒有可靠來源。Jev返回reject,拒絕。這三輪測試下來,發佈、核實、攔截三個分支就都跑通了。以後再有新聞進來,程序就可以先讓Jev判斷,再把消息交給對應的步驟處理,省去我們逐條查看結果、手動分類的過程。下一個Manus時刻?這次用下來,我們覺得最需要花心思的地方,其實是把問題問清楚。

比如“這條消息可信嗎”和“這家公司有沒有證明性能提升”,看起來差不多,但對AI來說完全是兩種不同的判斷。以前我們費盡心力給AI寫更好的提示詞,現在看來要用Jev這類軟件,過硬的語文功底還是必不可少的。先想好自己需要什麼結果,才能讓Jev幫上忙。另外,Jev的玩法其實還有很多。前面的新聞審核只是最基礎的玩法,已經有人直接拿Jev研究微信聊天。比如“Crush好感監控器”,就能分析聊天記錄裡的情緒和意圖,還能給自己的回覆評級。以前要截圖問朋友“他這句話是什麼意思”,現在有人把這件事做成了工具。說起來,Jev的熱度的確高得嚇人,有當時Manus爆火時的味道了。

如果把“Manus時刻”理解成一種讓人看完演示,就忍不住想親手試試的興奮感,那麼Jev身上,或許的確是迎來了屬於它但“Jev時刻”吧。

Related

相關文章

教機器人幹活,光“刷課時”可不夠!靈初這次較真數據質量

靈初智能推出Psi-R2.5模型,強調高質量配對數據對機器人學習的重要性,並透過逆向使用世界模型Psi-W0,將真實機器人操作轉換為對應的人手示範,形成強配對數據以提升訓練效率。該模型也探索上下文學習(ICL),使人類示範可作為當前任務的提示,不必重新訓練模型,同時透過預訓練與後訓練結合,在實際部署中達到約99%成功率,降低客戶適配成本。

剛剛

這屆網友,正逐漸對十級濾鏡“祛魅”

數字力場2026.09.24 09:46 · 來自浙江全文4738字00:00 / 11:15在大眾審美趣味被暴力美顏調教得“活人感不足,假面感有餘”的當下,很多人希望抵禦軟性的審美規訓——哪怕真實必然伴隨著缺陷。文 | 數字力場,作者 | 佘宗明作家海明威曾說過:Good writing is true writing(好的寫作就是寫出真實)。將“寫作”改成“拍攝”,其實也成立。

2 小時前

智元第兩萬臺遠徵A3 Ultra下線交付長隆,六千臺半年填滿,具身機器人第一次在主題樂園裡常態上崗

9月24日,第20000臺通用具身智能機器人遠徵A3Ultra在橫琴長隆飛船樂園正式走下產線,並當場交到長隆集團手裡。從今年3月跨過萬臺門檻到如今的兩萬臺,這家公司只用了約6個月——產能爬坡的曲線,已經明顯進入了加速段。同一天,由智元與長隆聯手打造的全球首個大規模具身智能主題樂園在橫琴長隆飛船樂園啟幕,超過300臺智元全系機器人開始在園區裡常態化上崗,扎進遊客互動、導覽、演藝和科普研學等場景。

5 小時前

稚暉君把機器人賣到2萬元一臺,可人可狗可開發!

稚暉君(彭志輝)正式開賣個人機器人Q1與可變形機器人T1,售價均為19999元起,主打可創造與隨行,並開放二次開發平台。上緯新材轉型投入消費級機器人,上半年研發投入約1.64億元,但機器人業務尚未產生營收,公司出現虧損。

22 小時前

李飛飛談 AI 安全:不能只讓開發者評估自己的系統

她認為,對於能力日益強大的 AI 系統,其安全評估不應完全交由開發這些系統的公司負責。評估不能只交給開發公司作為斯坦福大學教授、World Labs 聯合創始人,李飛飛週二表示,儘管 AI 公司的內部研究人員可以評估單個模型的能力和安全性,但這無法替代由政府、行業和學術機構共同制定的更廣泛標準。

1 天前