Nokia Open-Sources AnyJev: A Training-Free Layer That Turns Any Open LLM Into a Calibrated Decision Model
Nokia’s applied research team has open-sourced AnyJev, a Python library that turns an open LLM into a decision model.It needs no training.It targets a common production job: picking one answer from a fixed set instead of writing a sentence.Is it deployable?
Yes, it installs from PyPI, ships under Apache-2.0, and has transformers and vLLM backends with shared-prefix scoring.What is AnyJev?AnyJev borrows its interface from Jev.Jev is the System One decision model that TypeSafe AI launched in September 2026 (our coverage).
You give AnyJev a typed question and get back a decision with a probability you can threshold.That probability is read from the model’s next-token distribution.Nothing is generated, parsed, or trained.The library supports 3 question types: A choice question picks one of K options.
A noul question is yes or no.A score question places the answer in one of several ordered bins.The Problem With Reading Logits Directly Many open projects already restrict the next token to the option labels and read the scores.The Nokia research team flags 2 flaws in that shortcut.
First, the answer can change when the options are reordered.Second, the probabilities are not calibrated.The levels doc names 2 causes: The first is prior bias: the model favors some labels, such as “Yes” over “No”, whatever the input.
The second is position bias: the model favors certain slots in the option list.How AnyJev Works: L0 and L1 Every decision carries a level field.L0 (zero labels, on by default) applies 2 fixes: Cyclic shifts.
For a question with K options, the list is shown in K rotations, so every option appears in every position once.The results are combined in log space as a geometric mean.If the position bias is additive in logit space, this removes it exactly.Prior correction.
By default, AnyJev uses batch calibration.It keeps a running mean of the predicted distributions on real inputs and divides it out at strength 0.75.The correction starts after 8 items.L0 costs K prefills per decision, batched over a shared prefix.That is about 0.
25 s per decision at batch 32 on one H100, with K = 20.L1 (100 to 500 labels per question) adds temperature scaling on top of L0.The fitted values are saved as a small JSON artifact.L1 reshapes confidence but does not change the ranking of answers.
Benchmark Results On Qwen3-8B with BANKING77 (20-way, 300 test items), the numbers look like this: MetricRaw logitsAnyJev L0AnyJev L1Labels required00100 to 500Flip rate when options reversed0.2300.0730.077Accuracy0.7470.8030.807Calibration error (ECE)0.2400.1840.095Auto-decidable at 5% error7.7%46.
3%52.0% A few other results from the repo: L0 reduced order flips on all 9 model and task rows tested.On a typed-decisions set, Qwen3-32B with L1 reached an ECE of 0.036, compared with 0.144 published for Jev.On accuracy, the fine-tuned Laya still leads.
The full ablation table covers Qwen, OLMo, Granite, Phi and Mistral models.Wu says the team tried AnyJev on an internal Nokia routing problem and saw promising results.How to Use AnyJev Copy CodeCopiedUse a different Browser# pip install "anyjev[hf]" from anyjev import Decider, Question from anyjev.
backends.hf import HFBackend d = Decider(HFBackend("Qwen/Qwen3-8B")) route = Question.choice("Which team should handle this?", ["billing", "technical", "sales", "other"], name="route") r = d.decide({"conversation": [...]}, [route]) r["route"].
distribution # probabilities per option For serving, you start vLLM with prefix caching and point a VLLMBackend at it.window.addEventListener("message",function(e){var f=document.getElementById("ajx-embed-frame");if(f&&e.source===f.contentWindow&&e.data&&e.data.ajxHeight){f.style.height=e.data.
ajxHeight+"px";}}); Key Takeaways AnyJev turns open LLMs into Jev-style typed decision models with no training.L0 uses cyclic shifts and a batch prior to remove position and label bias.On Qwen3-8B BANKING77, the order-flip rate falls from 0.230 to 0.073.
Auto-decidable traffic at 5% error rises from 7.7% to 52.0% with L1.It is Apache-2.0 on PyPI, with Hugging Face and vLLM backends.Check out the GitHub Repo.All credit goes to the researcher of this project.
Also, feel free to follow us on Twitter and don’t forget to join our 150k+ML SubReddit and Subscribe to our Newsletter.Wait!are you on telegram?now you can join us on telegram as well.Need to partner with us for promoting your GitHub Repo OR Hugging Face Page OR Product Release OR Webinar etc.?
Connect with us The post Nokia Open-Sources AnyJev: A Training-Free Layer That Turns Any Open LLM Into a Calibrated Decision Model appeared first on MarkTechPost.
Related
相關文章

達卯科技完成新一輪融資,算電協同核心軟件層“稀缺標的”
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 達卯科技完成新一輪融資,算電協同核心軟件層“稀缺標的” 量子位的朋友們 2026-09-23 17:46:57 來源:量子位 打造算電協同領域“Windows”級操作系統 算電協同AI能源運營操作系統核心企業達卯科技,近期據悉已完成約2億元新一輪融資。去年10月,達卯科技完成由寧德時代旗下溥泉資本領投的近億元A+輪融資。 達卯科技成立於2021年,總部位於上海徐匯模速空間,是國內首家將能源大模型規模化落地算電協同、虛擬電廠與泛能源場景的AI企業,也是算電協同賽道的先行者。公司核心依託自研垂類能源大模型與AI智能體集群,打造算電協同平臺、AI虛擬電廠平臺、智能運維平臺等產品矩陣,面向智算中心客戶提供從諮詢規劃、投資測算、智能運營、精細化運維、能源增值交易的全生命週期服務。 公司推出的核心產品算電協同2.0平臺・AIDC綠電直連能源運營操作系統,是算電協同產業鏈中的關鍵軟件,已形成面向GW級智算中心綠電直連場景的全週期智慧能源運營閉環能力,核心技術指標處於行業領先水平,推動AIDC從傳統“用電負荷”升級為“新型電力系統下可調度、可交易的柔性資源”。 目前,達卯科技股東陣容包含寧德時代、商湯科技、寒武紀等產業鏈龍頭企業,具備優異的產業生態協同與資源聚合能力。 算電協同,係指通過數字化技術、智能算法和通信網絡,將算力基礎設施與電力系統(發電、輸電、配電、用電環節)進行有機整合,實現資源動態匹配與優化配置的基建工程,以提升能源利用效率、保障算力供給穩定性,並推動低碳化發展。2026年初,算電協同首次寫入政府工作報告,成為新基建重點方向。今年9月,國務院層面進

國內開發者如何穩定使用 Claude Code、Codex 和 Gemini CLI:從配置接入到團隊協作
AI資訊AI新聞資訊正文國內開發者如何穩定使用 Claude Code、Codex 和 Gemini CLI:從配置接入到團隊協作發佈於AI新聞資訊發佈時間 :2026年9月23號 17:28閱讀 :2分鐘隨著 AI 編程工具快速發展,Claude Code、Codex、Gemini CLI 等工具已經逐漸從簡單的代碼補全,發展到可以理解項目結構、修改多個文件、執行命令、排查問題,甚至協助完成完整應用開發。對於個人開發者、獨立開發者和企業研發團隊來說,AI 編程工具已經成為提高開發效率的重要組成部分。不過,在實際使用過程中,很多國內開發者遇到的問題並不只是模型能力本身,還包括網絡連接、支付方式、配置流程、額度管理和售後支持等。一、使用 AI 編程工具時,開發者常見的問題網絡連接不穩定在使用 AI 編程 Agent 處理複雜任務時,一次任務可能需要持續運行幾分鐘,甚至更長時間。如果連接過程中出現中斷,就可能導致:代碼修改沒有完成;Agent 執行到一半停止;需要重新提交任務;上下文丟失;項目調試過程被打斷。尤其是在大型代碼庫分析、跨文件重構和連續多輪對話中,穩定性會直接影響使用體驗。配置過程比較複雜Claude Code、Codex 和 Gemini CLI 通常需要配置 API 地址、密鑰、環境變量或命令行參數。對於剛開始接觸 AI 編程工具的用戶來說,可能會遇到:API 地址配置錯誤;環境變量沒有生效;不同系統配置方式不同;模型名稱填寫錯誤;VS Code、JetBrains 或命令行環境無法正常調用。充值和報銷不方便個人開發者更關注價格和充值靈活性,企業和高校用戶則通常還需要考慮:是否支持國內支付;餘額是否會過期;是否可以按量付費;是否支持團隊統一管理;是否能夠提供合同和發票;採購後能否正常報銷。團隊使用缺少統一管理當多個成員同時使用 AI 編程工具時,如果每個人單獨注

Anthropic 擬租賃最高 1 吉瓦算力,減少對雲廠商依賴
AI資訊AI新聞資訊正文Anthropic 擬租賃最高 1 吉瓦算力,減少對雲廠商依賴發佈於AI新聞資訊發佈時間 :2026年9月23號 17:39閱讀 :1分鐘據媒體報道,Anthropic 正處於早期談判階段,擬從阿波羅全球管理(Apollo Global Management)控股的數據中心開發商手中租賃最高 1 吉瓦(GW)算力。這被視為這家 AI 公司降低對雲廠商依賴的重大舉措之一。若交易達成,Anthropic 將直接掌握相當體量的算力供給,而不再單純依賴第三方雲平臺按量分配。目前談判仍處早期,最終租賃規模、期限與具體開發商尚未敲定,但“最高 1 吉瓦”的目標已顯示出 Anthropic 對自有算力底盤的強烈訴求。部分知情人士稱,Anthropic 還在商議由谷歌為該項目提供信貸擔保。不過,目前尚不清楚谷歌將對項目的哪一部分承擔兜底責任。相關推薦醫療 AI 走向全球普惠:Anthropic 攜手 OpenEvidence,將臨床決策支持工具免費覆蓋百國Anthropic與醫學知識平臺OpenEvidence達成戰略合作,將基於人工智能的臨床決策支持工具免費提供給美國和歐洲以外醫療資源匱乏地區的醫生,打破循證醫學知識獲取的地理限制,緩解當地醫學文獻、專科醫生及繼續醫學教育資源不足等痛點,推動全球醫療資源公平可及。2026年9月23號 14:07147.9kAnthropic上線Claude Opus 5.5 ,任務成本大降 40%Anthropic發佈Claude Opus 5.5,為Claude 5.5系列首款。官方稱多數任務表現與Fable 5.1相當,成本較上代Opus 5降40%、速度提升超30%,9項測試中7項領先,編程表現突出。約兩小時後,OpenAI推出GPT-6 Sol和Luna,GPT-6“宇宙”擴容。2026年9月23號 8:53135.9k福

螞蟻百靈開源 Ming-Image-0.1-Design 系列模型,UI 設計專項評測位列開源第一
首頁 > 智能時代>人工智能 螞蟻百靈開源 Ming-Image-0.1-Design 系列模型,UI 設計專項評測位列開源第一 2026/9/23 17:42:16 來源:IT之家 作者:遠洋 責編:遠洋 評論: IT之家 9 月 23 日消息,今日,螞蟻百靈大模型正式開源 Ming-Image-0.1-Design 系列,包含兩個參數量均為 6B 的模型:Ming-Image-0.1-Design,從文字需求生成 UI、信息圖、海報和完整視覺設計;Ming-Image-0.1-Design-Layer,將創意圖或者設計圖拆成可獨立編輯的透明圖層。IT之家注意到,螞蟻百靈同時開源了 Design Skill 和 PPT Skill,將模型能力繼續連接到前端頁面與可編輯演示文稿。據官方介紹,Ming-Image-0.1-Design 重點增強了四項能力:支持 8K 長結構化提示詞增強,將自然語言需求組織為文案、模塊、佈局和視覺風格;優化標題、按鈕、卡片和多區域信息的文字渲染與版式穩定性;通過端到端生成一次性完成整體設計,統一配色、構圖和素材風格;創建原生 RGBA VAE,直接生成人物、商品、圖標和裝飾等透明背景素材。相比通過代碼多次調用通用生圖模型,分別生成背景、插畫和裝飾,端到端生成擁有更完整的全局控制,能夠減少素材之間色系衝突和畫風不一致。在 Artificial Analysis 於 2026 年 9 月 18 日更新的 UI / UX Design 專項評測中,Ming-Image-0.1-Design 位列開源模型第 1,Elo 得分為 1082。模型在 UI / UX 場景中的版式勝率達到 67.4%,複雜構圖達到 67.0%,文字渲染達到 66.7%。官方稱,Ming-Image-0.1-Design 系列仍有明確的能力邊界。Design 目前最穩定的是排版

斑馬智能發佈端模型AutoOmni2.0,讓元神AI更懂“我的世界”
斑馬智能在雲棲大會發表新一代全模態端側大模型AutoOmni 2.0,任務處理能力堪比10倍參數量的雲模型,並推出AutoClaw 2.0智艙協作實車方案。元神AI強調理解用戶的「表世界」與「裡世界」,透過「三個連通」朝Personal AI演進,已覆蓋主流車企68%的服務。AutoOmni與10家晶片廠合作,實現低延遲、隱私保護及高效能推理,並展示免喚醒與主動智能等場景,未來將從單體智能擴展至群體智能。

它石智航頂尖團隊引領中國具身智能率先邁入規模化落地階段
它石智航創辦人陳亦倫於上海跨國企業推介會中,強調具身智能須經真實產線驗證,並指出中國憑藉豐富製造業場景,率先進入規模化落地階段。該公司已透過自研AWE基座大模型與自製機器人硬件,完成從模型突破到規模化應用的三級躍遷,並計畫擴大研發團隊與生產基地,提升交付能力。未來將以中國為研發核心,面向全球推動工業智能化轉型。