B站上線"AI 無限競技場"測評榜:上百模型同場廝殺,GPT-6 暫坐頭把交椅
AI資訊AI新閒資訊正文B站上線"AI 無限競技場"測評榜:上百模型同場廝殺,GPT-6 暫坐頭把交椅發布於AI新閒資訊時間 :Sep 20, 2026閱讀 :1分鐘B站今天端出了一塊大模型擂臺——"AI 無限競技場"測評榜,並同步亮出首輪排行榜。在10位 UP 主的真機實測裡,GPT-6Astra 拿下榜首、並且搶下"登頂次數冠軍",把 GLM-5.3壓在身後;前五名裡國產大模型佔了三席,和海外巨頭貼身肉搏。這塊競技場和傳統跑分榜的玩法不一樣。
它把 B站 各領域 UP 主對上百個大模型的真實場景實測匯成一個廣場,涵蓋代碼、推理、協作、知識等多種主題,而且不設固定的測評維度限制——來自不同分區的創作者拿真實工作流、專業應用乃至趣味腦洞自主命題,讓模型在同題 PK 裡把實際差距攤開給人看。DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千問、Hy、MiniMax 等主流模型都在對比之列,排名實時刷新,並持續向全站 UP 主開放報名。B站 押注這塊榜單,底氣來自平臺上 AI 內容的爆發。過去一年,B站 AI 知識內容消費時長同比增長72%,月均觀看 AI 內容的用戶超過1.
9億,圍繞模型發佈、討論、測評、使用、求助、共建的內容已經成體系。當模型迭代快到跑分榜追不過發佈節奏,把評測權交還給真實創作者和真實工作流,反而更貼近用戶心裡那句"到底哪個好用"——B站 想做的,是把自家的社區生態變成大模型走向大眾的另類裁判臺。相關推薦B 站上線“AI 無限競技場”:百大模型同臺 PK,GPT-6 Astra 暫居榜首B站上線“AI無限競技場”大模型測評榜並公佈首輪結果:GPT-6 Astra在10位UP主測評中登頂,力壓GLM-5.3獲“榜首次數冠軍”;前五名中國產大模型佔三席。
該榜由各領域UP主對上百個大模型進行真實場景實測,覆蓋代碼、推理、協作、知識等主題,不設固定命題。Sep 20, 202631.2k Anthropic考慮推出新模型,擬應對OpenAI GPT-6Astra競爭路透社稱,Anthropic籌備IPO期間擬推新AI模型,以應對OpenAI GPT-6Astra在企業市場的競爭,但安全性仍在評估,發佈時間未定。此舉與其CEO阿莫代9月12日呼籲放緩AI能力迭代、重視安全的主張形成對照。Sep 20, 2026146.0kOpenAI 宣佈 GPT-5.
5 將於 10 月 14 日下線:ChatGPT 與 Codex 同步移除OpenAI宣佈GPT-5.5將於10月14日從ChatGPT、ChatGPT Work及Codex下線,覆蓋所有訂閱方案。官方提醒Codex用戶儘快切換至GPT-5.6 Sol或GPT-6 Astra。此次停用涉及全部計劃,替代模型為上述兩個。該模型於今年4月24日推出,較GPT-5.4在同等任務上有所優化。Sep 16, 2026178.9kGPT-6 Astra 模擬經營售貨機一年狂賺 1.
5 萬美元,成績碾壓 Claude 近 3 倍Andon Labs的Vending-Bench2測試中,AI以500美元模擬經營售貨機一年。GPT-6 Astra平均賬戶餘額達15515美元首次登頂,最差一輪也超過Claude Fable5.1最佳表現。差距不僅在於盈利,更在策略:Astra持續壓低採購價,一度砍至原價約48%。Sep 15, 2026256.6kGPT-6 Astra展現恐怖統治力:模擬售貨機一年狂攬1.5萬美元,成績碾壓Claude近3倍Andon Labs的Vending-Bench2測試中,AI代理用500美元模擬經營自動售貨機一年。
GPT-6Astra平均餘額達15515美元,最差一輪也超Claude Fable5.1最好成績,首次登頂,優勢體現在供應鏈管理和規則執行力。Sep 14, 2026217.4k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026
Related
相關文章

微信 AI 團隊開源 WeKnora:知識庫不再只“動嘴”,還能在沙箱裡“動手”
AI資訊AI新聞資訊正文微信 AI 團隊開源 WeKnora:知識庫不再只“動嘴”,還能在沙箱裡“動手”發佈於AI新聞資訊發佈時間 :2026年9月20號 16:22閱讀 :1分鐘微信 AI 團隊正式開源了知識管理框架 WeKnora(維娜拉),最新發布的 0.8.0 版本已全面面向公眾開放使用。它的定位可以概括為一句話:讓知識庫不只是“能查到答案”,而是“能動手去執行”。WeKnora 想解決的是大模型落地時最現實的問題——知識躺在文檔裡,模型說得頭頭是道,但要把它們變成可驗證的結果,中間缺一雙手腳。anydoc 解析 + GraphRAG,把雜亂文檔變成知識圖譜第一個亮點是 anydoc 解析:PDF、Word、Markdown、網頁等多種格式可直接導入,無需預先轉換;配合 Wiki 模式,能把雜亂的文檔自動整理成結構化的知識體系。第二個是 GraphRAG。普通 RAG 靠向量檢索把相關片段撈出來拼給模型,GraphRAG 則更進一步——把實體和關係抽取出來建成圖譜,在回答“事物之間怎麼關聯”這類問題時,比純向量檢索靠譜得多。Skill Sandbox Runtime:知識可以被安全“執行”最值得關注的是 Skill Sandbox Runtime。知識庫中的內容可以被封裝成“技能”,運行在 Docker、E2B、CubeSandbox 等沙箱環境裡——這意味著知識不只是被“讀到”,而是能被安全地“執行”。模型可以從知識庫裡調用一個技能、在沙箱中跑一遍並返回可驗證的結果,而不是停在“我建議你怎麼做”。再加上長期記憶(Long-term Memory)功能,這套框架的意圖相當完整:解析、組織、檢索、執行、記憶形成一條龍。架構採用模塊化設計,可按需取用;許可證為 MIT,開源友好、商用無負擔,這也是它敢於面向“從個人到企業”場景的底氣。相關推薦雙節前後 10 多款大模型蓄

APUS 開源國內首批Jev跨平臺復現:國產模型實現秒級決策
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> APUS 開源國內首批Jev跨平臺復現:國產模型實現秒級決策 量子位的朋友們 2026-09-20 16:30:32 來源:量子位 9月19日,中國人工智能企業APUS旗下 AI 實驗室公佈了全球最早一批針對Jev的獨立開源復現成果 9月19日,中國人工智能企業APUS(麒麟合盛網絡技術股份有限公司)旗下 AI 實驗室公佈了全球最早一批針對Jev的獨立開源復現成果,幷包裝成了開箱即用的Agent Skill fast-browser-use,支持純本地模型離線執行。該項目支持macOS、Linux、Windows三大主流桌面與服務器操作系統,既可以在GPU服務器上運行,也可以在沒有GPU的Mac和PC上運行。全部代碼以MIT協議向全球開發者開放。 什麼是Jev與”決策模型”? Jev之名取自19世紀經濟學家傑文斯(Jevons),暗合”傑文斯悖論”:智能使用成本的暴跌,將帶來智能用量的暴漲。該模型面向智能體(Agent)運行中最高頻的一類需求,即分類、選擇、評分、真偽判斷,直接返回類型化答案與置信概率,而非逐字生成文本。業內認為,這一路線驗證了Agent架構的”快慢分工”:昂貴的大模型負責規劃等”慢思考”,高頻、原子化的”快判斷”交給輕量決策模型完成。負責組裝與調度這套分工的工程層,在業界被稱為Harness。 APUS復現了什麼? APUS完整實現了Jev底層決策範式,並將其完整落地於最具代表性的瀏覽器自動化(Browser-use)場景。APUS基於Jev公開文檔展示的輸入範式與評估邏輯,分析出了其“跳過自迴歸解碼、隱狀態直接打分”的核心邏輯。

谷歌AI首次“越獄”:竟然自己破解密碼入侵三家公司!
? 來,一起看下Gemini新鮮出爐的事故。 事情的起因,是一家名叫Irregular的AI安全公司,組織了一場“奪旗”(Capture the Flag)演練,要求是讓模型從一家虛構的公司系統裡拿到一段秘密信息。 而這個測試環境原本不應該具備聯網能力的,但問題也恰恰出在了這裡。由於一些bug,公網訪問被意外打開了;更巧的是,演練裡設定的那家虛構公司,和現實中一家真實企業重名。

Anthropic 把 IPO 推到 11 月:2 萬億美元估值劍指 SpaceX 紀錄,安全警告成上市前的"護身符"
據《華爾街日報》9月19日報道,這家 Claude 開發商計劃將首次公開募股推遲到11月,比許多投資者此前押注的10月晚了一步。知情人士透露,部分顧問認為多等一個月,能讓公司把第三季度的財務數據擺上桌,用真金白銀證明自己的競爭地位——這紙報表,正是當下最硬的說服工具。

消息稱 Anthropic 擬在 IPO 前推出新模型,應對 GPT-6 Astra 衝擊
此事發生在公司籌備 IPO 前夕——就在此前,其首席執行官還呼籲整個 AI 行業放緩技術迭代的腳步。消息人士稱,推新模型意在直面來自直接競爭對手的壓力。此前,Anthropic CEO 達里奧·阿莫代伊已向全球 AI 業界發聲,呼籲行業放慢新能力發佈節奏、妥善處理安全風險。