B站上線"AI 無限競技場"測評榜:上百模型同場廝殺,GPT-6 暫坐頭把交椅

AI資訊AI新聞資訊正文B站上線"AI 無限競技場"測評榜:上百模型同場廝殺,GPT-6 暫坐頭把交椅發佈於AI新聞資訊發佈時間 :2026年9月20號 14:13閱讀 :1分鐘B站今天端出了一塊大模型擂臺——"AI 無限競技場"測評榜,並同步亮出首輪排行榜。在10位 UP 主的真機實測裡,GPT-6Astra 拿下榜首、並且搶下"登頂次數冠軍",把 GLM-5.3壓在身後;前五名裡國產大模型佔了三席,和海外巨頭貼身肉搏。這塊競技場和傳統跑分榜的玩法不一樣。
它把 B站 各領域 UP 主對上百個大模型的真實場景實測匯成一個廣場,涵蓋代碼、推理、協作、知識等多種主題,而且不設固定的測評維度限制——來自不同分區的創作者拿真實工作流、專業應用乃至趣味腦洞自主命題,讓模型在同題 PK 裡把實際差距攤開給人看。DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千問、Hy、MiniMax 等主流模型都在對比之列,排名實時刷新,並持續向全站 UP 主開放報名。B站 押注這塊榜單,底氣來自平臺上 AI 內容的爆發。過去一年,B站 AI 知識內容消費時長同比增長72%,月均觀看 AI 內容的用戶超過1.
9億,圍繞模型發佈、討論、測評、使用、求助、共建的內容已經成體系。當模型迭代快到跑分榜追不過發佈節奏,把評測權交還給真實創作者和真實工作流,反而更貼近用戶心裡那句"到底哪個好用"——B站 想做的,是把自家的社區生態變成大模型走向大眾的另類裁判臺。相關推薦 Anthropic考慮推出新模型,擬應對OpenAI GPT-6Astra競爭路透社稱,Anthropic籌備IPO期間擬推新AI模型,以應對OpenAI GPT-6Astra在企業市場的競爭,但安全性仍在評估,發佈時間未定。此舉與其CEO阿莫代9月12日呼籲放緩AI能力迭代、重視安全的主張形成對照。2026年9月20號 9:50146.
0kOpenAI 宣佈 GPT-5.5 將於 10 月 14 日下線:ChatGPT 與 Codex 同步移除OpenAI宣佈GPT-5.5將於10月14日從ChatGPT、ChatGPT Work及Codex下線,覆蓋所有訂閱方案。官方提醒Codex用戶儘快切換至GPT-5.6 Sol或GPT-6 Astra。此次停用涉及全部計劃,替代模型為上述兩個。該模型於今年4月24日推出,較GPT-5.4在同等任務上有所優化。2026年9月16號 9:22178.9kGPT-6 Astra 模擬經營售貨機一年狂賺 1.
5 萬美元,成績碾壓 Claude 近 3 倍Andon Labs的Vending-Bench2測試中,AI以500美元模擬經營售貨機一年。GPT-6 Astra平均賬戶餘額達15515美元首次登頂,最差一輪也超過Claude Fable5.1最佳表現。差距不僅在於盈利,更在策略:Astra持續壓低採購價,一度砍至原價約48%。2026年9月15號 9:54256.6kGPT-6 Astra展現恐怖統治力:模擬售貨機一年狂攬1.5萬美元,成績碾壓Claude近3倍Andon Labs的Vending-Bench2測試中,AI代理用500美元模擬經營自動售貨機一年。
GPT-6Astra平均餘額達15515美元,最差一輪也超Claude Fable5.1最好成績,首次登頂,優勢體現在供應鏈管理和規則執行力。2026年9月14號 17:45217.4kOpenAI發佈金融服務版ChatGPT:集成GPT-6 Astra重構投行核心業務OpenAI於9月10日推出ChatGPT for Financial Services,聯合摩根士丹利與Evercore開發,聚焦投資銀行和股票研究場景,標誌大模型深入金融機構核心業務。該服務集成GPT-6 Astra推理能力,可高效處理海量數據。2026年9月11號 9:54328.
7k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026
Related
相關文章

全球基模決戰,AI圈休不了十一長假了
全球基模決戰,AI圈休不了十一長假了量子位·2026年09月20日 15:10Claude、Gemini、Kimi集體憋大招 現在就預告了——中秋和國慶的13天假期,可能會是今年AI圈最忙最炸的兩週。 盆友,別休了,別睡了,找好椅子癱坐吧。 「基模決戰周」,真要來了!! 硅谷那邊已經暗流湧動。 Anthropic的新Claude,灰測動靜早就傳得沸沸揚揚。 谷歌更是直接,Gemini 4 Pro疑似已經披著馬甲,偷偷混進Arena參加摸底考試了。 國內這邊,全卡在假期前瘋狂憋大招。 Kimi開始拿「K3.1」瘋狂打啞謎,DeepSeek下一張Pro牌已經提前寫進官方文檔,Qwen4也直接亮出了新架構。 而擂臺正中央,OpenAI月初才剛剛放出GPT-6 Astra——一款讓OpenAI提前給AGI開香檳的基模。 好傢伙,這架勢整得像大家提前約好了一樣: 該來的、可能來的、偷偷摸摸已經在考場裡的,全趕到了一塊兒。 節前最後一舞,Are you ready? 硅谷集體圍攻OpenAI GPT-6 Astra 硅谷這邊,A社、谷歌、馬斯克的Grok幾乎都有新動作傳出。 A社Claude 5.2箭在弦上 最先坐不住的自然還

肉眼看不出的幻覺?清華提出視覺源幻覺,僅用0.9%數據實現SOTA
肉眼看不出的幻覺?清華提出視覺源幻覺,僅用0.9%數據實現SOTA新智元·2026年09月20日 15:05清華提出視覺源幻覺及解法ACFT,提升多模態模型可靠性 多模態大模型的物體幻覺,長期被歸因於語言先驗。 先看下面兩組對話。 第一組,一張只有小狗的照片,問模型「圖中有椅子嗎」,它答「沒有,圖中是一隻狗」,完全正確; 第二組,另一張照片,問「圖中有餐桌嗎」,模型卻言之鑿鑿地回答「有一張餐桌,還有一個男孩站在它前面」,而畫面里根本沒有餐桌。 這就是困擾多模態大模型(MLLM)落地的物體幻覺:模型會「看見」並不存在的物體,或者對明明存在的物體視而不見。在自動駕駛、醫療輔助等高風險場景中,這種錯誤的代價可能非常高。 過去的主流解釋是:這都怪語言先驗。 模型在訓練語料裡見慣了「餐桌」和「男孩」共同出現,於是即便圖裡沒有,也順著語言統計規律說了出來。 但清華大學的研究團隊認為,這個解釋並不完整。 近日,來自清華大學的團隊在ACM MM 2026(第34屆ACM國際多媒體會議)論文中提出:當模型輸出很短時,比如只回答Yes/No,推理更依賴視覺模態,此時會浮現出另一套幻覺機制,它根植於視覺特徵提取本身。 研究人員將其命名為

GPT-6 Astra 聯手人類攻破重大進展級數學難題:AI 不再只是解題機,成了規律發現者
題目問的是批准式委員會選舉裡"核是否為空",本意是尋找"核為空"的反例,GPT-6Astra 卻反過來證明:這樣的反例根本不存在,也就是說絕對公平的委員會在任何情況下都必定存在。更漂亮的是,模型還順手發明了一套基於"調和熵"的全新投票規則,給出多項式時間的算法,證明局部最優解就已經滿足"核"的要求。

國產大模型企業半月「連籤三單」,中國 AI 出海正在加速
本文作者: 胡清文 2026-09-20 14:50 導語:MiniMax 提供了一個好的觀察樣本。今年 9 月,國產 AI 出海賽道迎來一波密集落地潮。短短半個月,沙特、硅谷、新加坡三地接連官宣了與 MiniMax 的合作項目。

階躍星辰 Step 5 Preview 全量開放:600B 參數打平 K3 級性能,新用戶最長白嫖 75 天
今天該模型正式全量開放——API 和 Studio 已經可以使用,10 月 15 日還將發佈完整權重模型。Step 5 Preview 是階躍星辰推出的旗艦模型,採用稀疏 MoE 架構,總參數 600B,每次僅激活 27B,支持 100 萬 Token 上下文和圖文輸入。

B 站上線“AI 無限競技場”:百大模型同臺 PK,GPT-6 Astra 暫居榜首
其中 GPT-6 Astra 在 10 個 UP 主測評中拿下榜首,打敗 GLM-5.3 獲得“榜首次數冠軍”;前五名中,國產大模型佔據三席。據 B 站介紹,“AI 無限競技場”是一個彙集 UP 主 AI 大模型測評的競技廣場,由各領域 UP 主對上百個大模型的真實場景實測構成,涵蓋代碼、推理、協作、知識等多種測評主題。