GPT-6 Astra 聯手人類攻破重大進展級數學難題:AI 不再只是解題機,成了規律發現者
AI資訊AI新閒資訊正文GPT-6 Astra 聯手人類攻破重大進展級數學難題:AI 不再只是解題機,成了規律發現者發布於AI新閒資訊時間 :Sep 20, 2026閱讀 :1分鐘在全球頂級 AI 數學基準 FrontierMath 上,一道懸了九年、自2017年就被拋出的"重大進展"級開放難題被拿下——而這次的功臣是 GPT-6Astra 與三位人類研究員的人機組合。題目問的是批准式委員會選舉裡"核是否為空",本意是尋找"核為空"的反例,GPT-6Astra 卻反過來證明:這樣的反例根本不存在,也就是說絕對公平的委員會在任何情況下都必定存在。
更漂亮的是,模型還順手發明瞭一套基於"調和熵"的全新投票規則,給出多項式時間的算法,證明局部最優解就已經滿足"核"的要求。在這輪協作裡,人類負責定方向、把邏輯關,AI 則頂起知識庫、計算演練和那些跳躍式的靈感——分工像極了一個配合默契的研究組。這是 AI 頭一回摘下"重大進展"級數學難題,意義不只是多解了一道題。它把大模型從"解題機器"的位置往前推了一格,變成了能參與發現數學規律的合作者;連維護榜單的 Epoch AI 都為此新增了"Human + AI"狀態標籤,專門給這種人機聯名的研究成果留了位置。當數學家開始扮演"提示詞工具人"的角色,科研這條路的寫法,正在被悄悄改寫。
相關推薦B 站上線“AI 無限競技場”:百大模型同臺 PK,GPT-6 Astra 暫居榜首B站上線“AI無限競技場”大模型測評榜並公佈首輪結果:GPT-6 Astra在10位UP主測評中登頂,力壓GLM-5.3獲“榜首次數冠軍”;前五名中國產大模型佔三席。該榜由各領域UP主對上百個大模型進行真實場景實測,覆蓋代碼、推理、協作、知識等主題,不設固定命題。Sep 20, 202681.4kB站上線"AI 無限競技場"測評榜:上百模型同場廝殺,GPT-6 暫坐頭把交椅B站推出“AI無限競技場”測評榜,彙總10位UP主對上百個大模型的真實場景實測,覆蓋代碼、推理、協作、知識等。
首輪榜單中GPT-6Astra居首並獲“登頂次數冠軍”,GLM-5.3次之;前五國產佔三席,與海外模型貼身競爭。該榜單不同於傳統跑分,更強調真實應用表現。Sep 20, 2026122.6kUnity 官宣 Claude Code 與 Codex 插件:31 項開發技能把 AI 代理綁上游戲引擎Unity發佈官方Claude Code與OpenAI Codex插件,為AI編程代理配備開發技能;Codex版含31項技能,支持新建項目及遷移至URP,適配Unity6及以上。此舉針對通用AI寫Unity代碼常參照過時教程的問題。Sep 20, 2026128.
3k馬斯克放豪言:AI 將使明年美國 GDP 增速翻番至 4%馬斯克預測AI將使美國明年GDP增速從約2%翻倍至4%或更高,與主流機構觀點相悖。晨星認為2027年經濟增速將放緩,美聯儲加息增加不確定性;阿波羅預計2027至2029年AI資本支出或達GDP的3%;穆迪關注2027年美國科技企業芯片相關投入。Sep 20, 2026123.6k特朗普宣佈組建“人工智能部隊”:AI 未來或佔美國 GDP 的 25%據央視新聞報道,美國總統特朗普9月19日在社交媒體宣佈將組建“人工智能部隊”,並將任命一名人工智能事務“總管”。
他稱人工智能代表下一場工業革命或互聯網浪潮,規模與影響力更大,甚至可能佔美國GDP的25%。他還抨擊民主黨人“企圖摧毀AI”。Sep 20, 2026149.8k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026
Related
相關文章

微信 AI 團隊開源 WeKnora:知識庫不再只“動嘴”,還能在沙箱裡“動手”
AI資訊AI新聞資訊正文微信 AI 團隊開源 WeKnora:知識庫不再只“動嘴”,還能在沙箱裡“動手”發佈於AI新聞資訊發佈時間 :2026年9月20號 16:22閱讀 :1分鐘微信 AI 團隊正式開源了知識管理框架 WeKnora(維娜拉),最新發布的 0.8.0 版本已全面面向公眾開放使用。它的定位可以概括為一句話:讓知識庫不只是“能查到答案”,而是“能動手去執行”。WeKnora 想解決的是大模型落地時最現實的問題——知識躺在文檔裡,模型說得頭頭是道,但要把它們變成可驗證的結果,中間缺一雙手腳。anydoc 解析 + GraphRAG,把雜亂文檔變成知識圖譜第一個亮點是 anydoc 解析:PDF、Word、Markdown、網頁等多種格式可直接導入,無需預先轉換;配合 Wiki 模式,能把雜亂的文檔自動整理成結構化的知識體系。第二個是 GraphRAG。普通 RAG 靠向量檢索把相關片段撈出來拼給模型,GraphRAG 則更進一步——把實體和關係抽取出來建成圖譜,在回答“事物之間怎麼關聯”這類問題時,比純向量檢索靠譜得多。Skill Sandbox Runtime:知識可以被安全“執行”最值得關注的是 Skill Sandbox Runtime。知識庫中的內容可以被封裝成“技能”,運行在 Docker、E2B、CubeSandbox 等沙箱環境裡——這意味著知識不只是被“讀到”,而是能被安全地“執行”。模型可以從知識庫裡調用一個技能、在沙箱中跑一遍並返回可驗證的結果,而不是停在“我建議你怎麼做”。再加上長期記憶(Long-term Memory)功能,這套框架的意圖相當完整:解析、組織、檢索、執行、記憶形成一條龍。架構採用模塊化設計,可按需取用;許可證為 MIT,開源友好、商用無負擔,這也是它敢於面向“從個人到企業”場景的底氣。相關推薦雙節前後 10 多款大模型蓄

APUS 開源國內首批Jev跨平臺復現:國產模型實現秒級決策
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> APUS 開源國內首批Jev跨平臺復現:國產模型實現秒級決策 量子位的朋友們 2026-09-20 16:30:32 來源:量子位 9月19日,中國人工智能企業APUS旗下 AI 實驗室公佈了全球最早一批針對Jev的獨立開源復現成果 9月19日,中國人工智能企業APUS(麒麟合盛網絡技術股份有限公司)旗下 AI 實驗室公佈了全球最早一批針對Jev的獨立開源復現成果,幷包裝成了開箱即用的Agent Skill fast-browser-use,支持純本地模型離線執行。該項目支持macOS、Linux、Windows三大主流桌面與服務器操作系統,既可以在GPU服務器上運行,也可以在沒有GPU的Mac和PC上運行。全部代碼以MIT協議向全球開發者開放。 什麼是Jev與”決策模型”? Jev之名取自19世紀經濟學家傑文斯(Jevons),暗合”傑文斯悖論”:智能使用成本的暴跌,將帶來智能用量的暴漲。該模型面向智能體(Agent)運行中最高頻的一類需求,即分類、選擇、評分、真偽判斷,直接返回類型化答案與置信概率,而非逐字生成文本。業內認為,這一路線驗證了Agent架構的”快慢分工”:昂貴的大模型負責規劃等”慢思考”,高頻、原子化的”快判斷”交給輕量決策模型完成。負責組裝與調度這套分工的工程層,在業界被稱為Harness。 APUS復現了什麼? APUS完整實現了Jev底層決策範式,並將其完整落地於最具代表性的瀏覽器自動化(Browser-use)場景。APUS基於Jev公開文檔展示的輸入範式與評估邏輯,分析出了其“跳過自迴歸解碼、隱狀態直接打分”的核心邏輯。

谷歌AI首次“越獄”:竟然自己破解密碼入侵三家公司!
? 來,一起看下Gemini新鮮出爐的事故。 事情的起因,是一家名叫Irregular的AI安全公司,組織了一場“奪旗”(Capture the Flag)演練,要求是讓模型從一家虛構的公司系統裡拿到一段秘密信息。 而這個測試環境原本不應該具備聯網能力的,但問題也恰恰出在了這裡。由於一些bug,公網訪問被意外打開了;更巧的是,演練裡設定的那家虛構公司,和現實中一家真實企業重名。

Anthropic 把 IPO 推到 11 月:2 萬億美元估值劍指 SpaceX 紀錄,安全警告成上市前的"護身符"
據《華爾街日報》9月19日報道,這家 Claude 開發商計劃將首次公開募股推遲到11月,比許多投資者此前押注的10月晚了一步。知情人士透露,部分顧問認為多等一個月,能讓公司把第三季度的財務數據擺上桌,用真金白銀證明自己的競爭地位——這紙報表,正是當下最硬的說服工具。

消息稱 Anthropic 擬在 IPO 前推出新模型,應對 GPT-6 Astra 衝擊
此事發生在公司籌備 IPO 前夕——就在此前,其首席執行官還呼籲整個 AI 行業放緩技術迭代的腳步。消息人士稱,推新模型意在直面來自直接競爭對手的壓力。此前,Anthropic CEO 達里奧·阿莫代伊已向全球 AI 業界發聲,呼籲行業放慢新能力發佈節奏、妥善處理安全風險。