OpenAI Astra用2000美元拿下10道世紀難題,數學家的定義被改寫了嗎?

2026年8月3日 18:23
OpenAI Astra用2000美元拿下10道世紀難題,數學家的定義被改寫了嗎?

重點摘要

好的,這是一篇按照您的要求重新撰寫的完整新聞稿。 --- ## OpenAI Astra用2000美元拿下10道世紀難題,數學家的定義被改寫了嗎? 2026年8月1日,OpenAI拋出了一枚足以震撼全球數學界的重磅炸彈。其下一代主力模型Astra(目前仍為內部版本)在數學與理論計算機科學領域一口氣取得了十項重大突破,涵蓋高維幾何、編碼理論、群論、算子代數、量子複雜度、格密碼學與極值組合學等多個前沿方向。

站內 AI 整理稿

好的,這是一篇按照您的要求重新撰寫的完整新聞稿。 ---

## OpenAI Astra用2000美元拿下10道世紀難題,數學家的定義被改寫了嗎? 2026年8月1日,OpenAI拋出了一枚足以震撼全球數學界的重磅炸彈。其下一代主力模型Astra(目前仍為內部版本)在數學與理論計算機科學領域一口氣取得了十項重大突破,涵蓋高維幾何、編碼理論、群論、算子代數、量子複雜度、格密碼學與極值組合學等多個前沿方向。這些難題無一例外,都是學術界公認的“硬骨頭”,每道題都沉默了超過十年,核心進展長期停滯,甚至包括多個困擾頂尖數學家數十年的世紀猜想。 消息傳出後,數學圈的第一反應不是歡呼,而是長時間的沉默與反覆的核對。因為這次,AI的角色發生了根本性的逆轉。過去,AI總被視為“算得飛快的計算器”,人類提供思路,機器負責計算;而這一次,完整的論證過程由模型自主生成,人類的角色徹底退居為整理者與驗證者。更刺痛神經的是其驚人的成本——按OpenAI自家Sol API的費率折算,找出這十個完整解法的Token總費用僅約2000美元。平均一道題200美元,這個數字還不到北美一名研究生一週的津貼,卻看起來輕而易舉地改寫了延續百年的數學研究成本賬本。 當日,Anthropic研究員半年前的調侃——“下週頒發的菲爾茲獎,可能是最後一個頒發給人類的菲爾茲獎”——被反覆提及,似乎正以一種出人意料的速度變成現實。 ### 十道硬骨頭:從非sofic群到高維堆積的歷史性突破

在Astra的這十項成果中,有幾項的重量級突破值得單獨拎出來放在聚光燈下。最為重磅的,當屬對“非sofic群”存在性的構造。早在1999年,阿貝爾獎得主Mikhail Gromov拋出了“sofic群”這一深刻概念,其核心問題簡潔而致命:任何一個無限複雜的群,是否都能用有限置換去局部逼近它的乘法表?這個看似不食人間煙火的問題,實際牽動著一整片數學疆域的神經。sofic熵理論、動力系統遍歷論、算子代數等一系列核心分支,全部懸繫於這個問號之上。然而,27年來,無數頂尖數學家前赴後繼試圖尋找反例,全都無功而返。Astra則另闢蹊徑,直接從數學工具箱中拎出了二元Leavitt代數的單位群,將Kun-Thom擴展圖理論與Thompson群V巧妙地糅合在一起,硬生生逼出了一個決定性的矛盾,一舉終結了這場長達四分之一世紀的追獵。 同一賽道上的另一顆重磅炸彈,是對1982年菲爾茲獎得主Alain Connes剛性猜想的直接證偽。Connes曾以極大的氣魄斷言,某些群可以由它們的von Neumann代數唯一決定,這被視為算子代數領域的基石性直覺。然而Astra直接推翻了這一斷言。通過構造一個可數無限的群族,AI證明了這些群彼此之間互不同構,長得完全不一樣;但詭異的是,它們各自的von Neumann代數卻完完全全相同。整個構造過程中最為關鍵的一步,在於Astra極具洞察力地區分了兩種極易混淆的共軛關係——可測共軛與代數共軛。在過去,許多數學家習慣性地將它們視為一體,而Astra通過嚴謹的邏輯將兩者徹底分離。這個區分一旦確立,後續的構造便如高屋建瓴,順理成章。 與此同時,停滯了長達46年的高維球體堆積問題也被正面擊穿。在n維空間中如何將相同大小的球體堆積得最為緊密,這個問題本身通俗易懂,但卻難如登天。2022年,烏克蘭數學家Viazovska因為解出了8維與24維的精確堆積密度而榮獲菲爾茲獎,可其他維度的密度上限卻一直如同鐵板一塊。1978年,蘇聯數學家Kabatiansky與Levenshtein給出一個著名的上界,此後整整半個世紀,再也無人能向前推進哪怕一寸。Astra這次精確計算出了Cohn–Elkies線性規劃的指數衰減率,意味著它把那個卡了全球數學家46年的Kabatiansky–Levenshtein界,首次推開了歷史性的一毫米。 此外,Astra還在組合數學領域一口氣解決了傳奇數學家埃爾德什(Erdős)留下的三道經典開放問題,包括著名的第183號多色拉姆齊數、第146號與第180號極值圖論猜想;在算術電路複雜性方面給出了n⁴/log n量級的新下界;在量子複雜度理論中證明了通用雙人量子博弈的指數並行重複定理;並在格密碼學的基礎問題上證明了最近向量問題的多項式因子近似困難性。曼徹斯特大學數學家Thomas Bloom事後評價道,這次集中發佈的十項結論,其整體學術價值遠超五個月前OpenAI證偽“埃爾德什單位距離猜想”的單次成果。 ### 數學界與AI圈的集體震動與冷靜旁觀

Astra的公佈如同在平靜的學術深潭中丟入了一塊巨石,全球學術界與科技業陷入一片震動。頂尖數學家的反應非常直接。羅格斯大學傑出教授、美國數學學會成員Alex Kontorovich在社交媒體上的評價只有兩個驚歎號。菲爾茲獎得主、劍橋大學教授Timothy Gowers則直言:“如果這些證明通過了完整的同行評議,我們將需要重新思考'做數學'意味著什麼。”牛津大學數論教授Thomas Bloom也感嘆:“25年前我們還在用紙筆推公式,現在AI竟然直接證明了非sofic群。”數學家兼AI研究者Ilya Glazer說得更為徹底:“數學家的定義被改寫了。”

AI圈內部同樣為之震動。OpenAI首席研究科學家Noam Brown表示:“測試時計算還遠未見頂——我們一直低估了推理期間投入更多算力的價值。”微軟研究院副總裁Sebastien Bubeck的感慨則帶有一絲個人化色彩:“我不敢相信我們真的做到了。非sofic群從'幾乎不可能被證明'的列表中劃掉了。”獨立評估機構Epoch AI則強調,他們採取了前所未有的隔離措施,確保這些競賽題目絕對沒有出現在任何公開的訓練數據中——Astra展現的是真正的數學創造力,而非檢索能力。 然而,在一片讚歎聲中,刺耳的質疑聲同樣無法忽視。認知科學家Gary Marcus立刻潑來一盆冷水。他在個人博客發文指出,圍繞Astra的討論正在犯一個經典的合成謬誤:把“模型在特定數學任務上的表現”誇大成“通用智能的躍遷”。Marcus的邏輯很平實:一個擅長數學的人並不能在寫作或理解人際關係上自動成為天才。Astra的確擅長某些數學問題,但這不意味著它能避免模型幻覺,更不意味著它能解決其他生成式AI系統普遍存在的可靠性問題。他甚至尖銳地補充:“它甚至不意味著它能可靠地讀取PDF。”

### 狂歡背後的四道冷靜關卡

熱鬧歸熱鬧,在為AI歌功頌德之前,至少有四件事值得我們冷靜下來看一看。 第一,Astra是尚未發佈的內部模型。OpenAI對外展示的是精選後的10道成功題目,我們無從得知團隊究竟嘗試了多少道題、失敗了多少次。Noam Brown自己也坦承,他們曾試探過黎曼猜想等級的千禧年難題,目前尚未成功。那些未被展示的暗面,才是評估AI真實能力上限的關鍵。 第二,同行評議尚未完成。截至目前,Astra的數學成果尚未通過傳統學術期刊嚴格的同行評議。有數學家指出,OpenAI在國會山的演示更像一場“精心策劃的營銷事件”。“攻破難題”與“被數學界正式確認”之間,還隔著一個完整的獨立複核週期。在沒有同行評議之前,任何聲稱都只能算是技術公司的一面之詞。 第三,Lean驗證通過並不等於證明原創。OpenAI已在GitHub上公開了十項結果的Lean形式化證明文件,官方形式化清單顯示,主要證明的sorry_count為0——也就是說沒有留白、沒有跳步。但這套驗證系統能保證的,僅限於推導本身在邏輯上沒有漏洞。一個更為本質的問題是:從數學家的原始猜想到Lean能讀懂的形式化命題,這個翻譯過程究竟有沒有走樣?證明的方法夠不夠新?結果在整個學科中的真實分量如何?這些問題Lean無法回答,只能依靠人類數學家的價值判斷。形式化系統能做的,只是逐行檢查推理鏈條的合法性,它無法判斷模型是否真正“理解”了其在做什麼。 第四,2000美元僅為推理成本。這個驚人的數字只計算了Token損耗,按Sol API價格折算。而模型的訓練成本(數十億美元級)、頂級研發團隊的薪資、選題方向的研究、數學家的參與費用以及龐大的基礎設施投入,統統未納入其中。官方倉庫另註明,將這些證明整理成Lean形式化文件,前後花費了一週時間。將“2000美元拿下菲爾茲獎級難題”當作標題,多少有將毛利率當作成本價的意味。 ### 數學的經濟學正在改寫

拋開狂熱宣講與技術質疑,Astra此次事件真正的歷史坐標,或許不在這10道題目本身,而在於三件更為底層的變革。 第一,它第一次將“提出論證、整理論證、機器驗證”三件事串聯成了一條完整的流水線。過去,大模型在數學領域充其量只是個算得快的計算器,查文獻、潤色證明、寫代碼。而Astra完全改變了遊戲規則:論證由模型自己生成,人類與模型一同整理成論文,再由模型將每一道步驟轉化為Lean形式化證明證書。這意味著數學研究裡最核心的兩道關口——“把答案想出來”與“確認答案沒想錯”——第一次被同一個模型同時攻破。 第二,它將AI的能力證明從“benchmark分數”切換為“解決真正沒人解決過的問題”。這套新邏輯設計得非常聰明:未解難題沒有標準答案,沒有洩露風險,沒有過度擬合的可能。你出一道沒有前人解過的難題,我解了,這就是最好的能力證明。但它也有一個致命的軟肋:驗證權到底在誰手裡?“此前無人解決”這句話的驗證機制是什麼?由誰來獨立複現?這些問題在OpenAI的公告中沒有得到完全回答。在沒有獨立驗證之前,“解了10道數學題”只能作為一個強有力的營銷信號,而尚不能構成一個完整的科學事實。 第三,Altman優先選擇在華盛頓進行演示,這個細節透露了更多信息。Astra的這次發佈,首先是講給政策制定者聽的,其次才是講給開發者聽的。理由非常清晰:AI政策的走向,高度取決於政策制定者是否相信AI公司有能力管理好前沿技術的風險。如果OpenAI能持續向政府展示“我們的AI能解決人類未解決的難題”,那麼這個敘事在獲取政策信任、規避過度干預方面,將擁有直接且巨大的價值。Astra系列模型預計將成為首批須經特朗普政府新版AI框架審查的產品,該框架要求AI公司在向公眾發佈模型前,須事先向美國政府提交備案。 所以,Astra真正的意義,或許不是“AI即將捧起菲爾茲獎”,至少在今日,它還沒有。真正被撼動的,是數學研究的經濟學根基。過去,一個頂級團隊可能耗費五年心血才攻下一道難題;現在,幾千美元就能批量掃蕩候選答案。OpenAI同期宣佈向10萬名科學家和數學家免費開放其最強模型的使用權,這顯然不僅是慈善,更是在搶佔下一代科研入口的制高點。 陶哲軒在2026年國際數學家大會上的那句預言——“從證明稀缺到證明過剩”——如今被提早命中。當一台中端筆記本電腦的算力便能批量生產經機器驗證的數學證明,這個世界稀缺的不再是“能不能證出來”,而是“我們還想問出什麼值得被證明的問題”。2000美元在市場上或許可以買到十個定理的嚴謹證明,可是購買不回那個深夜裡,人類望向虛空並追問“為什麼是這個問題”的瞬間。而那個瞬間,或許依然屬於人類。

Related

相關文章

智元下架了首席科學家羅劍嵐

智元機器人首席科學家羅劍嵐,從官網合夥人團隊名單中消失了。 36氪旗下「量子位」8月3日傍晚獨家發現,智元機器人官網最新披露的合夥人團隊成員名單,已不再包含羅劍嵐的名字。而在2025年9月智元首次對外公開合夥人團隊時,羅劍嵐的身份赫然在列,職務為「合夥人、高級副總裁兼首席科學家」。這一變化,意味著這家正籌備港股IPO的明星機器人公司,其核心技術領導架構在上市前夕出現了重大調整。 官網名單變動之前,社交媒體上其實已經陸續出現羅劍嵐可能離職的討論。如今,當他的名字正式從智元官方頁面移除,傳聞可謂多了一層最直接的佐證。

剛剛

估值40億美元,半年翻6倍,今年融資最猛的AI應用公司,竟然在賣保險

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦廣東最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作估值40億美元,半年翻6倍,今年融資最猛的AI應用公司,竟然在賣保險硅基觀察Pro·2026年08月03日 19:27保險行業,迎來了AI變量 這可能是今年融資最猛的AI應用公司。 今年以來,Corgi連續完成4輪融資,估值則從年初的6.3億美元一路漲到40億美元,半年翻了6倍多。即使不計算最新一輪,Corgi的累計融資也已經超過3.74億美元。 投資人之所以如此看好,是因為Corgi的增長速度實在太快了。 2025年7月,Corgi剛剛獲得承保業務所需的完整監管批准。到2026年1月,公司披露的年化收入運行率已經超過4000萬美元。4個月後,Forbes稱這一數字進一步突破1億美元。 Corgi給出的目標更加激進:到2026年底,年化收入運行率達到4.5億美元。相比年初,翻了接近10倍! 但增長快,還不是Corgi最有意思的地方。它真正特別之處在於,幾乎每一步都在和傳統保險公司反著走。 傳統商業保險不願意服務小微企業,Corgi偏偏盯上了創業公司。 過去,由於服務性價比過低,微企業便成了一塊傳統保險公司不太願意碰的市場。在美國,傳統商業險對早期創業公司的覆蓋率不足20%。 Corgi的打法,是用AI把報價、核保、

剛剛

被金融黑灰產逼急的銀行風控,開始用AI測謊

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦四川最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作被金融黑灰產逼急的銀行風控,開始用AI測謊36氪的朋友們·2026年08月03日 19:28讓銀行、助貸平臺沒想到的是,貸款中介從個人信用修復舉措中發現了“機會”——通過提供高息民間借款幫助借款人修復個人信用,然後“引導”借款人前往正規金融機構申請更大額度的貸款。 自2026年7月中旬起,汪宇接到一項緊急工作,配合技術部門迅速將“智能線上面審”技術嵌入現行的個人消費信貸風控審批流程。 作為一家農商行華東地區分行的風控人員,汪宇近幾日與技術部門同事待在一起,評估上述技術的具體應用成效。例如,在風控系統向借款人詢問“在去年12月至今年3月,你修復個人信用所償還的逾期貸款資金,是不是來自工作收入或家人親友支持”後,AI(人工智能)能否捕捉借款申請人回答“是”那一刻的表情變化,準確判斷其是否在撒謊。 一旦被AI判定為“撒謊”,相關個人消費貸款申請將被從嚴審核,有較高概率被否決。 最近兩週,作為一家助貸平臺的運營總監,劉偉忙著與其他助貸平臺、持牌消費金融機構磋商加強逾期客戶名單共享,以便能及時發現在其他金融機構已經還款逾期的借款人是否跑來他們這裡申請貸款。“我們將這項工作稱為撞庫。當前若想防範貸款逾期風險,離不開它。”劉偉說

剛剛

再刷新全球觸覺感知最大融資金額!帕西尼再獲10億元戰略輪融資

再刷新全球觸覺感知最大融資金額!帕西尼再獲10億元戰略輪融資 在具身智能賽道持續升溫的2026年,感知層領域迎來了一筆具有里程碑意義的鉅額融資。8月3日,36氪獲悉,帕西尼感知科技(以下簡稱「帕西尼」)正式宣佈完成10億元戰略輪融資。至此,截至第三季度,帕西尼累計融資金額已達35億元,一舉刷新全球觸覺感知領域的融資紀錄。這一數字不僅使其以絕對優勢斷層領跑全球具身感知賽道,更標誌著觸覺感知這一細分方向正式上升為資本博弈的戰略高地。

剛剛

宇樹的光環有多重?

宇樹科技以約420億元估值快速通過科創板審核,即將成為「A股人形機器人第一股」,創下最快審核紀錄。然而,參考優必選、寒武紀等硬科技股上市後股價大幅回落的案例,宇樹的商業化進展、營收結構及市場情緒將決定其能否避免「上市即巔峰」的宿命。

剛剛

AI花錢大賽:亞馬遜收錢,蘋果在買單

亞馬遜因AI投資能轉化為實際收入,股價大漲;蘋果因存儲晶片漲價導致利潤率下滑,股價重挫。30年期美債收益率升至5.27%,推高AI產業融資成本,市場開始檢視各公司AI投資的回報率。

剛剛