OpenAI公開62頁核心手稿,AI連破十大「菲爾茲獎級」難題

2026年8月4日 16:24
OpenAI公開62頁核心手稿,AI連破十大「菲爾茲獎級」難題

重點摘要

OpenAI公開一份62頁核心手稿,詳細展示下一代模型Astra如何獨立破解十大「菲爾茲獎級」數學難題,燒掉的Token成本僅約2000美元。手稿揭露了AI重構解題思路的過程,包含高維球體堆積、非sofic群等多年未解的重大問題。OpenAI強化學習負責人形容此事比任何時刻都更像「奇點前夜」。

站內 AI 整理稿

OpenAI 今天(4 日)無預警公開一份長達 62 頁的核心手稿,標題為《How the Ideas Came Together》,完整揭露旗下 AI 模型破解十道頂級數學難題的推演過程。這份文件最驚人的地方在於,全文由 AI 模型獨立撰寫,OpenAI 團隊完全沒有插手,而燒掉的 Tokens 若以 GPT-5.6 Sol API 計費標準換算,成本僅約 2000 美元。消息一出,立即在學界與社群引爆討論,許多人猜測這款代號 Astra 的下一代模型,很可能就是傳說中的 GPT-6。 這份手稿的摘要只有一小段,但資訊量相當驚人。根據說明,AI 在讀取原始的思維鏈(CoT)與最終成文的數學論文後,針對每一道題目重新建構出四個層面的內容:哪些想法最初指向可行路徑、哪些看似有分量的方法撞上真正的障礙、什麼樣的視角切換讓底層結構浮現,以及決定性的洞察最後如何構成完整論證。換句話說,這不是單純的解答展示,而是把整個思考過程攤在陽光下。 十道難題涵蓋範圍極廣,包括高維球體堆積、二元碼與球面碼、群論、Connes 剛性猜想、算術電路下界、量子並行重複、最近向量問題、Ehrhart 體積猜想、多色 Ramsey 數與極值圖論。在這之前,OpenAI 內部員工已在官方部落格透露下一代模型 Astra 攻克這些難題,並附上 249 頁的論文合集與完整的 Lean 4 形式化證書,如今 62 頁手稿正式公開,等於官方蓋章認證了這項突破。 在十道題目中,討論度最高的莫過於高維球體堆積問題。這個問題用白話講就是:把一堆一樣大的球塞進一個箱子裡,最多能塞多滿?三維空間的答案從水果攤壘橙子的堆法就能看出來,早就有了定論。但當維度拉到幾百維、上千維時,人類只能給出一個「上界」,也就是最多不可能超過多少。這個上界的指數一直卡在 0.5991,從 1978 年算起到現在,整整 46 年沒有實質推進。Astra 直接把它推到了 0.6044005442916776954…,密度上界寫成 2^-(0.6044…+o(1))d,堪稱重大突破。 關鍵在於它是怎麼做到的。手稿顯示,Astra 在推演過程中先確定了 Cohn–Elkies 線性規劃這套方法本身的極限。最初它嘗試用 Cauchy–Schwarz 不等式去估計某個函數的負質量,但做到極限只能達到半徑 √d/(2√π)。卡住之後,AI 做出了一個關鍵判斷:障礙不是常數沒優化好,而是全域範數根本記不住負質量落在哪裡。於是它決定更換視角,改用 Mellin 變換加調和測度。這個選擇有其深層原因:對徑向函數來說,傅立葉變換本質上就是 Hankel 變換,而它的核只依賴空間半徑與頻率半徑的乘積;到了 Mellin 這一側,這個操作會變成極其簡單的反射,再加上一個顯式相位。 手稿中還記錄了一個特別精妙的細節。那個相位因子在實軸上模長恆等於 1,因此在實軸上什麼都看不出來,但當它往外延拓到複平面時,攜帶的正是範數不等式丟掉的那部分高維資訊。推到極限時,調和測度收斂成一個 logistic 密度,其對數位勢精確等於 digamma 函數,積分出來正好是 log(π/2),1/π 這個閾值就是從這裡冒出來的。手稿還特別提醒,調和測度的總質量是 (1−σ)/2 而不是 1,要是太早把這個核換成機率密度,會改寫指數常數,導致整個證明失效。 拿到下界之後,還得構造出一個真正達到它的函數。Astra 的做法是先借助高斯給出的傅立葉對稱性,但發現鞍點位置不對,於是乘上一個偶的形變,讓鞍點移動同時不破壞對稱性。在把可用的阻尼吃滿之後,得到一個「理想剖面」,其鞍點位移積分靠 Wallis 乘積算出來,正好等於 −(1/2)log(π/2),這個數字把高斯的半徑 1/√(2π) 精確搬到 1/π,下界預測的半徑與上界構造出的半徑完美對上。手稿裡還有個很具體的註記:構造輔助函數時,遠處需要補一塊正的阻尼,而這塊補丁必須加在整個區間上,不能加在單點上,否則會撞上共振頻率。 第二道備受矚目的難題,是 27 年來無人能構造出的「非 sofic 群」。這個概念由阿貝爾獎得主、俄羅斯數學家 Mikhail Gromov 在 1999 年提出,「sofic」在希伯來語中代表「有限」。用大白話講,這個問題問的是:一個無限大的抽象結構,能不能被一堆「足夠大的有限洗牌操作」近似模擬出來?Astra 給出了顯式構造,答案是可以,存在一個無限的、有限表現的非 sofic 群。曼徹斯特大學數學家 Thomas Bloom 直言,在構造類成果裡,這比先前的單位距離猜想反例更加重大。 手稿最有價值的部分,是它寫清楚了真正的卡點所在。Kun 定理給的是許多個擴張圖,但 Kun–Thom 定理要求的是一個;「多」和「一」之間的這道坎,就是整章的核心難點。AI 稱之為「關鍵的錯配」(the crucial mismatch),並舉了一個例子說明為什麼不能隨便挑一個:在兩份完全相同的 Q 併起來(Q⊔Q)上,「交換兩份」這個操作跟擴張的 K 作用精確交換,但它不保持任何一個分量,那些「近似中心的東西」可以在分量之間來回跳,根本抓不住。在此之前,Astra 還走過一條彎路,試圖把 property (T) 直接轉成混合性,但修正平均雖然治好了譜問題,卻治不了「到底選哪個分量」。 最終版本以一個本質原則重寫:要平均的永遠是分量規模的有界單調函數,絕不能是無界的規模本身。具體做法是在每個環境擴張分量 A 裡取一個頂點加權的中位數 m_A,然後定義 f(x) = M(x) / (M(x) + m_A),其中 M 是分量規模。這個函數永遠落在 0 和 1 之間,而且 1/2 恰好是每個 A 上的中位數,等於把一個失控的量變成受控的量。關鍵在於生成元是置換,只挪位置、不增不減,走一圈總變化必然是零,而每步最多掉一點點,兩邊都被壓成可忽略。再按高度切開、對小的一側用擴張性兩頭一夾,f 幾乎處處等於 1/2,同一範圍裡所有塊的規模被夾得幾乎一樣大,才能一一對上號。收尾時還剩一小片區域,Astra 的處理相當反直覺——挑一片儘可能大的壞區域整個扔掉,正因為挑的是最大的那片,反而證明它小到可以忽略。Gromov 提出的問題,在 27 年後終於有了答案。 手稿公開後,OpenAI 強化學習團隊的大佬 Mo Bavarian 也在第一時間發文,開頭就形容這是一個「超現實」時刻。他回憶 2021 年團隊放出 GSM8K 資料集,那只是 8500 道小學數學應用題,簡單到只用 2 到 8 步就能解完,但在 GPT-2、GPT-3 的年代,AI 連小學數學題都做不穩,起草郵件已經算勉強夠用。誰也沒想到,短短幾年時間,大規模強化學習突飛猛進,當年那些看似不可逾越的技術死衚衕被一一擊碎。Mo Bavarian 直言:「對我而言,這一刻,比任何時候都更像奇點前夜。」從幾年前在小學應用題裡跌跌撞撞,到如今 2000 美元的 Tokens 就能換來十份可能寫進數學史的答案,奇點前夜,或許真的沒有那麼遙遠。

Related

相關文章

物理AI不是下一個風口,而是下一輪工業革命

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

開源版Claude Science來了,零依賴、MIT協議,內置30+項科研Skills

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛
鈦媒體生成式AI

首部AIGC故事片《奇譚》,究竟是怎麼做出來的?

首部AIGC故事片《奇譚》,究竟是怎麼做出來的?文娛先聲2026.08.04 17:56 · 來自北京全文4045字從製作流程到商業化路徑,《奇譚》的探索證明,AI影視的發展並非簡單替代傳統影視,而是在人工創意與AI能力結合下,重新定義影視生產方式。文 | 文娛先聲,作者 | 王燁 AI影視,迎來了首部獲得官方發行許可的長片作品。近期,《奇譚:紙刃渡荒墟》(以下簡稱《奇譚》)在愛奇藝正式上線。

剛剛

斷電0.01秒燒掉幾十萬:AI最隱秘的暴利賽道,中企瘋搶

AI 的運算能力正在成為這個時代最稀缺的資源,但支撐這一切運轉的,除了那些昂貴的圖形處理器(GPU),還有一套外界幾乎看不見的電力系統。每天有無數人對著人工智慧對話框輸入指令、要求生成圖片或影片,每一次請求的背後,都是成千上萬顆GPU在瞬間進入滿載狀態。這些晶片的用電模式和傳統數據中心截然不同,過去機房的電力負載相對平穩,現在AI的GPU則像一輛在怠速與全油門之間來回切換的跑車,用電量在毫秒級別內暴起暴落。

剛剛
智東西生成式AI

120萬星!開發者排隊“投簡歷”,DeepSeek一條內測帖,變成了Agent開源大摸底

DeepSeek的Agent Harness團隊負責人崔添翼於8月1日發文招募內測人員,吸引769位開發者提交712個開源倉庫,合計超過120萬Stars,涵蓋長任務執行、記憶管理與安全評測等Agent基礎設施方向。社區推測DeepSeek可能基於Harness打造對標Claude Code的AI Coding Agent,但官方尚未證實。這場招募意外揭露了Agent工程化的關鍵能力版圖,包括穩定執行、上下文管理與安全控制等挑戰。

剛剛
量子位生成式AI

DeepSeek低價風暴打服硅谷!海外平臺爭相倒貼V4 Flash

DeepSeek V4 Flash以極低價格與大幅提升的性能引發全球開發者熱潮,海外平台如Nous Portal和Cline甚至自行加碼補貼,顯示其成本優勢驚人。該模型經後訓練優化後,多項評測分數大幅躍升,能力直逼頂尖模型,但價格僅為後者的百分之一,讓開發者能以極低成本實現AI產品原型。文章認為這象徵AI進入類似福特T型車普及的黃金時代,並預告DeepSeek Code工具可能即將推出。

剛剛