OpenAI公開62頁核心手稿,AI連破十大「菲爾茲獎級」難題

重點摘要
OpenAI公開一份62頁核心手稿,詳細展示下一代模型Astra如何獨立破解十大「菲爾茲獎級」數學難題,燒掉的Token成本僅約2000美元。手稿揭露了AI重構解題思路的過程,包含高維球體堆積、非sofic群等多年未解的重大問題。OpenAI強化學習負責人形容此事比任何時刻都更像「奇點前夜」。
OpenAI 今天(4 日)無預警公開一份長達 62 頁的核心手稿,標題為《How the Ideas Came Together》,完整揭露旗下 AI 模型破解十道頂級數學難題的推演過程。這份文件最驚人的地方在於,全文由 AI 模型獨立撰寫,OpenAI 團隊完全沒有插手,而燒掉的 Tokens 若以 GPT-5.6 Sol API 計費標準換算,成本僅約 2000 美元。消息一出,立即在學界與社群引爆討論,許多人猜測這款代號 Astra 的下一代模型,很可能就是傳說中的 GPT-6。這份手稿的摘要只有一小段,但資訊量相當驚人。
根據說明,AI 在讀取原始的思維鏈(CoT)與最終成文的數學論文後,針對每一道題目重新建構出四個層面的內容:哪些想法最初指向可行路徑、哪些看似有分量的方法撞上真正的障礙、什麼樣的視角切換讓底層結構浮現,以及決定性的洞察最後如何構成完整論證。換句話說,這不是單純的解答展示,而是把整個思考過程攤在陽光下。十道難題涵蓋範圍極廣,包括高維球體堆積、二元碼與球面碼、群論、Connes 剛性猜想、算術電路下界、量子並行重複、最近向量問題、Ehrhart 體積猜想、多色 Ramsey 數與極值圖論。
在這之前,OpenAI 內部員工已在官方部落格透露下一代模型 Astra 攻克這些難題,並附上 249 頁的論文合集與完整的 Lean 4 形式化證書,如今 62 頁手稿正式公開,等於官方蓋章認證了這項突破。在十道題目中,討論度最高的莫過於高維球體堆積問題。這個問題用白話講就是:把一堆一樣大的球塞進一個箱子裡,最多能塞多滿?三維空間的答案從水果攤壘橙子的堆法就能看出來,早就有了定論。但當維度拉到幾百維、上千維時,人類只能給出一個「上界」,也就是最多不可能超過多少。這個上界的指數一直卡在 0.5991,從 1978 年算起到現在,整整 46 年沒有實質推進。Astra 直接把它推到了 0.
6044005442916776954…,密度上界寫成 2^-(0.6044…+o(1))d,堪稱重大突破。關鍵在於它是怎麼做到的。手稿顯示,Astra 在推演過程中先確定了 Cohn–Elkies 線性規劃這套方法本身的極限。最初它嘗試用 Cauchy–Schwarz 不等式去估計某個函數的負質量,但做到極限只能達到半徑 √d/(2√π)。卡住之後,AI 做出了一個關鍵判斷:障礙不是常數沒優化好,而是全域範數根本記不住負質量落在哪裡。於是它決定更換視角,改用 Mellin 變換加調和測度。
這個選擇有其深層原因:對徑向函數來說,傅立葉變換本質上就是 Hankel 變換,而它的核只依賴空間半徑與頻率半徑的乘積;到了 Mellin 這一側,這個操作會變成極其簡單的反射,再加上一個顯式相位。手稿中還記錄了一個特別精妙的細節。那個相位因子在實軸上模長恆等於 1,因此在實軸上什麼都看不出來,但當它往外延拓到複平面時,攜帶的正是範數不等式丟掉的那部分高維資訊。推到極限時,調和測度收斂成一個 logistic 密度,其對數位勢精確等於 digamma 函數,積分出來正好是 log(π/2),1/π 這個閾值就是從這裡冒出來的。
手稿還特別提醒,調和測度的總質量是 (1−σ)/2 而不是 1,要是太早把這個核換成機率密度,會改寫指數常數,導致整個證明失效。拿到下界之後,還得構造出一個真正達到它的函數。Astra 的做法是先借助高斯給出的傅立葉對稱性,但發現鞍點位置不對,於是乘上一個偶的形變,讓鞍點移動同時不破壞對稱性。在把可用的阻尼吃滿之後,得到一個「理想剖面」,其鞍點位移積分靠 Wallis 乘積算出來,正好等於 −(1/2)log(π/2),這個數字把高斯的半徑 1/√(2π) 精確搬到 1/π,下界預測的半徑與上界構造出的半徑完美對上。
手稿裡還有個很具體的註記:構造輔助函數時,遠處需要補一塊正的阻尼,而這塊補丁必須加在整個區間上,不能加在單點上,否則會撞上共振頻率。第二道備受矚目的難題,是 27 年來無人能構造出的「非 sofic 群」。這個概念由阿貝爾獎得主、俄羅斯數學家 Mikhail Gromov 在 1999 年提出,「sofic」在希伯來語中代表「有限」。用大白話講,這個問題問的是:一個無限大的抽象結構,能不能被一堆「足夠大的有限洗牌操作」近似模擬出來?Astra 給出了顯式構造,答案是可以,存在一個無限的、有限表現的非 sofic 群。
曼徹斯特大學數學家 Thomas Bloom 直言,在構造類成果裡,這比先前的單位距離猜想反例更加重大。手稿最有價值的部分,是它寫清楚了真正的卡點所在。Kun 定理給的是許多個擴張圖,但 Kun–Thom 定理要求的是一個;「多」和「一」之間的這道坎,就是整章的核心難點。AI 稱之為「關鍵的錯配」(the crucial mismatch),並舉了一個例子說明為什麼不能隨便挑一個:在兩份完全相同的 Q 併起來(Q⊔Q)上,「交換兩份」這個操作跟擴張的 K 作用精確交換,但它不保持任何一個分量,那些「近似中心的東西」可以在分量之間來回跳,根本抓不住。
在此之前,Astra 還走過一條彎路,試圖把 property (T) 直接轉成混合性,但修正平均雖然治好了譜問題,卻治不了「到底選哪個分量」。最終版本以一個本質原則重寫:要平均的永遠是分量規模的有界單調函數,絕不能是無界的規模本身。具體做法是在每個環境擴張分量 A 裡取一個頂點加權的中位數 m_A,然後定義 f(x) = M(x) / (M(x) + m_A),其中 M 是分量規模。這個函數永遠落在 0 和 1 之間,而且 1/2 恰好是每個 A 上的中位數,等於把一個失控的量變成受控的量。
關鍵在於生成元是置換,只挪位置、不增不減,走一圈總變化必然是零,而每步最多掉一點點,兩邊都被壓成可忽略。再按高度切開、對小的一側用擴張性兩頭一夾,f 幾乎處處等於 1/2,同一範圍裡所有塊的規模被夾得幾乎一樣大,才能一一對上號。收尾時還剩一小片區域,Astra 的處理相當反直覺——挑一片儘可能大的壞區域整個扔掉,正因為挑的是最大的那片,反而證明它小到可以忽略。Gromov 提出的問題,在 27 年後終於有了答案。手稿公開後,OpenAI 強化學習團隊的大佬 Mo Bavarian 也在第一時間發文,開頭就形容這是一個「超現實」時刻。
他回憶 2021 年團隊放出 GSM8K 資料集,那只是 8500 道小學數學應用題,簡單到只用 2 到 8 步就能解完,但在 GPT-2、GPT-3 的年代,AI 連小學數學題都做不穩,起草郵件已經算勉強夠用。誰也沒想到,短短幾年時間,大規模強化學習突飛猛進,當年那些看似不可逾越的技術死衚衕被一一擊碎。Mo Bavarian 直言:「對我而言,這一刻,比任何時候都更像奇點前夜。」從幾年前在小學應用題裡跌跌撞撞,到如今 2000 美元的 Tokens 就能換來十份可能寫進數學史的答案,奇點前夜,或許真的沒有那麼遙遠。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。