OpenAI公開62頁核心手稿,AI連破十大「菲爾茲獎級」難題

2026年8月4日 16:24
OpenAI公開62頁核心手稿,AI連破十大「菲爾茲獎級」難題

重點摘要

OpenAI公開一份62頁核心手稿,詳細展示下一代模型Astra如何獨立破解十大「菲爾茲獎級」數學難題,燒掉的Token成本僅約2000美元。手稿揭露了AI重構解題思路的過程,包含高維球體堆積、非sofic群等多年未解的重大問題。OpenAI強化學習負責人形容此事比任何時刻都更像「奇點前夜」。

站內 AI 整理稿

OpenAI 今天(4 日)無預警公開一份長達 62 頁的核心手稿,標題為《How the Ideas Came Together》,完整揭露旗下 AI 模型破解十道頂級數學難題的推演過程。這份文件最驚人的地方在於,全文由 AI 模型獨立撰寫,OpenAI 團隊完全沒有插手,而燒掉的 Tokens 若以 GPT-5.6 Sol API 計費標準換算,成本僅約 2000 美元。消息一出,立即在學界與社群引爆討論,許多人猜測這款代號 Astra 的下一代模型,很可能就是傳說中的 GPT-6。這份手稿的摘要只有一小段,但資訊量相當驚人。

根據說明,AI 在讀取原始的思維鏈(CoT)與最終成文的數學論文後,針對每一道題目重新建構出四個層面的內容:哪些想法最初指向可行路徑、哪些看似有分量的方法撞上真正的障礙、什麼樣的視角切換讓底層結構浮現,以及決定性的洞察最後如何構成完整論證。換句話說,這不是單純的解答展示,而是把整個思考過程攤在陽光下。十道難題涵蓋範圍極廣,包括高維球體堆積、二元碼與球面碼、群論、Connes 剛性猜想、算術電路下界、量子並行重複、最近向量問題、Ehrhart 體積猜想、多色 Ramsey 數與極值圖論。

在這之前,OpenAI 內部員工已在官方部落格透露下一代模型 Astra 攻克這些難題,並附上 249 頁的論文合集與完整的 Lean 4 形式化證書,如今 62 頁手稿正式公開,等於官方蓋章認證了這項突破。在十道題目中,討論度最高的莫過於高維球體堆積問題。這個問題用白話講就是:把一堆一樣大的球塞進一個箱子裡,最多能塞多滿?三維空間的答案從水果攤壘橙子的堆法就能看出來,早就有了定論。但當維度拉到幾百維、上千維時,人類只能給出一個「上界」,也就是最多不可能超過多少。這個上界的指數一直卡在 0.5991,從 1978 年算起到現在,整整 46 年沒有實質推進。Astra 直接把它推到了 0.

6044005442916776954…,密度上界寫成 2^-(0.6044…+o(1))d,堪稱重大突破。關鍵在於它是怎麼做到的。手稿顯示,Astra 在推演過程中先確定了 Cohn–Elkies 線性規劃這套方法本身的極限。最初它嘗試用 Cauchy–Schwarz 不等式去估計某個函數的負質量,但做到極限只能達到半徑 √d/(2√π)。卡住之後,AI 做出了一個關鍵判斷:障礙不是常數沒優化好,而是全域範數根本記不住負質量落在哪裡。於是它決定更換視角,改用 Mellin 變換加調和測度。

這個選擇有其深層原因:對徑向函數來說,傅立葉變換本質上就是 Hankel 變換,而它的核只依賴空間半徑與頻率半徑的乘積;到了 Mellin 這一側,這個操作會變成極其簡單的反射,再加上一個顯式相位。手稿中還記錄了一個特別精妙的細節。那個相位因子在實軸上模長恆等於 1,因此在實軸上什麼都看不出來,但當它往外延拓到複平面時,攜帶的正是範數不等式丟掉的那部分高維資訊。推到極限時,調和測度收斂成一個 logistic 密度,其對數位勢精確等於 digamma 函數,積分出來正好是 log(π/2),1/π 這個閾值就是從這裡冒出來的。

手稿還特別提醒,調和測度的總質量是 (1−σ)/2 而不是 1,要是太早把這個核換成機率密度,會改寫指數常數,導致整個證明失效。拿到下界之後,還得構造出一個真正達到它的函數。Astra 的做法是先借助高斯給出的傅立葉對稱性,但發現鞍點位置不對,於是乘上一個偶的形變,讓鞍點移動同時不破壞對稱性。在把可用的阻尼吃滿之後,得到一個「理想剖面」,其鞍點位移積分靠 Wallis 乘積算出來,正好等於 −(1/2)log(π/2),這個數字把高斯的半徑 1/√(2π) 精確搬到 1/π,下界預測的半徑與上界構造出的半徑完美對上。

手稿裡還有個很具體的註記:構造輔助函數時,遠處需要補一塊正的阻尼,而這塊補丁必須加在整個區間上,不能加在單點上,否則會撞上共振頻率。第二道備受矚目的難題,是 27 年來無人能構造出的「非 sofic 群」。這個概念由阿貝爾獎得主、俄羅斯數學家 Mikhail Gromov 在 1999 年提出,「sofic」在希伯來語中代表「有限」。用大白話講,這個問題問的是:一個無限大的抽象結構,能不能被一堆「足夠大的有限洗牌操作」近似模擬出來?Astra 給出了顯式構造,答案是可以,存在一個無限的、有限表現的非 sofic 群。

曼徹斯特大學數學家 Thomas Bloom 直言,在構造類成果裡,這比先前的單位距離猜想反例更加重大。手稿最有價值的部分,是它寫清楚了真正的卡點所在。Kun 定理給的是許多個擴張圖,但 Kun–Thom 定理要求的是一個;「多」和「一」之間的這道坎,就是整章的核心難點。AI 稱之為「關鍵的錯配」(the crucial mismatch),並舉了一個例子說明為什麼不能隨便挑一個:在兩份完全相同的 Q 併起來(Q⊔Q)上,「交換兩份」這個操作跟擴張的 K 作用精確交換,但它不保持任何一個分量,那些「近似中心的東西」可以在分量之間來回跳,根本抓不住。

在此之前,Astra 還走過一條彎路,試圖把 property (T) 直接轉成混合性,但修正平均雖然治好了譜問題,卻治不了「到底選哪個分量」。最終版本以一個本質原則重寫:要平均的永遠是分量規模的有界單調函數,絕不能是無界的規模本身。具體做法是在每個環境擴張分量 A 裡取一個頂點加權的中位數 m_A,然後定義 f(x) = M(x) / (M(x) + m_A),其中 M 是分量規模。這個函數永遠落在 0 和 1 之間,而且 1/2 恰好是每個 A 上的中位數,等於把一個失控的量變成受控的量。

關鍵在於生成元是置換,只挪位置、不增不減,走一圈總變化必然是零,而每步最多掉一點點,兩邊都被壓成可忽略。再按高度切開、對小的一側用擴張性兩頭一夾,f 幾乎處處等於 1/2,同一範圍裡所有塊的規模被夾得幾乎一樣大,才能一一對上號。收尾時還剩一小片區域,Astra 的處理相當反直覺——挑一片儘可能大的壞區域整個扔掉,正因為挑的是最大的那片,反而證明它小到可以忽略。Gromov 提出的問題,在 27 年後終於有了答案。手稿公開後,OpenAI 強化學習團隊的大佬 Mo Bavarian 也在第一時間發文,開頭就形容這是一個「超現實」時刻。

他回憶 2021 年團隊放出 GSM8K 資料集,那只是 8500 道小學數學應用題,簡單到只用 2 到 8 步就能解完,但在 GPT-2、GPT-3 的年代,AI 連小學數學題都做不穩,起草郵件已經算勉強夠用。誰也沒想到,短短幾年時間,大規模強化學習突飛猛進,當年那些看似不可逾越的技術死衚衕被一一擊碎。Mo Bavarian 直言:「對我而言,這一刻,比任何時候都更像奇點前夜。」從幾年前在小學應用題裡跌跌撞撞,到如今 2000 美元的 Tokens 就能換來十份可能寫進數學史的答案,奇點前夜,或許真的沒有那麼遙遠。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

44 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前