鈦媒體生成式AI

AI科研範式革命:花200美元即可攻克一道數學世紀難題

2026年8月3日 19:15
AI科研範式革命:花200美元即可攻克一道數學世紀難題

重點摘要

AI科研範式革命:花200美元即可攻克一道數學世紀難題硅谷Tech news2026.08.03 19:13 · 來自北京全文5638字00:00 / 14:37科研的邊際成本從百萬美元級降至百元級,重新定義成本結構往往意味著產業變革的開始。

站內 AI 整理稿

# AI科研範式革命:花200美元即可攻克一道數學世紀難題

## 從“解題”到“發現”的歷史性跨越

OpenAI日前宣佈,其下一代模型Astra以約2000美元推理成本攻克了十道數學與理論計算機科學前沿難題,平均每道題僅耗費200美元。所有成果均通過Lean形式化驗證,代碼已公開於GitHub倉庫。這些難題涵蓋高維球堆積、編碼理論、群論、量子複雜性和極值組合學等領域,每道題在學術界積壓均超過十年。需要明確的是,這十道題是從多次嘗試中篩選出的成功案例——據OpenAI披露,模型在早期探索階段存在大量失敗,GPT-5.2 Pro對Erdős問題的一次通過率僅為1%至2%。Astra呈現的是“成功精選集”,而非無差別的全面碾壓。即便如此,這份成績單依然標誌著一道分水嶺:AI已從“解已知答案的題”跨越為“產出人類也未知的原創證明”。AI不再是科研的“助手”,而是科研的“參與者”。 ## 八個月:從“圖書館管理員”到“獨立研究者”

要理解Astra十題的意義,必須回溯AI數學能力的進化曲線。2025年10月,OpenAI宣稱GPT-5解決了十個Erdős問題,但隨後被澄清——GPT-5所做的並非原創證明,而是文獻搜索,在已有論文中找到了未被數據庫收錄的解答。AI擅長檢索,並不證明AI擅長創造。轉折發生在2026年1月:軟件工程師Neel Somani使用GPT-5.2 Pro生成了Erdős問題#397的原創證明,經Harmonic的Aristotle系統完成Lean形式化驗證,菲爾茲獎得主陶哲軒親自確認該證明為此前文獻中不存在的新論證。隨後問題#728和#729也在數日內相繼被攻克。今年5月20日,OpenAI內部通用推理模型推翻了平面單位距離問題的核心猜想——一個自1946年提出、近80年無人撼動的離散幾何命題。AI找到了一族反例,核心思路借用了代數數論領域的Golod-Shafarevich定理,實現了多項式級別的改進。菲爾茲獎得主Tim Gowers稱之為“AI數學的里程碑”。從GPT-5的“查資料”到GPT-5.2的“原創三題”,再到5月模型“推翻80年猜想”,最後到Astra的“2000美元橫掃十題”,八個多月的時間,AI完成了角色躍遷。 ## 多智能體協同:從“一人解題”到“團隊作戰”

Astra的核心突破不在於參數規模更大,而在於組織方式根本不同。據報道,Astra能夠讓多個智能體協同工作,拆分複雜任務、分配子目標、相互校驗,並在數小時甚至數天內持續推進。十個開放問題並非由一個模型一口氣推導出來,而是由一個協調者將問題拆解為子命題,分配給不同專長的子智能體並行執行,再由驗證智能體篩選、合併、檢查邏輯一致性。這一流程與人類數學研究團隊的組織方式高度同構。Anthropic的Managed Agents、OpenAI的Agents SDK、微軟Agent Framework 1.0、LangChain的supervisor-as-tool——四家主流廠商的共識是:讓多個AI自由討論不是最優方案,一個管理者分配任務、多個執行者交付結果才是。 ## 全球共振:不止OpenAI一家

Astra並非孤例。Google DeepMind的AlphaProof Nexus自主解決了9個Erdős開放問題,其中最早一題已困擾學界56年,單題成本最低僅7.5美元。北京大學AI4Math團隊採用雙智能體框架推翻Anderson猜想,完成國內首次由AI自主解決數學開放問題並完成大規模形式化驗證,生成了約19000行Lean代碼。Math Inc的Gauss在5天內完成了8維(E8)情形的球堆積定理形式化,隨後再用約一週完成24維(Leech格)情形,總計產出約20萬行Lean代碼,原人類團隊估計剩餘工作量需6個月。此外,Anthropic、字節跳動Seed-Prover、月之暗面Kimina-Prover、DeepSeek-Prover-V2等系統也在各自方向推進神經定理證明的自動化。形式化推理賽道已形成全球性競爭格局。 ## 信任錨點:Lean如何讓AI的數學“可驗證”

如果說上述突破展示了AI“能做數學”的能力,那麼下一個問題就是:我們如何信任AI產出的數學結果?這正是Lean形式化驗證所要回答的。Lean是一種交互式定理證明器,由微軟研究院開發,將數學證明寫成可被計算機逐行檢查的代碼。不同於傳統學術論文依賴同行評議的主觀判斷,Lean驗證是二進制的——要麼編譯通過,要麼報錯。一旦一個證明在Lean中“編譯”成功,它就不需要人類相信它,它本身就是正確的。Astra十項成果的GitHub倉庫中“sorry”計數為零,意味著形式化證明中無任何步驟遺漏或未證。大語言模型的“虛假推理”問題在科研場景中是不可忽視的風險:同行評議精力、復現預算、沿著錯誤方向繼續深挖的研究週期,都可能被“看起來對”的AI生成論文無聲吞噬。Lean提供了獨立於AI的“終極裁判”系統,人類不需要逐行審閱AI產出的數千行推理,只需確認Lean編譯器通過即可。據Mines Paris PSL官方數據,Lean數學庫Mathlib已積累約210萬行代碼、超27萬條已形式化的定理。Meta的ATLAS項目消耗1830億token,將26本數學教材翻譯為Lean代碼庫。讓機器自動檢查“是不是對的”的能力,正在從增值功能變成基礎設施。 ## 成本崩塌:從百萬美元到兩百美元

2000美元這個數字是Astra故事中最具衝擊力的細節,但需要明確的是,這僅指推理算力的邊際成本,不包括模型訓練(數億美元級)、基礎設施投資以及人類研究者的選題與驗證時間。即便如此,邊際成本的下降幅度仍然驚人。傳統數學研究中,一個Erdős級別的開放問題可能需要一位頂尖數學家耗費數年甚至數十年,背後是終身教職的薪資、研究經費、博士生培養費用,折算成本在百萬美元量級以上。Astra以2000美元攻克十題,平均每題200美元,約相當於一個初級軟件工程師一週的工資。成本下行趨勢同樣值得關注:2026年5月單位距離問題的推理成本約1000美元,8月Astra十題平均每題200美元,同期DeepMind AlphaProof Nexus單題成本最低僅7.5美元。同代模型的推理優化、專用硬件普及、多智能體架構對token利用效率的提升,都將繼續壓縮這個數字。當解決一個前沿數學猜想的邊際成本降到200美元以下,“只有天才數學家才能做前沿數學”這個隱含前提開始鬆動。 ## 密碼學衝擊波與科研預算結構重配

成本下降最直接的連鎖反應發生在密碼學領域。7月28日,Anthropic披露Claude Mythos Preview在約60小時、10萬美元成本內,發現了NIST後量子簽名候選算法HAWK-256的格結構對稱性缺陷,將密鑰恢復的理論工作量從2的64次方降至2的38次方。次日,HAWK開發者宣佈從NIST標準化進程中撤回該方案。這不是量子計算機攻破RSA,而是純粹由AI推理能力驅動的密碼分析——不需要量子比特,不需要超低溫冷卻。當多智能體系統能以200美元一題的邊際成本求解開放數學問題時,密碼學家面臨的不再是“AI能不能找到漏洞”,而是“低成本密碼分析何時平民化”。科研能耗正從實驗密集型轉向推理密集型。高校計算中心的採購清單將從“更多GPU”擴展為“更多能跑形式化推理管線的算力配額”。OpenAI於7月29日推出的“ChatGPT學術研究者計劃”向十萬名科學家免費提供前沿模型訪問權限,承諾到2027年前投入2.5億美元——表面上是公益,本質上是在下一代科研範式中搶佔用戶習慣。 ## 數學家的新定位:從“證明者”走向“提問者”

成本的急劇下降正在將一個問題推向臺前:當AI能夠以極低成本產出數學成果時,數學家自身的存在價值又該如何定義?6月2日,國際數學聯盟(IMU)正式背書《萊頓人工智能與數學宣言》。截至撰寫時,該宣言已獲超過3000人簽署,陶哲軒稱其為“必要框架”,多位菲爾茲獎得主也已簽署。《自然》雜誌於6月18日發表社論全面支持,呼籲其他學科效仿。宣言指出AI對數學的五大威脅:不可靠結果、歸屬缺失、依賴不平等、過度炒作、自主性喪失。OpenAI在其Astra報告中回應了這些關切,承認AI有“貢獻”,既不是把AI當成無生命的工具,也不是賦予AI作者身份,而是把人類放在“最終承擔責任”的位置。 Astra解決的是“證明一個長期猜想是否成立”的證明型突破,而“提出一個全新交叉方向、需要直覺跳躍的猜想”的概念型突破,依然是人類最稀缺的能力。不過,單位距離問題的突破也展示了AI超出預期的跨域聯想能力——它將代數數論的Golod-Shafarevich理論應用於離散幾何,這種跨學科聯繫被數學家Arul Shankar評價為“具備原創、精妙的獨立思想”。AI的跨域聯想能力正在快速進步。隨著Astra可以200美元一題解決開放難題,人類數學家的工作重心將從“產生證明”向上游遷移到“提出好問題”。萊頓宣言的務實建議是:人類研究者選擇問題、設定標準、批判想法、驗證結果;AI貢獻廣度、速度和並行探索能力。陶哲軒在2026年初的演講中判斷:“AI將成為數學研究中值得信賴的合作者。”Tim Gowers在5月20日當晚最初誤以為AI“證明”了單位距離猜想,寫道:“如果AI能想出這樣的證明,數學家的好日子可能很快就要結束了。”但次日他得知AI是“推翻”了猜想(而非證明),明確表示“如釋重負”。這一細節折射出數學界對AI能力的複雜心態——既為其潛力震撼,又為其邊界感到寬慰。 ## 驗證機制的遞歸困境

如果Astra能以每天幾十個問題的速度產生候選解,當前人類同行評議體系根本消化不了這個流量。Lean形式化驗證提供了部分答案,但將自然語言證明翻譯為Lean代碼本身也需要成本。AI輔助的自動形式化正在縮小這個差距,但遠未達到即插即用的水平。於是出現一個繞不過去的困境:要規模化驗證AI產生的數學結果,我們需要AI來自動化驗證過程——但這又回到了“誰來驗證驗證AI的AI”的遞歸問題。當AI產出速度是人類驗證速度的百倍以上時,最終裁決權可能退化為抽樣檢查權,而系統性犯錯的風險窗口始終存在。 2000美元不是奧爾特曼在國會山拋出的營銷數字,它是一道分水嶺。在這條線的左邊,科學發現是人類智力的專屬領地,昂貴、緩慢、依賴天才的偶然出現。在這條線的右邊,科學發現開始變成一種可以被工程化、被規模化、被定價的服務。當一個數學猜想的邊際解決成本降到200美元,它就不再是“科研”,它變成了“查詢”,“做科研”這件事本身的成本結構也正在被重新定義。從歷史經驗看,重新定義成本結構往往意味著產業變革的開始。基礎科學的前沿發現,不再是一件只有人類才能做的事。但“什麼值得發現”、“發現之後如何理解”、“誰來為發現負責”——這些問題,仍然只屬於人類。

Related

相關文章

量子位生成式AI

這個新生圖模型有點夯:4K直出的,國產的,開源的!

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 這個新生圖模型有點夯:4K直出的,國產的,開源的! 十三 2026-08-03 19:59:32 來源:量子位 商湯預覽了SenseNova U1.5 Lite 金磊 發自 凹非寺 量子位 | 公眾號 QbitAI 剛剛,新出的一個生圖模型,著實是有點東西在身上的: 國產的,4K直出的,開源的,輕量的,還是可以指哪兒改哪兒的。 例如下面這張信息密度超高的圖片,就是它做出來的: 我們從結果可以看到,即便是把圖片放大了來看 ,不論是文字、圖片元素,都是細節拉滿的狀態。 再如這組充滿藝術感的視覺大片,這個AI也是不在話下: 那這是何許AI是也? 它,便是商湯剛剛面向社區開源的SenseNova U1.5-Lite-Preview。 這是一個輕量級原生統一多模態模型的早期預覽版本。它延續了商湯自研的NEO-Unify架構,把語言、視覺語義和像素生成放進同一套模型裡,覆蓋視覺理解、推理、生成與編輯。 不過有一說一,原生4K直出,還僅僅是它的亮點之一。 在僅有8B-MoT參數的輕量身形之下,U1.5-Lite-Preview做到了: 複雜Prompt能接住:支持長篇、多約束、層次化和結構化視覺指令; 文字和版式更能打:面向海報、信息圖、品牌視覺等高信息密度內容; 生成後還能繼續改:支持參考圖、多圖組合、局部文字編輯,以及紅框、座標和marker精準編輯。 畢竟在真實創作中,“會畫圖”只是第一步,真正決定它能不能進入創作流程的,還得看複雜任務和編輯能力。 那U1.5-Lite-Preview這個8B-MoT小模型創作起來有多方便?我們繼續往下看~ 能Hold住復

剛剛
鈦媒體生成式AI

對話博登智能趙捷:十億訂單在手,具身智能最缺的仍是高質量數據

對話博登智能趙捷:十億訂單在手,具身智能最缺的仍是高質量數據TechPulse2026.08.03 19:48 · 來自河北全文5467字00:00 / 17:40機器人真正的進步,有時就藏在一次失敗之後:它有沒有記住,人類當時是怎樣把錯誤糾正過來的。具身智能的數據生意正在迅速升溫。斯坦福大學《2026 AI Index Report》顯示,機器人在仿真操作基準中的任務成功率已達到89.

剛剛

在K3爆火之際,來聊聊Kimi的商業化前景

月之暗面推出的Kimi K3模型因開源且性能強勁而爆紅,上線後迅速登頂Hugging Face趨勢榜,並引發資本市場震盪。其商業化進展迅速,年度經常性收入(ARR)已突破3億美元,API收入佔比超過七成,海外付費用戶增長顯著,並藉助與亞馬遜雲科技等雲平台的合作拓展全球市場。

剛剛
鈦媒體生成式AI

怎麼看待AI大回調,大摩120頁研報深度解讀

怎麼看待AI大回調,大摩120頁研報深度解讀AlphaEngineer2026.08.03 18:40 · 來自北京全文3170字00:00 / 08:53摩根士丹利解讀AI板塊回調:屬技術性回調,看好AI基建。作者 | 費斌傑 北京市青聯委員 熵簡科技CEO6月下旬以來,全球AI板塊經歷了一輪顯著回調。這到底是短暫的技術性回調,還是週期見頂的信號,這是一個價值千金的問題。

剛剛

深度:外賓 Genspark

Genspark 雖在公開信支持開放權重模型,但其真實立場更接近閉源實驗室,商業策略上則希望藉開放模型降低成本。該公司創辦人刻意淡化曾在百度任職的背景,並在矽谷華人社群活動中保持距離,反而積極贊助國際商業會議,塑造純正美國 AI 公司的形象。

剛剛