鈦媒體生成式AI

AI科研範式革命:花200美元即可攻克一道數學世紀難題

2026年8月3日 19:15
AI科研範式革命:花200美元即可攻克一道數學世紀難題

重點摘要

AI科研範式革命:花200美元即可攻克一道數學世紀難題硅谷Tech news2026.08.03 19:13 · 來自北京全文5638字00:00 / 14:37科研的邊際成本從百萬美元級降至百元級,重新定義成本結構往往意味著產業變革的開始。

站內 AI 整理稿

# AI科研範式革命:花200美元即可攻克一道數學世紀難題

## 從“解題”到“發現”的歷史性跨越

OpenAI日前宣佈,其下一代模型Astra以約2000美元推理成本攻克了十道數學與理論計算機科學前沿難題,平均每道題僅耗費200美元。所有成果均通過Lean形式化驗證,代碼已公開於GitHub倉庫。這些難題涵蓋高維球堆積、編碼理論、群論、量子複雜性和極值組合學等領域,每道題在學術界積壓均超過十年。需要明確的是,這十道題是從多次嘗試中篩選出的成功案例——據OpenAI披露,模型在早期探索階段存在大量失敗,GPT-5.2 Pro對Erdős問題的一次通過率僅為1%至2%。Astra呈現的是“成功精選集”,而非無差別的全面碾壓。

即便如此,這份成績單依然標誌著一道分水嶺:AI已從“解已知答案的題”跨越為“產出人類也未知的原創證明”。AI不再是科研的“助手”,而是科研的“參與者”。## 八個月:從“圖書館管理員”到“獨立研究者”

要理解Astra十題的意義,必須回溯AI數學能力的進化曲線。2025年10月,OpenAI宣稱GPT-5解決了十個Erdős問題,但隨後被澄清——GPT-5所做的並非原創證明,而是文獻搜索,在已有論文中找到了未被數據庫收錄的解答。AI擅長檢索,並不證明AI擅長創造。轉折發生在2026年1月:軟件工程師Neel Somani使用GPT-5.2 Pro生成了Erdős問題#397的原創證明,經Harmonic的Aristotle系統完成Lean形式化驗證,菲爾茲獎得主陶哲軒親自確認該證明為此前文獻中不存在的新論證。隨後問題#728和#729也在數日內相繼被攻克。

今年5月20日,OpenAI內部通用推理模型推翻了平面單位距離問題的核心猜想——一個自1946年提出、近80年無人撼動的離散幾何命題。AI找到了一族反例,核心思路借用了代數數論領域的Golod-Shafarevich定理,實現了多項式級別的改進。菲爾茲獎得主Tim Gowers稱之為“AI數學的里程碑”。從GPT-5的“查資料”到GPT-5.2的“原創三題”,再到5月模型“推翻80年猜想”,最後到Astra的“2000美元橫掃十題”,八個多月的時間,AI完成了角色躍遷。## 多智能體協同:從“一人解題”到“團隊作戰”

Astra的核心突破不在於參數規模更大,而在於組織方式根本不同。據報道,Astra能夠讓多個智能體協同工作,拆分複雜任務、分配子目標、相互校驗,並在數小時甚至數天內持續推進。十個開放問題並非由一個模型一口氣推導出來,而是由一個協調者將問題拆解為子命題,分配給不同專長的子智能體並行執行,再由驗證智能體篩選、合併、檢查邏輯一致性。這一流程與人類數學研究團隊的組織方式高度同構。Anthropic的Managed Agents、OpenAI的Agents SDK、微軟Agent Framework 1.0、LangChain的supervisor-as-tool——四家主流廠商的共識是:讓多個AI自由討論不是最優方案,一個管理者分配任務、多個執行者交付結果才是。 ## 全球共振:不止OpenAI一家

Astra並非孤例。Google DeepMind的AlphaProof Nexus自主解決了9個Erdős開放問題,其中最早一題已困擾學界56年,單題成本最低僅7.5美元。北京大學AI4Math團隊採用雙智能體框架推翻Anderson猜想,完成國內首次由AI自主解決數學開放問題並完成大規模形式化驗證,生成了約19000行Lean代碼。Math Inc的Gauss在5天內完成了8維(E8)情形的球堆積定理形式化,隨後再用約一週完成24維(Leech格)情形,總計產出約20萬行Lean代碼,原人類團隊估計剩餘工作量需6個月。

此外,Anthropic、字節跳動Seed-Prover、月之暗面Kimina-Prover、DeepSeek-Prover-V2等系統也在各自方向推進神經定理證明的自動化。形式化推理賽道已形成全球性競爭格局。## 信任錨點:Lean如何讓AI的數學“可驗證”

如果說上述突破展示了AI“能做數學”的能力,那麼下一個問題就是:我們如何信任AI產出的數學結果?這正是Lean形式化驗證所要回答的。Lean是一種交互式定理證明器,由微軟研究院開發,將數學證明寫成可被計算機逐行檢查的代碼。不同於傳統學術論文依賴同行評議的主觀判斷,Lean驗證是二進制的——要麼編譯通過,要麼報錯。一旦一個證明在Lean中“編譯”成功,它就不需要人類相信它,它本身就是正確的。Astra十項成果的GitHub倉庫中“sorry”計數為零,意味著形式化證明中無任何步驟遺漏或未證。

大語言模型的“虛假推理”問題在科研場景中是不可忽視的風險:同行評議精力、復現預算、沿著錯誤方向繼續深挖的研究週期,都可能被“看起來對”的AI生成論文無聲吞噬。Lean提供了獨立於AI的“終極裁判”系統,人類不需要逐行審閱AI產出的數千行推理,只需確認Lean編譯器通過即可。據Mines Paris PSL官方數據,Lean數學庫Mathlib已積累約210萬行代碼、超27萬條已形式化的定理。Meta的ATLAS項目消耗1830億token,將26本數學教材翻譯為Lean代碼庫。讓機器自動檢查“是不是對的”的能力,正在從增值功能變成基礎設施。## 成本崩塌:從百萬美元到兩百美元

2000美元這個數字是Astra故事中最具衝擊力的細節,但需要明確的是,這僅指推理算力的邊際成本,不包括模型訓練(數億美元級)、基礎設施投資以及人類研究者的選題與驗證時間。即便如此,邊際成本的下降幅度仍然驚人。傳統數學研究中,一個Erdős級別的開放問題可能需要一位頂尖數學家耗費數年甚至數十年,背後是終身教職的薪資、研究經費、博士生培養費用,折算成本在百萬美元量級以上。Astra以2000美元攻克十題,平均每題200美元,約相當於一個初級軟件工程師一週的工資。

成本下行趨勢同樣值得關注:2026年5月單位距離問題的推理成本約1000美元,8月Astra十題平均每題200美元,同期DeepMind AlphaProof Nexus單題成本最低僅7.5美元。同代模型的推理優化、專用硬件普及、多智能體架構對token利用效率的提升,都將繼續壓縮這個數字。當解決一個前沿數學猜想的邊際成本降到200美元以下,“只有天才數學家才能做前沿數學”這個隱含前提開始鬆動。## 密碼學衝擊波與科研預算結構重配

成本下降最直接的連鎖反應發生在密碼學領域。7月28日,Anthropic披露Claude Mythos Preview在約60小時、10萬美元成本內,發現了NIST後量子簽名候選算法HAWK-256的格結構對稱性缺陷,將密鑰恢復的理論工作量從2的64次方降至2的38次方。次日,HAWK開發者宣佈從NIST標準化進程中撤回該方案。這不是量子計算機攻破RSA,而是純粹由AI推理能力驅動的密碼分析——不需要量子比特,不需要超低溫冷卻。當多智能體系統能以200美元一題的邊際成本求解開放數學問題時,密碼學家面臨的不再是“AI能不能找到漏洞”,而是“低成本密碼分析何時平民化”。

科研能耗正從實驗密集型轉向推理密集型。高校計算中心的採購清單將從“更多GPU”擴展為“更多能跑形式化推理管線的算力配額”。OpenAI於7月29日推出的“ChatGPT學術研究者計劃”向十萬名科學家免費提供前沿模型訪問權限,承諾到2027年前投入2.5億美元——表面上是公益,本質上是在下一代科研範式中搶佔用戶習慣。## 數學家的新定位:從“證明者”走向“提問者”

成本的急劇下降正在將一個問題推向臺前:當AI能夠以極低成本產出數學成果時,數學家自身的存在價值又該如何定義?6月2日,國際數學聯盟(IMU)正式背書《萊頓人工智能與數學宣言》。截至撰寫時,該宣言已獲超過3000人簽署,陶哲軒稱其為“必要框架”,多位菲爾茲獎得主也已簽署。《自然》雜誌於6月18日發表社論全面支持,呼籲其他學科效仿。宣言指出AI對數學的五大威脅:不可靠結果、歸屬缺失、依賴不平等、過度炒作、自主性喪失。OpenAI在其Astra報告中回應了這些關切,承認AI有“貢獻”,既不是把AI當成無生命的工具,也不是賦予AI作者身份,而是把人類放在“最終承擔責任”的位置。

Astra解決的是“證明一個長期猜想是否成立”的證明型突破,而“提出一個全新交叉方向、需要直覺跳躍的猜想”的概念型突破,依然是人類最稀缺的能力。不過,單位距離問題的突破也展示了AI超出預期的跨域聯想能力——它將代數數論的Golod-Shafarevich理論應用於離散幾何,這種跨學科聯繫被數學家Arul Shankar評價為“具備原創、精妙的獨立思想”。AI的跨域聯想能力正在快速進步。隨著Astra可以200美元一題解決開放難題,人類數學家的工作重心將從“產生證明”向上游遷移到“提出好問題”。

萊頓宣言的務實建議是:人類研究者選擇問題、設定標準、批判想法、驗證結果;AI貢獻廣度、速度和並行探索能力。陶哲軒在2026年初的演講中判斷:“AI將成為數學研究中值得信賴的合作者。”Tim Gowers在5月20日當晚最初誤以為AI“證明”了單位距離猜想,寫道:“如果AI能想出這樣的證明,數學家的好日子可能很快就要結束了。”但次日他得知AI是“推翻”了猜想(而非證明),明確表示“如釋重負”。這一細節折射出數學界對AI能力的複雜心態——既為其潛力震撼,又為其邊界感到寬慰。## 驗證機制的遞歸困境

如果Astra能以每天幾十個問題的速度產生候選解,當前人類同行評議體系根本消化不了這個流量。Lean形式化驗證提供了部分答案,但將自然語言證明翻譯為Lean代碼本身也需要成本。AI輔助的自動形式化正在縮小這個差距,但遠未達到即插即用的水平。於是出現一個繞不過去的困境:要規模化驗證AI產生的數學結果,我們需要AI來自動化驗證過程——但這又回到了“誰來驗證驗證AI的AI”的遞歸問題。當AI產出速度是人類驗證速度的百倍以上時,最終裁決權可能退化為抽樣檢查權,而系統性犯錯的風險窗口始終存在。2000美元不是奧爾特曼在國會山拋出的營銷數字,它是一道分水嶺。

在這條線的左邊,科學發現是人類智力的專屬領地,昂貴、緩慢、依賴天才的偶然出現。在這條線的右邊,科學發現開始變成一種可以被工程化、被規模化、被定價的服務。當一個數學猜想的邊際解決成本降到200美元,它就不再是“科研”,它變成了“查詢”,“做科研”這件事本身的成本結構也正在被重新定義。從歷史經驗看,重新定義成本結構往往意味著產業變革的開始。基礎科學的前沿發現,不再是一件只有人類才能做的事。但“什麼值得發現”、“發現之後如何理解”、“誰來為發現負責”——這些問題,仍然只屬於人類。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前