OpenAI這是拿千禧年難題當Benchmark刷啊。。。

近期,AI領域出現了一個頗具話題性的現象:OpenAI被認為正將目光投向數學界最艱深、最富盛名的「千禧年大獎難題」,並試圖將這些困擾人類頂尖數學家多年的題目,當作衡量新一代AI模型能力的測試基準。這項舉動迅速引發了科技圈與學術界的熱烈討論,許多人驚嘆於AI的進步速度,也有人對這種「挑戰極限」的評測方式感到好奇。
所謂「千禧年大獎難題」(Millennium Prize Problems),是美國克雷數學研究所(Clay Mathematics Institute)於2000年公布的七道頂級數學難題,包括P/NP問題、霍奇猜想、龐加萊猜想、黎曼猜想、楊-米爾斯存在性與質量間隙、納維-斯托克斯存在性與光滑性,以及貝赫和斯維尼翁-戴爾猜想。每一道題目都懸賞一百萬美元,至今僅有龐加萊猜想在2003年由俄羅斯數學家格里戈里·佩雷爾曼解出,其餘六道仍懸而未決。這些題目被視為數學領域「皇冠上的明珠」,是檢驗人類智力極限的終極考驗。如今,這道高牆似乎被AI公司盯上了。
據了解,OpenAI近期在內部評估中,開始嘗試讓最新的旗艦模型接觸這些難題的簡化版本或相關變體,觀察模型能否在缺乏既有參考答案的情況下,產出有意義的推理步驟。這與過去AI在程式競賽、高中數學聯賽或研究所入學考試中取得高分不同,那些測試儘管複雜,但終究有已知的解答路徑,而千禧年難題則是完全未知的領域,沒有標準答案可供模型「背誦」或「模仿」。這項動向之所以引發關注,在於其背後的評測哲學已經悄然改變。過去幾年,AI模型的數學能力通常以標準化考試分數來衡量,例如SAT數學、GRE定量推理等,這些基準很快就被各大模型「刷穿」,分數屢創新高,但學界普遍質疑,高分是否真的代表「理解」數學。
如今,拿千禧年難題當作Benchmark,等於直接把測驗難度拉升到人類知識的邊界,因為這些題目本身就代表著數學界尚未解決的開放性問題。從技術層面來看,讓AI挑戰這種等級的題目,實際上是在測試模型的「原創推理」能力,而非單純的知識檢索或模式比對。當模型面對一道從未見過、且本質上可能尚未被任何人解出的問題時,它必須自行建構一套邏輯鏈,並在虛擬的思維空間中反覆試錯。這對目前基於大型語言模型架構的AI來說,是截然不同的挑戰,因為模型的訓練資料中幾乎不可能包含可用的解題策略。OpenAI此舉也讓外界重新審視近年AI在數學領域的飛躍。
從最初只能處理簡單的四則運算,到後來在國際數學奧林匹亞競賽中達到金牌水準,再到如今嘗試觸碰千禧年難題,AI的推理能力確實以令人咋舌的速度進化。有評論認為,這代表AI從「計算工具」蛻變為「潛在的數學發現者」的可能性,不再只是驗算機器,而可能在某天協助人類數學家開闢全新的理論方向。然而,學術界對此並非一片叫好。部分數學家指出,將這些世紀難題用作AI基準,實務上存在諸多問題。首先,這些問題過於困難,導致模型幾乎無法產生任何可被驗證的正向結果,測驗結果往往淪為「全軍覆沒」,難以區分模型之間的細微能力差距。
其次,AI即使能生成看似合理的證明草稿,要讓頂尖數學家信任其正確性,必須通過嚴謹的邏輯審查,而這遠比程式自動評分來得複雜且主觀。更有學者認為,這種做法帶有濃厚的「行銷」意味。在AI競賽白熱化的階段,各家廠商都在尋找能製造話題的評測標準。比起枯燥的學術論文或企業內部報告,向外界展示「我們的AI正在挑戰黎曼猜想」顯然更具傳播效果。這種「拿傳奇題目刷存在感」的做法,雖然能吸引目光,卻可能誤導公眾,讓人誤以為AI已經離解開這些難題不遠,而實際上,距離真正突破仍有漫漫長路。但不可否認,即便AI尚未解開任何一道千禧年難題,這股趨勢已對數學研究方式產生實質影響。
自動化證明工具近年來長足進步,AI能協助人類數學家驗證繁瑣的證明步驟,或在窮舉搜尋的過程中快速找到潛在的反例。千禧年難題作為最高標準的「場域」,正好提供了研發這些工具的最佳試驗場。如果AI未來真能在其中一個問題上取得階段性進展,哪怕只是提出一個新的引理或構造一個關鍵的反例,都將是科學史上的重大事件。回歸「拿千禧年難題當Benchmark刷」這句話本身,某種程度上也反映了當前AI產業的狂熱氛圍。當傳統基準被快速超越,業界不得不尋找更極端的題目來檢驗模型極限,而人類知識的盡頭——這七道百年難題,自然成了終極的「試金石」。
無論這種做法是務實的技術評估,還是吸引眼球的宣傳手法,可以確定的是,AI與純數學之間的界線正在變得模糊。未來,究竟是人類數學家藉由AI突破瓶頸,還是AI獨立證明出下一個偉大定理,值得所有人拭目以待。
Related
相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究
作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

阿里達摩院開源全球首個專家級通用醫療影像 AI 模型 DAMO RADAR:可一次性識別超 146 種病症,成果登《科學》
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 files 的線索投遞!9 月 18 日消息,阿里達摩院今日宣佈,與浙江大學醫學院附屬第一醫院等機構研發出的通用醫療影像 AI 模型 DAMO RADAR,登上國際頂級學術期刊《科學》(Science)。

零樣本幹活!Figure 機器人走進 30 個陌生家庭,整理客廳、折毛巾、鋪床
AGI...智客Z...2026.09.18 15:08 · 來自北京全文3855字00:00 / 11:06美國人形機器人公司Figure發佈Helix 2.5,將其稱為最先進的神經網絡。人形機器人真正走向家庭,難點或許從來不是“會不會做家務”,而是換一個家庭之後,它還能不能繼續做。

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線
。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線
我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”
Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。