百年黎曼猜想被Claude破了新紀錄!是個未公開新模型

2026年8月11日 13:15
百年黎曼猜想被Claude破了新紀錄!是個未公開新模型
站內 AI 整理稿

把下界推高了一大截 不er,這竟然是真的??剛剛,A社官宣自家一個尚未公開的Claude研究模型,在黎曼猜想上取得了重大進展。它將滿足黎曼猜想的黎曼ζ函數零點比例的下界,從41.6%提高到了67.2%。什麼概念?這個數字上一次被人類往前推動,還是經過幾代數學家接力、用幾十年一點點磨出來的。結果Claude這次雖然沒打下終極Boss(A社:沒有完全解決猜想),卻在半路順手刷新了一項長期紀錄。更離譜的是。Claude完成這次研究,靠的是60個智能體、3100萬輸出Token。以及,人類只能在一旁反覆給它加油。。。繼續Claude。相信你自己。

只能說,數學界最難繃的一幕出現了: 人類負責情緒價值,AI負責推進數學前沿(doge)。沒證明黎曼猜想,但把下界推高了一大截 黎曼猜想一度被喻為數學“猜想界皇冠”。它由德國數學家黎曼在1859年提出,至今已難倒人類167年,誰能證明出來,就能拿走100萬美元大獎。用最不繞彎子的話說,它研究的是素數背後隱藏的規律。都知道素數就是隻能被1和自身整除的整數,比如2、3、5、7、11…… 它們是構成整數的基礎,但出現的位置看上去卻毫無章法: 有時捱得很近,有時又隔著一大段。為了找到其中的規律,黎曼研究了一個叫“黎曼ζ函數”的數學函數,這個函數有許多能讓函數值變成0的“零點”。

黎曼猜測,其中所有“非平凡零點”,都排列在複平面上實部等於1/2的同一條直線上。這就是黎曼猜想: 黎曼ζ函數的所有非平凡零點,實部都等於1/2。數學家之所以如此在意,是因為這些零點與素數分佈緊密相關。如果黎曼猜想成立,就意味著素數的分佈雖然看起來隨機,背後的波動卻始終被限制在一個精確範圍內。大量建立在“假設黎曼猜想成立”基礎上的數學結論,也能獲得真正可靠的地基。過去一百多年裡,數學家已經用計算機驗證了海量零點,發現它們全都乖乖落在臨界線上。但驗證再多,也只能說明“檢查過的都對”,無法證明無限多個零點永遠不會出現一個“叛徒”。

鑑於完整證明實在太難,於是數學家換了一條路線: 既然暫時證明不了“所有零點都在線上”,那能不能先證明“至少有一定比例的零點在線上”?經過幾代數學家接力,這個比例的已知下界被一點點推到了41.6%。而Claude這次做的,就是把它一口氣提高到了67.2%。注意,這並不等於“黎曼猜想被證明了67.2%”,也不代表剩下32.8%的零點不滿足猜想。它的準確含義是: Claude證明了,至少67.2%的非平凡零點位於臨界線上。雖然距離要求“全部零點都在線上”的黎曼猜想,仍然存在本質差距。但對於一個被人類磨了幾十年的長期紀錄來說,從41.6%直接跳到67.2%,成績已經足夠扎眼。

方法揭秘 至於Claude怎麼做到的,根據A社描繪的故事,開局就很“不講武德”。沒辦法,誰讓A社員工Jarred一上來就把整個猜想的證明任務甩給了Claude: 請嘗試證明黎曼猜想。Claude:我?黎曼猜想??(A社版奔波兒灞) fine,雖然有億點難,但誰讓咱是給人類打工的,開幹吧…… 於是,在沒有精心設計的解題路線,也沒有數學家在旁邊手把手指導的情況下,Claude先是一口氣生成並嘗試了650個思路。結果,不出意外,喜提650連敗。按理說,到這裡故事就該結束了,畢竟這可是從1859年懸到現在、無數頂級數學家都沒能拿下的終極難題。

但Jarred仍不死心,他給Claude再次下了一個非常簡單粗暴的指令: 再試一次。沒想到Claude很快就“開悟”了,因為它知道“搖人”了。第二輪,Claude在Claude Code里拉起約60個子智能體,花了一天半時間,執行2400條Shell命令、寫下數百個Python腳本,還圍繞已知的黎曼ζ函數零點進行了數千次數值檢驗。這60個智能體有的負責提出新思路,有的沿著重點方向繼續推導,有的專門尋找反例,還有一批直接充當審稿人,負責給其他智能體挑錯。最終,有2個智能體竟然真的提出了關鍵數學思路。

眼見同伴如此給力,其他智能體也沒偷懶: 13個負責提供輔助想法,30個探索了其他方向但沒能成功,13個專門驗證論證,最後2個幫忙把成果整理成論文。而作為這支隊伍裡唯一的人類,Jarred的主要工作竟是不斷髮送鼓勵??繼續Claude。相信你自己。就這麼“哄”了一天半,Claude雖然沒能證明黎曼猜想,卻意外發現: 如果把幾項已有數學成果重新組合起來,似乎可以突破一個停滯多年的紀錄。它將滿足黎曼猜想的ζ函數零點比例下界,從41.6%直接推到了67.2%。生活,真就處處充滿意外之喜唄!!

為了確認自己不是“算嗨了”,Claude又拉來不同的子智能體交叉審稿、尋找反例,還從arXiv下載了54篇論文,檢查這個結果是不是早就有人做過。覺得還不夠保險,它又從頭獨立證明了一遍。A社:連Claude自己也對其發現感到驚訝,也許像我們許多人一樣,Claude低估了AI的進步速度。確認暫時沒發現問題後,Claude主動提出: 寫成論文,再找人類數論專家來驗貨。隨後,Anthropic內部兩位數學家Levent Alpöge和Ralph Furman檢查了這項結果。

Claude還和Anthropic員工Eric Easley一起,把證明寫成了計算機可驗證的Lean版本,並通過標準工具Comparator的測試。此外,兩位解析數論專家Brian Conrey和Dan Goldston也審閱了論文。也就是說,從想出思路到交叉審稿、查重、復現、寫論文、做形式化驗證,Claude幾乎把科研流程走了一遍。當然,這還不等於完成了傳統同行評審,更不意味著黎曼猜想被解決了。Anthropic也明確表示,這套方法大概率無法直接通向完整證明。

但真正誇張的地方在於: AI已經不只會做有標準答案的數學題了,面對一個沒人知道答案的開放問題,它開始能夠自己找方向、讀論文、試錯、挑漏洞,甚至拿出新的研究結果。原本只是讓Claude挑戰一個幾乎不可能完成的任務。結果主線沒通關,支線先爆出橙裝了。One More Thing 話說,不知道這個模型是不是傳說中的Fable 5.1(或Fable 6)。網上最近已經開始流傳Fable 5.1的消息: 爆料稱,它主要強化了長週期推理和智能體能力,可能已經完成內部測試,只是在等待合適的發佈窗口。還有人猜測,面對下一輪模型大戰,A社可能直接跳過“5.1”,把版本號抬到Fable 6。

不過截至目前,這些說法既沒有API型號、系統卡和Benchmark佐證,也沒有得到Anthropic官方確認。或許等OpenAI發佈GPT-6就知道了。螳螂捕蟬,黃雀在後,懂的都懂(doge)。版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

鈦媒體生成式AI

王興興“錯配”梁文鋒?

王興興“錯配”梁文鋒?字母榜2026.08.24 17:44 · 來自河北全文4818字00:00 / 13:21關於世界模型,宇樹和DeepSeek理念分歧明顯。文 | 字母榜宇樹科技的股價還在持續下跌。市值從上市首日的4449億元高點,跌至2400億元,截至8月24日收盤,市值較最高點蒸發了2000億元。然而比股價更值得關注的是,宇樹接下來要怎麼走。8月20日,也就是宇樹上市第二天,王興興出現在北京世界機器人大會論壇。十多分鐘的分享裡,AI成為了高頻詞彙。他談到AI實時生成、實時識別,也談到AI模型投入,更透露了宇樹正在預研的一件事:讓物理AI機器人實現“自進化”。王興興講的每一件事,最後都指向一個關鍵要素:AI大模型。特別是最後一點,王興興說,要實現“物理AI自進化”,要用目前最前沿、最頂尖的AI大模型來驅動。而這恰恰是宇樹目前不太擅長的部分。不過,宇樹找到了DeepSeek。今年8月,兩家公司已經達成合作,圍繞AI大模型與具身智能相關技術展開合作。說到具身智能公司和AI大模型公司的合作,就不得不提當年Figure AI和OpenAI的合作。2024年,OpenAI在投資Figure AI後,雙方簽署了三年合作協議,合作開發人形機器人AI模型。但是僅一年後,FigureAI終止合作,轉向自研。於是問題來了:王興興和梁文鋒,會不會重走Figure AI和OpenAI的老路?01為什麼宇樹需要DeepSeek?對於宇樹來說,過去幾年,模型研發已經有了一些積累,但顯然投入不足,進展緩慢,所以找到一個頂尖的AI大模型公司合作,是一個比較自然的選擇。先來看宇樹目前的模型研發進展。當前,具身智能大模型沒有一個統一的技術路線,但VLA和世界模型,是行業重點探索的兩個方向。行業甚至也在探索兩者融合的技術路線。宇樹也在摸索,採取了“兩條腿走路”的策略,並行研發兩種模型。所謂VLA(視覺

剛剛
量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛