他讓GPT-5.6 Sol連跑33小時攻關費馬大定理,被系統強制終止

2026年7月28日 20:25
他讓GPT-5.6 Sol連跑33小時攻關費馬大定理,被系統強制終止

重點摘要

一位開發者讓GPT-5.6 Sol連續運行了33個小時,試圖挑戰費馬大定理的證明,最終卻被系統強制終止。這個實驗引發了外界對AI推理能力極限的關注,也讓人好奇這套模型究竟能處理多複雜的數學問題。 據了解,GPT-5.6 Sol是OpenAI最新一代大型語言模型,具備更強的邏輯推理與數學運算能力。開發者將費馬大定理的證明任務交給它,並讓它不間斷地運算超過一天,過程中模型不斷生成新的數學推導與嘗試。然而,在33小時後,系統因超出運算資源限制而強制終止了這個進程,未能得出完整的證明結果。

站內 AI 整理稿

一位開發者近日進行了一項大膽的實驗,讓 OpenAI 最新一代大型語言模型 GPT-5.6 Sol 連續運行了長達 33 個小時,目標是挑戰數學史上最著名的難題之一——費馬大定理的證明。然而,就在模型不斷產出新的數學推導與嘗試之際,系統最終因超出運算資源限制而強制終止了這個進程,未能得出完整的證明結果。這個實驗不僅引發了外界對 AI 推理能力極限的關注,也讓業界對這套模型究竟能處理多複雜的數學問題充滿好奇。據了解,GPT-5.6 Sol 是 OpenAI 最新推出的旗艦級大型語言模型,相較於前代版本,它在邏輯推理、數學運算與長期連貫思考方面進行了顯著強化。

開發者選擇將費馬大定理的證明任務交給它,並刻意不設定時間或步驟上限,讓模型以不間斷的方式進行運算。在長達 33 小時的過程中,GPT-5.6 Sol 持續生成新的數學推導、嘗試不同的證明路徑,並反覆修正自己的邏輯鏈條,展現出驚人的持續推理能力。費馬大定理是數學史上最具傳奇色彩的難題之一,由法國數學家皮埃爾·德·費馬在 1637 年提出。費馬在閱讀古希臘數學家丟番圖的《算術》時,在書頁邊緣寫下了一段著名的筆記,聲稱自己發現了一個絕妙的證明,但因為書邊空白太窄而無法寫下。這個定理的陳述看似簡單:當整數 n 大於 2 時,方程式 xⁿ + yⁿ = zⁿ 沒有正整數解。

然而,這個看似簡單的命題卻困擾了數學界長達三個半世紀,直到 1994 年才由英國數學家安德魯·懷爾斯給出完整且嚴謹的證明。懷爾斯的證明過程本身就是數學界的一段傳奇。他花了七年時間秘密研究,最終在 1993 年於劍橋大學的一次講座中宣布證明成功,但隨後被發現證明中存在一個漏洞。懷爾斯又花了一年多的時間,與他的學生理查·泰勒合作,最終在 1994 年修補了漏洞,才正式完成了這個世紀難題的證明。懷爾斯的證明運用了大量現代數學工具,包括橢圓曲線、模形式與伽羅瓦表示理論,其複雜程度遠超費馬時代的數學範疇。這次 GPT-5.

6 Sol 的實驗雖然沒有成功重現懷爾斯的證明,但模型在長時間運算中展現出的持續推理能力,仍然讓業界感到振奮。開發者觀察到,模型在運算過程中並非簡單地進行暴力搜索或隨機嘗試,而是展現出某種程度的策略性思考:它會先建立一些基礎的數學假設,然後逐步推導出中間結論,並在遇到矛盾時回溯調整方向。這種類似人類數學家在解題時採用的「探索與修正」模式,顯示出大型語言模型在高等數學領域的應用潛力。值得注意的是,系統在 33 小時後強制終止進程,並非因為模型本身出現錯誤或崩潰,而是因為運算資源的限制。GPT-5.

6 Sol 在長時間運行中消耗了大量的計算資源,包括 GPU 運算時間與記憶體,最終觸發了系統的資源保護機制。開發者表示,這個結果雖然令人遺憾,但也從側面反映出模型在面對極度複雜的數學問題時,確實需要更龐大的運算基礎設施來支撐。這次實驗也引發了學術界與科技界的廣泛討論。部分數學家認為,AI 目前仍然無法真正理解數學證明的深層結構,它們只是基於大量訓練數據進行模式匹配與序列生成。然而,也有專家指出,GPT-5.6 Sol 在長時間運算中展現出的連貫推理能力,已經超越了單純的語言模型範疇,開始觸及某種形式的「數學直覺」。

這種直覺雖然還遠不及人類頂尖數學家的水準,但隨著模型規模與訓練數據的不斷增長,未來或許能夠在數學研究中扮演輔助角色。開發者事後表示,這次實驗雖然以系統強制終止告終,但過程中收集到的數據與觀察到的模型行為,對於理解 AI 的推理極限具有重要價值。他計畫在未來調整參數設定或優化資源配置,再次嘗試類似的挑戰。可能的改進方向包括:為模型提供更明確的證明方向指引、設定階段性目標以降低長期運算的資源消耗,或是採用分散式運算架構來分擔負載。OpenAI 方面目前尚未對這次實驗發表官方評論,但業界普遍認為,GPT-5.6 Sol 的表現已經證明了大型語言模型在處理複雜數學問題上的潛力。

費馬大定理的證明或許短期內仍無法由 AI 獨立完成,但隨著技術的進步,AI 在數學研究中的角色將從單純的計算工具,逐步演變為能夠參與推理與創新的合作夥伴。這次實驗也為 AI 領域帶來了一個值得深思的問題:當我們賦予模型越來越強大的推理能力時,如何定義「成功」與「失敗」?GPT-5.6 Sol 雖然沒有完成費馬大定理的證明,但它在 33 小時內產生的數學推導與邏輯鏈條,或許本身就蘊含著某些尚未被發現的數學洞見。開發者表示,他正在整理模型運算過程中產生的所有推導記錄,並計畫將其公開,供數學界與 AI 研究社群進一步分析。從更宏觀的角度來看,這次實驗象徵著 AI 從「回答問題」到「解決問題」的轉變。

傳統上,大型語言模型被設計用來回答用戶提出的問題,但 GPT-5.6 Sol 的長時間自主運算,顯示出模型已經具備在某個特定領域內進行持續探索與嘗試的能力。這種能力如果能夠進一步強化,未來或許可以用於自動化數學證明、科學假說生成,甚至是藥物分子設計等需要長期推理的複雜任務。儘管費馬大定理的證明最終未能由 AI 完成,但這個實驗已經在科技界與數學界之間架起了一座新的橋樑。它讓人們看到,AI 不僅能夠處理日常生活中的語言任務,也開始觸及人類智力活動中最深奧的領域之一——數學證明。隨著運算資源的擴展與模型架構的優化,或許在不久的將來,我們就能看到 AI 在數學研究中寫下屬於自己的傳奇篇章。

Related

相關文章

天才,對AI發展到底有多重要?

加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

剛剛

Jeff Dean們,趕在貝葉斯AI到來之前跳船

Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

5 小時前

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分

Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

7 小時前

智元下架了首席科學家羅劍嵐

智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。

10 小時前