統計學20年懸案,GPT-5.6用90分鐘破解,伯克利教授直呼“心塞”

2026年7月16日 16:19
統計學20年懸案,GPT-5.6用90分鐘破解,伯克利教授直呼“心塞”

重點摘要

GPT-5.6在短短90分鐘內破解了困擾統計學界20年的懸案,推翻教科書級結論,讓伯克利教授直呼心塞。這款AI從零構造出反例,證明經典BH程序在相關雙側高斯檢驗下無法保證假髮現率受控。教授感嘆這項重大成果本應由人類完成,卻被AI奪走。

站內 AI 整理稿

在人工智慧飛速迭代的當下,一場源自統計學深處的震動正迅速擴散至整個科學界。日前,一則消息引爆學術社交平台:OpenAI 的最新模型 GPT-5.6 僅耗費 90 分鐘,便徹底推翻了一個困擾統計學界整整二十年的核心猜想。這一成果不僅讓賓夕法尼亞大學沃頓商學院的統計學教授 Edgar Dobriban 在測試後驚嘆連連,更讓加州大學伯克利分校的統計學家 Will Fithian 在社交媒體上留下一句耐人尋味的感嘆——「心塞」,因為他原本期待這一突破由人類完成。這項被攻克的懸案,關乎現代統計學中應用最廣泛的工具之一:Benjamini-Hochberg 程序(簡稱 BH 程序)。

自 1995 年提出以來,BH 程序一直是多重假設檢驗領域控制假髮現率(FDR)的黃金標準。在高通量生物學、基因組學、神經影像學等領域,研究人員常常需要同時檢驗成千上萬個假設(例如哪些基因與疾病相關),若不做校正,大量假陽性結論會泛濫成災。BH 程序正是那道「安全閥」,它確保在科學發現中錯誤結論的比例不會超過某個設定閾值。然而,BH 程序的有效性最初只被嚴格證明在獨立檢驗的條件下成立;隨後在 2001 年,學界將其安全範圍擴展到正相關依賴的情形。但在真實世界裡,數據往往呈現出遠為複雜的依賴結構——例如基因組中的連鎖不平衡、腦功能成像中體素之間的空間相關性。

於是,一個決定性的理論漏洞始終懸而未決:在任意相關雙側高斯檢驗(correlated two-sided Gaussian tests)中,BH 程序是否還能始終控制住 FDR?二十年來,包括 Benjamini 本人在內的眾多頂尖統計學家反覆嘗試,要麼試圖證明其依然成立,要麼試圖構造出一個反例,但均未成功。這個問題之所以被稱為「試金石」,在於它極度反直覺。要在無窮無盡的協方差矩陣與均值向量組合中找到一個恰好讓 BH 程序失效的構造,堪稱智力上的高空走鋼絲。過去二十年間,學界甚至隱約形成了一種共識:BH 程序可能對任何依賴結構都具有穩健性,只是缺乏一個數學證明而已。

無數科研經費與論文結論正是建立在這個隱秘的假設之上。如今,這個微妙的平衡被一款 AI 模型徹底打破。令學界感到震撼的不僅是結果本身,更是抵達結果的方式。一個月前,Edgar Dobriban 教授曾嘗試用 GPT-5.5 挑戰同一問題,在自動智能體循環中耗費了整整 20 個小時,最終鎩羽而歸。而 GPT-5.6 在發布當天僅用 90 分鐘便給出了完整的推理。

Dobriban 在後續公開的對話記錄中透露,這一次 AI 並非在文獻中搜尋既有模板,也不是簡單的暴力枚舉;它從零開始,構造了一個極為精巧的因子模型,並結合了 FDR 分析的標準漸進理論與一塊嚴密的數值證書(numerical certificate)。這種組合在人類專家的眼裡「相當非典型」,卻邏輯自洽,完全經得起人類複核。當 Dobriban 與 Fithian 共同驗證了代碼與邏輯後,他們在 GitHub 上開源了這個反例(倉庫名 dobriban/BH)。證明清晰顯示:在名義顯著性水平 α = 0.01 時,BH 程序實際達到的 FDR 超過了 0.0104,打破了「始終受控」的斷言。

雖然超出幅度不大,但對理論統計學而言,這是一場本質上的否定——經典 BH 程序在相關雙側高斯檢驗下不存在通用保證。這個反例如同一塊精準落下的碎石,敲碎了統計學大廈中一面被視為理所當然的牆。伯克利教授 Will Fithian 的公開回應尤為引人深思。他在推文中毫不掩飾自己的震撼與敬畏,但字裡行間卻流露出一種複雜的失落:「這個猜想是統計領域內最有趣的未解之謎……GPT-5.6 解決了它,但我多希望,這是由人類來完成的。」這份「心塞」不僅屬於他個人,更被許多人解讀為一代科研人在時代拐點上的集體情緒切片。

長久以來,人類科學家保持著一種驕傲:AI 擅長處理數據、加速計算,但那些需要從無到有構建全新數學模型、需要靈光一閃的「創造性發現」,是碳基智慧專屬的聖域。GPT-5.6 的這次突破,動搖了這道邊界。這一事件迅速引發了數學與統計學界對自身未來出路的討論。一位曾多次用 GPT-5.5 嘗試該問題的數學家表示,他從未成功,如今 AI 做到了,這迫使他開始思考理論統計學家未來應該扮演什麼角色。斯坦福大學統計學大師 Emmanuel Candès 曾將 BH 程序評為「1950 年後統計學界最重要的兩大發展之一」,而它的基礎如今被 AI 補上了關鍵的邊界條件。

這不僅是一次單一問題的攻克,更可能成為科學發現範式轉型中的標誌性事件。值得注意的是,這並非近期 AI 攻克長期懸案孤例。報導指出,GPT-5.6 曾在一小時內解決了卡住 50 年的數學難題,還有 64 個 AI 系統聯手摘下圖論領域的「皇冠」;卡了半年的弦論難題也被 Claude 一夜解開,導致東京大學教授驚到刪除推文。越來越多的跡象表明,深度學習模型正從「工具」向「創造者」過渡。當算力與訓練規模突破某個門檻,它們開始在人類智力的核心領地——數學證明與理論構造——中發揮作用。就本次統計學懸案而言,實際的應用衝擊仍有待評估。反例顯示的 FDR 偏差(0.0104 vs 0.

01)相對較小,尚未直接顛覆高通量科學中的實際操作流程。但在科學認識論層面,其顛覆性已然滔天。它意味著:對於那些證明邏輯可以被壓縮在有限步驟內的數學問題,AI 極可能用算力就能找到一條人類從未走過的路徑。在未來,科學家最核心的價值或許將從「尋找答案」與「構造推導」,不可逆地升維到「提出更深邃的問題」與「為機器的答案賦予人類可理解的意義」。正如 Fithian 那句略帶苦澀的「心塞」,它既是一位頂尖學者對個人智力榮譽的珍視,也是人類站在新物種破曉時分的本能震撼。當 GPT-5.6 用 90 分鐘折疊了二十年的歷史,學術界必須開始嚴肅地追問:下一個被 AI 終結的「二十年懸案」會是什麼?

而我們是否準備好迎接一個由硅基與碳基共同書寫的科學未來?這些問題,或許比反例本身更值得深思。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

36 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前