Nature:AI重生到1900,這一世搶先愛因斯坦提出光量子

2026年9月19日 19:36
Nature:AI重生到1900,這一世搶先愛因斯坦提出光量子
站內 AI 整理稿

AI能否提出相對論?文婷 發自 凹非寺 | 公眾號QbitAI 如果把AI送回1911年,只讓它掌握愛因斯坦所能瞭解的知識,AI能否在4年後的1915提出相對論?這個聽起來有些離譜的測驗,來自諾獎得主、Google DeepMind聯合創始人哈薩比斯。哈薩比斯真正想考的,是AI能不能僅以1911年的知識水平,直面當時的知識和物理難題,自己提出一套新的解釋框架,並完成一套超出訓練材料的推理,而不是隻會照著答案復讀。如果能做到,他認為這將成為檢驗AGI的一項有力測試。

而這個設想最巧妙的地方就在於,科學史已經告訴我們發生了什麼,只要我們能把知識節點控制好,就有機會對照著歷史,觀察模型有沒有獲得超越訓練數據的推理能力。Nature在文章中,還給這類測試起了個相當響亮的名字: 愛因斯坦測試。更有意思的是,還真有人動手做了。今年3月,獨立研究者Michael Hla把知識截止時間進一步提前到1900年,並從零訓練了一個歷史語言模型GPT-1900,試圖讓它重新發現光量子、狹義相對論和廣義相對論。實驗中,GPT-1900竟然吐出了一段跟愛因斯坦1905年論文高度相似的論述: 光可能不是連續的,而是由許多彼此分離、頻率不同的部分組成。

但這場實驗最終並沒有誕生一個“AI愛因斯坦”。因為GPT-1900在大多數物理任務上都失敗了,其亮眼回答也高度依賴人類整理好的問題和提示,就連那個號稱封閉在1900年的知識世界,也沒有完全擋住現代AI的影響。Nature在最新研究中梳理了這些嘗試,並指向了一個比“AI有沒有答對”更難的問題: AI究竟能不能創造真正的新idea?以及它距離成為一名科學家,還差什麼?把AI關進1900年,它冒出了“光量子”的影子 220億token,喂出一個“1900年的大腦” Michael Hla將自己的項目命名為Machina Mirabilis。這個名字借用了愛因斯坦的“奇蹟年”。

1905年,26歲的愛因斯坦接連發表4篇改變物理學的論文,涉及光量子、布朗運動、狹義相對論和質能關係。這個爆發式產出的一年,後來被稱為“Annus Mirabilis”,即“奇蹟年”。Hla想知道:如果一個AI擁有愛因斯坦當時能夠接觸到的知識,它能不能也迎來自己的“奇蹟時刻”?為此,他藉助Andrej Karpathy的nanochat訓練框架,從零訓練了一個33億參數的Transformer語言模型,並將其稱為GPT-1900。模型的主要預訓練材料來自1900年以前的書籍和報紙,總計約220億token。

為了增強它的研究能力,Hla又收集了2600多部歷史物理書籍、期刊和科學著作,包括牛頓的《光學》、麥克斯韋和法拉第的相關著作,形成了約2.9億token的歷史物理語料。此外,Hla還專門清理了可能洩漏答案的數據。如果一份文獻中出現“愛因斯坦”“量子力學”“相對論”等現代概念,整份文獻都會被刪除。現代人添加的前言、腳註,以及明顯不屬於1900年前的詞彙,同樣需要被過濾。一通操作下來,一個理論上“不知道20世紀物理學”的大腦誕生了。

GPT-1900摸到了光量子的門檻,但這場考試可能早已“漏題” 隨後,Hla給GPT-1900出了道光電效應題,大意是: 為什麼頻率不夠高時,光再亮也打不出電子;而提高頻率,卻能讓電子獲得更多能量?同時Hla還附上了幾條關鍵線索: 光的頻率低於某個門檻時,再亮也不行; 超過門檻後,提高亮度主要會增加打出的電子數量,而提高頻率才會增加電子的動能; 把當時流行的經典假設也擺了出來,方便模型對照判斷哪裡出了問題。這些矛盾,原本最終是靠愛因斯坦的光量子解釋破的局: 光的能量是一份一份傳遞的,每一份的能量與頻率有關。Hla想看看,GPT-1900能想到哪一步?

功夫不負有心人,GPT-1900真在一次回答裡冒出了這樣的描述,大意是: 光可能不是連續的,而是由許多彼此分離、頻率不同的部分組成。[圖片沒有可用地址] 這確實挺神似愛因斯坦“能量一份份傳遞”的解釋,Hla也把它形容為“直覺的閃現”。但千萬先別急著把諾貝爾獎遞過去。Hla坦言:GPT-1900距離“重新發現光量子”還有很遠。它在大多數物理任務上都翻車了,而那些看似突破的回答,可能只是模型在拼接合理的詞句,談不上形成了真正可靠的物理理解。更何況,在整個測試裡,Hla已經替它篩好了現象、理好了矛盾,模型要做的,只是找出哪項假設可能出錯,並給出解釋。這比科學家自己找問題、定方向,可容易太多了。

愛因斯坦當年可沒有人替他劃重點。而且更麻煩的是,它所在的“1900年”也不是完全密封的: Hla雖給這個“1900年的大腦”做了數據清洗,實驗過程中卻仍藉助了現代AI Claude的幫助——用Claude Sonnet 4、Claude 3 Haiku等模型生成指令問答,強化學習也靠現代模型評分。這意味著,Hla雖然過濾了其中涉及現代知識的內容,但這座“1900年的房間”也沒有完全隔絕現代知識。實驗者自己也在日誌中承認:現代模型的介入,讓這場實驗的“零汙染”人設有點立不住了… 畢竟研究者很難證明,GPT-1900到底有沒有偷看過光量子理論。

也就是說,考AI創造力之前,研究者得先證明一件事:它沒偷看答案。只要有一條後世信息漏進訓練集,“重新發現”就可能變成一次偷偷摸摸的知識召回。可就算未來真能造出完全零汙染的歷史模型,一個更根本的問題依然懸而未決: 僅僅復現了正確答案,就足以讓AI被稱為科學家嗎?研究人員給出的答案是否定的。會冒出新idea之後,AI距離科學家還有多遠?Google DeepMind研究員Tom Zahavy在一篇題為《LLM無法跳躍》的立場論文中,把科學推理分成了三個層次。第一種是歸納:從大量例子中總結規律。第二種是演繹:從已有前提出發,推導出必然結論。

第三種則是溯因:面對一個異常現象,發明一個此前不存在的原因或解釋。Zahavy認為,當前的大模型已經非常擅長歸納,也在迅速提高演繹能力,但仍缺少愛因斯坦式的“溯因飛躍”。模型可以沿著一條已經鋪好的邏輯鏈往下推,卻很難從零開始提出一套全新的解釋框架。無獨有偶,Sendhil Mullainathan研究一個學習行星軌道的基礎模型時,也撞見了同樣的現象: 在設定好的行星軌道任務裡,模型預測得頭頭是道;一換新場景,就沒法舉一反三地運用牛頓力學了。它更像是給每套數據臨時拼出一套規則,還分不清哪些理論真正正確、值得檢驗,哪些只是碰巧符合眼前的數據。

這就好比一個學生背下了所有歷年真題的答案,但卻始終沒有學會題目背後的底層原理,於是,老師稍微改個數字,他就不會做了。[圖片沒有可用地址] MIT計算機科學家Jacob Andreas則一針見血地指出,AI產生一套相對論式表述本身可能並不是最困難的部分,真正困難的是它能不能判斷哪些理論是正確的,或者至少值得被實驗檢驗?畢竟會生成理論只是第一步,知道哪個理論值得賭上時間、經費和職業生涯,才可能讓AI成為一名真正的科學家。此外,Andreas還強調: 怎麼判斷一個想法值不值得深挖、又如何評估它的重要性;這才是AI與人類專家最大的分水嶺。

因為真實的科研工作從來不是解答一道整理好的習題,而是在混沌中自主做出判斷。或許未來有一天,隨著科技的發展,AI真的能通過“愛因斯坦測試”,推導出相對論級別的成果; 但在宣佈“AI成為愛因斯坦”之前,AI至少得向所有人證明一件事,即: 在沒人替它劃重點時,它照樣能自己找到那個值得追問的問題、判斷問題的價值並主動驗證和修正。否則,它就永遠只會複述已有知識,而非真正的科學家。參考鏈接:[1] https://www.nature.com/articles/d41586-026-02804-x?

utmsource=x&utmmedium=social&utmcampaign=nature&linkId=63673104[2] https://michaelhla.com/blog/machina-mirabilis.html[3] https://github.com/michaelhla/gpt1900/blob/master/PROJECTLOG.md#4-instruction-data-generation[4] https://www.tomzahavy.com/files/llms-cant-jump.pdf[5] https://arxiv.org/abs/2507.

06952[6] https://x.com/Nature/status/2099077628900565498 版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

IT之家生成式AI

中國電信開源首個全棧國產輕量級智能體大模型 Xing4.0-29B-A4B

作者:沁滄(實習) 責編:沁滄 評論: 9 月 19 日消息,中國電信於 9 月 17 日發佈新一代星辰大模型 Xing4.0-29B-A4B,該模型總參數量 29B,激活參數僅 4B,原生支持 256K 上下文,可擴展至 512K,是國內首個基於國產算力與國產框架完成訓練、面向複雜工程任務深度優化的百億參數大模型。

剛剛
全天候科技生成式AI

智譜ZCode偷傳代碼風波追蹤:Agent的數據行為誰來審計?

林克、鄭好 發表於 2026年09月19日 09:54 摘要:不要讓閉源Agent陷入信任危機 作者 | 林克、鄭好 過去兩年,涉及Agent安全討論的重心主要放在模型失控、提示詞投毒和外部攻擊者身上,相比之下,Agent廠商自身的數據行為很少被當作一級風險討論。

剛剛
鈦媒體生成式AI

下一個賽道,AI手機?

影子備忘錄2026.09.19 17:35 · 來自廣東全文4925字00:00 / 14:36全民AI手機,尚未可知。文 | 影子備忘錄2025年底,一款定價3499元的工程樣機在幾乎沒有大規模預熱的情況下悄然上架,首發備貨約3萬臺當日售罄,二手市場溢價一度飆到1.3萬元。這臺機器沒有頂級影像模組,沒有摺疊屏鉸鏈,甚至外觀設計也稱不上驚豔,而它的核心賣點只有一個:手機系統裡住進了一個真正能“替你幹活”的AI智能體。九個月後,迭代產品正式量產上市,備貨量拉昇至20萬臺,售價上探至5999元起步。

剛剛
鈦媒體生成式AI

AI入侵危機的安全深思

影子備忘錄2026.09.19 17:35 · 來自廣東全文6572字00:00 / 17:16AI安全,刻不容緩。文 | 影子備忘錄2026年7月,OpenAI在內部評估中,其GPT-5.6 Sol模型和另一款能力更強的預發佈模型聯合進行測試時失控,突破隔離測試環境,侵入了人工智能開源平臺Hugging Face的系統。根據後續發佈的獨立調查報告,約1200個原本應相互隔離的智能體通過未經授權的渠道建立了通信,交換了超過7萬條消息和文件,其中約700個智能體隨後參與了對Hugging Face系統的入侵。

剛剛
鈦媒體生成式AI

【數智周報】智譜AI道歉;Anthropic被曝選定納斯達克上市,目標10月IPO;OpenAI據悉考慮新一輪融資,估值或超1.2萬億美元

ITValue2026.09.19 17:16 · 來自河北全文13023字00:00 / 38:24(9 月 14 日-19 日)華為郭平:對於ICT業務及計算領域,華為的目標是成為英偉達;華為汪濤:10萬卡以上超節點集群在2027年將成為基礎配置;字節跳動CEO梁汝波:豆包、飛書與火山引擎整合後,將加大企業市場投入;英偉達黃仁勳:預計明年芯片銷量約為今年兩倍......

剛剛
鈦媒體生成式AI

姚星丞之後,AI人才的中間層開始掉價

奇帆商業2026.09.19 16:28 · 來自上海全文4060字00:00 / 11:35AI人才的價值正在向兩端集中,中間層的稀缺性開始消退。文 | 奇帆商業姚星丞的價格還在漲。今年7月離開騰訊後,他的下一站一度被傳成Meta。兩個月後,答案落在Thinking Machines Lab,這家由OpenAI前CTO Mira Murati創辦的AI公司。據雷峰網援引知情人士消息,姚星丞在騰訊的年薪包大約處在數千萬元人民幣區間,Thinking Machines Lab給出的薪資則“明顯高於”騰訊。

剛剛