剛剛!Ilya首個模型曝光了

卻到處都是哥的傳說」的典型代表。親手締造深度學習時代的他,離開OpenAI已兩年有餘。自己創辦的SSI不發模型,不做產品,幾乎從牌桌上消失。可AI圈每隔一段時間,還是會有人追問同一個問題:Ilya在幹嘛?現在,這件問題突然有了一個答案。就在剛剛,X上網友「三隻草莓」爆料,SSI正在探索一種基於TTT(Test-Time Training,測試時訓練)的小型推理引擎。據其描述,這個模型會用專門整理的數據學習「如何學習」,再在解決問題的過程中更新部分權重。即使模型規模不大,也足以和經過更大規模訓練的模型掰手腕。
更進一步,他還在評論區表示,SSI當前版本已經準備就緒,團隊正在把下一代版本的規模直接擴展10倍。更更更關鍵的是,這可能不是一張「未來可期」的支票。按照他的說法,當前版本最快這個8月就可能露面,早期將會向少數用戶開放。也就是說,如果爆料屬實。SSI藏了兩年的第一把劍,可能真要出鞘了。消息出來後,不少網友已經聞到了風向變化。有人直呼,這才開始像真正的智能; 也有人判斷,只要這種路線能順利擴大規模,其他公司將很難追上SSI。但就在大夥已經準備迎接「Ilya王者歸來」的時候,又有消息稱: 這個月可能又不發了。真真假假,假假真真~ 這一次,Ilya的劍到底出不出鞘?
一把會在出手時改招的劍 老實說,Ilya離開OpenAI自立門戶之後,圍繞SSI的傳聞已經多到滿天飛。有人質疑Ilya在深度學習歷史中的真實貢獻,GPT真正的父親其實是Alec Radford; 也有人說他像梁文鋒一樣,轉頭研究量化去了。但這一次爆料能迅速炸開,還真不只是因為「Ilya」三個字自帶流量。而是它確實碰上了幾條已經公開的線索,經梳理至少有三條: 第一條,部署後持續學習,和Ilya去年11月在Dwarkesh Patel播客中表達的觀點高度一致。當時Ilya表示:「AGI」和「預訓練」兩個詞把行業帶偏了。因為人並不是生來便掌握所有工作的通用智能,人真正依靠的是持續學習。
他設想中的超級智能,更像一個極其聰明、求知慾旺盛的15歲少年。它懂得不算多,卻能在部署之後學習編程、醫學和各種工作,在一次次試錯中繼續成長。在Ilya看來,SSI要造的不是一臺出廠時(預訓練結束後)便無所不知的機器,而是一個能夠學會任何工作的心智。這個目標帶有明顯的元學習色彩:模型需要掌握的不只是某項技能,還有學習新技能的方法。Ilya雖然當時沒有提到TTT,但它們指向了同一個問題: 模型能不能在部署之後,繼續改變自己?第二條線索來自英偉達。今年7月27日,英偉達與SSI宣佈長期戰略合作,同時投資SSI,並向其提供下一代Vera Rubin系統。
SSI的算力將增加一個數量級,也就是約10倍,而且據路透社爆料,投資金額高達50億美元。關鍵錢和GPU還不是最重要的部分。英偉達在公告裡特意寫道,SSI過去兩年一直在悄悄推進一條新的研究路線。英偉達罕見地接觸到這項嚴密保密的研究後,決定推動它進入下一階段。換句話說,老黃驗過牌了。至於牌是什麼,他沒說。Ilya自己的表態同樣耐人尋味:是時候擴大SSI了!那……這個擴大規模,就很靈性。Ilya,你這雙眼睛究竟看到了什麼?第三條線索,是TTT本身在過去兩年的進展。最近,越來越多研究者開始嘗試越過「不斷擴展上下文」這條路線,尋找一種更接近持續學習的範式。原因也很簡單。
因為人並不是通過把小抄越寫越長來學習,更不會像《記憶碎片》裡的男主一樣,把遇到的每件事都紋在身上。經歷一件事之後,大腦會調整內部連接。下一次再遇到類似問題時,人已經不是上一次的自己,這也是TTT這條路線真正有意思的地方。簡單來說,TTT(Test-Time Training)就是測試時訓練,它讓模型不再把「訓練」和「推理」徹底切開,而是在真正解決問題時,拿眼前的數據繼續訓練自己,再根據預測結果與目標之間的誤差,調整內部狀態,甚至直接更新一部分參數。爆料中,「三隻草莓」還特意提到了一篇相關的論文—— End-to-End Test-Time Training for Long Context。
簡單來說,這篇論文把長上下文問題重新理解成了一個持續學習問題。傳統長上下文模型會把前文保存在上下文窗口中,每次生成新內容時,再回頭查找需要的信息。論文提出的TTT-E2E則把整段上下文當成訓練數據,讓模型在讀取過程中繼續做下一個Token預測,並把讀到的信息壓進自己的權重。由此,上下文不再只是一張隨時翻閱的作弊小抄,而開始變成真正改變模型本身的學習材料。而且值得補充說明的是,TTT和最近爆火的Agent Harness、Context Engineering 有本質的不同。後兩者依靠外部上下文搭建腳手架,讓模型看到更多信息、調用更多工具,但模型本身並沒有改變。
TTT則更進一步,它不只是讓模型看到更多、調用更多,而是讓模型在解決問題的過程中,直接改變自己。那麼話又說回來了。既然TTT不是新東西,且這麼牛,為什麼沒有早點用起來?原因嘛,也不難猜: 因為模型一旦能在部署後修改自己,就可能學錯、學偏,甚至忘掉原有能力。2016年,微軟聊天機器人Tay上線不到24小時,就在網友誘導下開始輸出攻擊性內容,最終被緊急下線。Tay與TTT並非同一種技術,卻很早就暴露了同一個難題: 安全。所以,就自然有網友提問了這個問題,然後三隻草莓表示Ilya已解決。當然,這句話遠遠算不上證據,甚至更像一句輕飄飄的江湖傳言。
但偏偏,它又繞回了SSI(Safe Superintelligence)名字裡的那個S: Safe。如果Ilya真想造一個部署之後不斷成長的超級智能,那麼「讓它學會學習」其實只解決了一半問題。剩下那一半甚至更難:讓它知道,什麼不能學。所有人為什麼都在等他 說到這裡,還有最後一個問題: 為什麼一則連真實性都沒法確認的匿名爆料,會讓這麼多人興奮?只因為站在山門後面的那個人,是Ilya Sutskever。他是OpenAI聯合創始人、前首席科學家,也是過去十幾年深度學習最有影響力的研究者之一。從AlexNet、Sequence-to-Sequence、AlphaGo到GPT系列,都能看到他的名字。
英偉達在這次合作公告裡還特意提到,Ilya後來還主導了最終通向OpenAI o1等推理模型的研究。換句話說,他最嚇人的地方從來不是發模型多。而是職業生涯裡,幾次在技術路線真正成為共識之前,就已經站到了那條路上。也正因為如此,2024年5月離開OpenAI之後,Ilya下一步要做什麼,一直是AI圈最大的謎題之一。而離開一個月之後成立的SSI更是將神秘刻在了骨子裡。除了目標安全超級智能以外,此後兩年,SSI不發模型、不做產品、不公開論文,外界甚至不知道他們具體在研究什麼。Ilya哪怕偶爾露面,也只是反覆談泛化、持續學習,以及預訓練時代可能正在走向終點。
直到今年7月,英偉達在看過SSI高度保密的研究後決定加碼,並幫助其將算力提升一個數量級,SSI才重回公眾視野。由此,我們再看今天這則TTT爆料,味道就不一樣了。Ilya一直在說,真正的超級智能應該能夠在部署之後繼續學習; 現在又有人爆料,SSI正在做一種會在推理過程中繼續更新自己的模型。當然,現在依然沒有實錘。但如果這兩條線最終真能對上—— 那Ilya閉關兩年磨的,可能真的不是又一個更大的GPT。而是一把會在出手時,自己變招的劍。準備好吧!參考鏈接 [1]https://x.com/i/trending/2087551605553901958 [2]https://www.youtube.
com/watch?v=aR20FWCCjAs 版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

WRC 2026|原生全模態世界模型:從模擬世界到交互世界
世界機器人大會期間,智象未來創辦人梅濤於「物理AI引領者論壇」發表演講,提出原生全模態世界模型從「模擬世界」走向「交互世界」的觀點。他強調即使AI模型智商接近140,高IQ不代表全能,需具備在真實物理世界中穩定完成任務的能力,此為Physical AI發展的關鍵。論壇聚焦通用物理智慧的技術演進與產業路徑,匯聚眾多專家參與。

阿里巴巴達摩院推出肝癌 AI 模型:可精準識別 1 釐米微小腫瘤
作者:遠洋 責編:遠洋 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,阿里巴巴達摩院聯合中國醫科大學附屬盛京醫院等機構研發出肝癌診斷 AI 模型 DAMO LiON,可通過 CT 影像識別微小的肝臟癌變病灶。在兩個月的真實世界前瞻臨床試驗中,該 AI 模型發現了 15 例原本被遺漏的惡性腫瘤,絕大部分為 1 釐米左右的病灶,幫助患者得到及時的手術或藥物治療。
數學自動形式化迎來重大突破:OpenBMB開源MathForm,8B模型憑實力逆襲大廠
OpenBMB團隊開源數學自動形式化框架、數據集與模型MathForm,目標是用Lean4讓機器準確讀懂並形式化驗證數學定理,攻克通用人工智能核心挑戰。其關鍵不是簡單翻譯自然語言,而是將每個數學概念精準映射到Mathlib庫中,為數學與AI交叉研究提供新工具。

加州伯克利數學教授撰文批評學生基礎差,卻被抓包“用 AI 寫的”
作者:清源 責編:清源 評論: 8 月 23 日消息,據英國《衛報》20 日報道,加州大學伯克利分校數學教授茲韋茲德利娜 · 斯坦科娃日前在《舊金山標準報》撰文批評部分學生存在“嚴重”的數學基礎缺失,卻又承認文章本身曾藉助 AI 編輯,由此引發爭議。

美國專家示警:學生依賴“AI 代寫”會削弱思考能力
作者:清源 責編:清源 評論: 8 月 23 日消息,美國學生使用 AI 完成作業、甚至代寫整篇論文的現象已經十分普遍,也有不少學校允許學生在一定範圍內藉助 AI 工具。據《紐約時報》當地時間 17 日報道,越來越多專家擔心,問題可能不只是學生會不會寫文章,而是長期依賴 AI 可能削弱他們本身的思考能力。