離開OpenAI和Google後,兩位大模型核心負責人決定卷下一代架構

重點摘要
離開OpenAI和Google的兩位大模型核心負責人,不約而同投入下一代AI架構的研發,挑戰現行Transformer的運算效率與長序列處理瓶頸。產業關注焦點從擴大模型規模轉向架構變革,預期未來一兩年內可能迎來重大突破。
近期,人工智慧領域出現一項備受關注的動向:兩位分別來自 OpenAI 與 Google 的關鍵研發負責人,在離開各自原先任職的頂尖實驗室後,不約而同地將下一步賭注押在下一代 AI 架構上。這兩位曾主導大型語言模型核心研發的資深專家,過去在業界累積了深厚的實戰經驗,如今卻選擇跳出 Transformer 主導的既有框架,從零開始探索截然不同的技術路線。業界觀察指出,這項選擇背後反映的,是整個大模型產業正在經歷一場深層的技術反思。過去幾年,業界普遍將注意力集中在擴大模型參數規模與訓練資料量,認為「越大越好」是通往通用人工智慧的捷徑。
然而,隨著模型規模持續攀升,現行 Transformer 架構在運算效率、長序列處理能力與推理成本上的瓶頸也日益明顯,迫使研究人員開始思考更根本的結構性變革。Transformer 自 2017 年問世以來,憑藉其並行計算優勢與自注意力機制,成為自然語言處理乃至多模態模型的基石。但隨著上下文視窗擴展至數萬甚至數十萬 tokens,自注意力的計算複雜度呈二次方成長,導致硬體記憶體與延遲快速惡化。此外,在推理階段,Transformer 需要逐 token 生成輸出,每一次生成都需重新計算部分注意力,使得長文本生成的效率大打折扣。這些限制已成為當前大規模部署的主要痛點。
因此,下一代 AI 架構需要具備哪些能力,成為這波技術攻關的核心問題。根據目前主流觀點,新架構必須在同等或更少的算力條件下,支援更長的上下文、更低的推理延遲,同時維持甚至提升模型對複雜任務的理解與生成能力。這不僅關乎模型本身的設計,更牽動訓練與部署的整體效率,從資料流程、硬體加速到能耗成本,都需一併納入考量。兩位關鍵人物的離職,正是對上述困境的直接回應。據了解,其中一位曾在 OpenAI 主導多個大型語言模型的核心研發,參與過從早期 GPT 到後續版本的重要技術路線決定;另一位則在 Google 長期耕耘,對 Transformer 架構的改良與擴展有深刻理解。
他們在頂尖環境中累積的經驗,使他們比多數人更早意識到現有架構的極限,也讓他們更有能力去設計全新的替代方案。目前,兩人的具體新動向尚未完全公開,但業界傳言他們可能各自成立新創公司,或加入現有研究機構,專注於開發非 Transformer 的基礎模型架構。這些實驗路線涵蓋狀態空間模型(State Space Models)、線性注意力機制、遞迴神經網路變體,以及基於物理或生物啟發的計算架構等。儘管具體技術細節仍屬保密,但其共同目標都是在運算效率與模型能力之間取得更好的平衡。值得注意的是,這並非單一事件。
過去一年間,已有數起類似的高階研究人員離開大型科技公司、自行創業的案例,而他們的共同特點,就是幾乎都將探索方向指向 Transformer 之外的架構。這股趨勢逐漸形成一股「脫離 Transformer」的運動,促使業界重新審視深度學習的基礎假設。從產業角度來看,這波架構變革可能有深遠影響。若新架構能在不犧牲模型品質的前提下,大幅降低訓練與推理成本,那麼原本受限於算力瓶頸的中小型企業或研究機構,將有機會參與更大型的模型開發。同時,邊緣裝置上的部署也將變得更加可行,加速 AI 在手機、物聯網、自動駕駛等場景的落地。
另一方面,現有以 Transformer 為核心的生態系——包括 GPU 運算庫、框架、訓練工具鏈——勢必需要隨之調整。若新架構採用不同的計算模式,現有的硬體優化策略可能不再適用,這將催生新的軟硬體協同設計需求。對於 NVIDIA 等晶片廠商而言,這既是挑戰也是機會。不過,也有專家提醒,架構創新並非一蹴可幾。Transformer 過去幾年之所以能快速普及,除了其本身效能優異外,也受益於大量開源工具與社群積累的經驗。新架構若要真正取代 Transformer,不僅需要理論上的突破,還需要建立完整的生態系統,包括訓練穩定性、可擴展性、以及與既有資料管線的相容性。
兩位核心負責人的行動,預示著 AI 產業可能在未來一兩年內迎來架構層面的重大突破,進而改變大模型發展的整體格局。無論最終結果如何,他們選擇離開成熟的環境、投入未知領域的勇氣,已經為學術界與產業界注入新的思考動力。業界正密切關注這條脫離 Transformer 的技術路線,將如何影響下一波人工智慧的進展。
Related
相關文章

天才,對AI發展到底有多重要?
加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

微軟 Copilot 新版圖標洩露,趨向扁平化、設計更簡潔
微軟 Copilot 圖標在 Edge Canary 測試版中意外曝光,新設計去除了 3D 陰影,變得更加扁平化。據悉,該圖標還曾短暫出現在新版 Microsoft 365 應用中,但上線時間尚未確定。#微軟Copilot#

Jeff Dean們,趕在貝葉斯AI到來之前跳船
Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時
首頁 > 智能時代>人工智能 谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時 2026/8/7 14:11:01 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 8 月 7 日消息,谷歌 DeepMind 團隊昨日(8 月 7 日)發佈博文,宣佈推出 WeatherNext Cyclones 天氣預測模型,主要。

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分
Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

智元下架了首席科學家羅劍嵐
智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。