離開OpenAI和Google後,兩位大模型核心負責人決定卷下一代架構

重點摘要
離開OpenAI和Google的兩位大模型核心負責人,不約而同投入下一代AI架構的研發,挑戰現行Transformer的運算效率與長序列處理瓶頸。產業關注焦點從擴大模型規模轉向架構變革,預期未來一兩年內可能迎來重大突破。
近期,人工智慧領域出現一項備受關注的動向:兩位分別來自 OpenAI 與 Google 的關鍵研發負責人,在離開各自原先任職的頂尖實驗室後,不約而同地將下一步賭注押在下一代 AI 架構上。這兩位曾主導大型語言模型核心研發的資深專家,過去在業界累積了深厚的實戰經驗,如今卻選擇跳出 Transformer 主導的既有框架,從零開始探索截然不同的技術路線。 業界觀察指出,這項選擇背後反映的,是整個大模型產業正在經歷一場深層的技術反思。過去幾年,業界普遍將注意力集中在擴大模型參數規模與訓練資料量,認為「越大越好」是通往通用人工智慧的捷徑。然而,隨著模型規模持續攀升,現行 Transformer 架構在運算效率、長序列處理能力與推理成本上的瓶頸也日益明顯,迫使研究人員開始思考更根本的結構性變革。 Transformer 自 2017 年問世以來,憑藉其並行計算優勢與自注意力機制,成為自然語言處理乃至多模態模型的基石。但隨著上下文視窗擴展至數萬甚至數十萬 tokens,自注意力的計算複雜度呈二次方成長,導致硬體記憶體與延遲快速惡化。此外,在推理階段,Transformer 需要逐 token 生成輸出,每一次生成都需重新計算部分注意力,使得長文本生成的效率大打折扣。這些限制已成為當前大規模部署的主要痛點。 因此,下一代 AI 架構需要具備哪些能力,成為這波技術攻關的核心問題。根據目前主流觀點,新架構必須在同等或更少的算力條件下,支援更長的上下文、更低的推理延遲,同時維持甚至提升模型對複雜任務的理解與生成能力。這不僅關乎模型本身的設計,更牽動訓練與部署的整體效率,從資料流程、硬體加速到能耗成本,都需一併納入考量。 兩位關鍵人物的離職,正是對上述困境的直接回應。據了解,其中一位曾在 OpenAI 主導多個大型語言模型的核心研發,參與過從早期 GPT 到後續版本的重要技術路線決定;另一位則在 Google 長期耕耘,對 Transformer 架構的改良與擴展有深刻理解。他們在頂尖環境中累積的經驗,使他們比多數人更早意識到現有架構的極限,也讓他們更有能力去設計全新的替代方案。 目前,兩人的具體新動向尚未完全公開,但業界傳言他們可能各自成立新創公司,或加入現有研究機構,專注於開發非 Transformer 的基礎模型架構。這些實驗路線涵蓋狀態空間模型(State Space Models)、線性注意力機制、遞迴神經網路變體,以及基於物理或生物啟發的計算架構等。儘管具體技術細節仍屬保密,但其共同目標都是在運算效率與模型能力之間取得更好的平衡。 值得注意的是,這並非單一事件。過去一年間,已有數起類似的高階研究人員離開大型科技公司、自行創業的案例,而他們的共同特點,就是幾乎都將探索方向指向 Transformer 之外的架構。這股趨勢逐漸形成一股「脫離 Transformer」的運動,促使業界重新審視深度學習的基礎假設。 從產業角度來看,這波架構變革可能有深遠影響。若新架構能在不犧牲模型品質的前提下,大幅降低訓練與推理成本,那麼原本受限於算力瓶頸的中小型企業或研究機構,將有機會參與更大型的模型開發。同時,邊緣裝置上的部署也將變得更加可行,加速 AI 在手機、物聯網、自動駕駛等場景的落地。 另一方面,現有以 Transformer 為核心的生態系——包括 GPU 運算庫、框架、訓練工具鏈——勢必需要隨之調整。若新架構採用不同的計算模式,現有的硬體優化策略可能不再適用,這將催生新的軟硬體協同設計需求。對於 NVIDIA 等晶片廠商而言,這既是挑戰也是機會。 不過,也有專家提醒,架構創新並非一蹴可幾。Transformer 過去幾年之所以能快速普及,除了其本身效能優異外,也受益於大量開源工具與社群積累的經驗。新架構若要真正取代 Transformer,不僅需要理論上的突破,還需要建立完整的生態系統,包括訓練穩定性、可擴展性、以及與既有資料管線的相容性。 兩位核心負責人的行動,預示著 AI 產業可能在未來一兩年內迎來架構層面的重大突破,進而改變大模型發展的整體格局。無論最終結果如何,他們選擇離開成熟的環境、投入未知領域的勇氣,已經為學術界與產業界注入新的思考動力。業界正密切關注這條脫離 Transformer 的技術路線,將如何影響下一波人工智慧的進展。
Related
相關文章
視覺語言模型心智測試
視覺語言模型心智測試。 多模態模型存在心智斷裂現象。實驗結果見心智理論論文原文所述。測試顯示模型 ��� 任務表現差異很大。自我偏差在導演任務中達到了高位。動畫測試下其表現更接近自閉成人。

世界模型的下一步?牛津、NUS團隊提出「心智世界建模」MWM:遠不止物理世界
這篇消息聚焦「世界模型的下一步?牛津、NUS團隊提出「心智世界建模」MWM:遠不止物理世界」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

人形機器人做手術上《Nature》,臨床成熟度拿了2.5分
人形機器人成功完成手術任務,相關成果登上《Nature》,並首次獲得臨床成熟度評分2.5分。該分數代表技術已完成概念驗證與初步可行性測試,但距離大規模臨床應用仍有一段距離。專家指出,要真正參與臨床手術,仍需克服精密控制、即時反饋與人機協作等挑戰。
Cursor 開源 Mixture-of-Kittens (MoK):專為 GB300 NVL72 機架設計的確定性 MoE 訓練巨內核
Cursor Research 正式開源 Mixture-of-Kittens(MoK),這是其 Composer 模型背後的混合專家(MoE)訓練巨內核。MoK 將所有 MoE 通訊與計算步驟融合為單一確定性內核。據 Cursor 團隊報告,其吞吐量最高可達最強公開基準的 2.37 倍,目前已支援數萬顆 GPU 的 Composer 訓練。部署門檻較高:需 NVIDIA Blackwell SM100 或 SM103 GPU(即 GB200 NVL72 或 GB300 NVL72 機架),並要求 Python 3.12+、PyTorch 2.10+ 及 CUDA toolkit 13.0+,且 GPU 間緩衝區依賴 PyTorch 對稱記憶體。因此,實際採用者限於擁有或租用 NVL72 容量的機構,如前沿實驗室與資金充足的模型新創公司。MoK 以 Apache-2.0 授權發布於 GitHub。

數學家24小時駁回OpenAI攻破的猜想!“AI證對了每句話,但已跟原猜想無關”
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 數學家24小時駁回OpenAI攻破的猜想!

AI 輔助“推翻”考拉茲猜想失敗,Lean 4.32.2 修復內核漏洞
一項藉助AI輔助、聲稱推翻考拉茲猜想的Lean形式化證明被確認無效,原因是Lean內核存在漏洞,導致系統能無條件接受假命題。Lean團隊在收到報告後迅速發布4.32.2版本修復該漏洞,該漏洞涉及內核處理嵌套歸納類型時忽略幽靈類型參數的檢查。