離開OpenAI和Google後,兩位大模型核心負責人決定卷下一代架構

2026年8月5日 15:31
離開OpenAI和Google後,兩位大模型核心負責人決定卷下一代架構

重點摘要

離開OpenAI和Google的兩位大模型核心負責人,不約而同投入下一代AI架構的研發,挑戰現行Transformer的運算效率與長序列處理瓶頸。產業關注焦點從擴大模型規模轉向架構變革,預期未來一兩年內可能迎來重大突破。

站內 AI 整理稿

近期,人工智慧領域出現一項備受關注的動向:兩位分別來自 OpenAI 與 Google 的關鍵研發負責人,在離開各自原先任職的頂尖實驗室後,不約而同地將下一步賭注押在下一代 AI 架構上。這兩位曾主導大型語言模型核心研發的資深專家,過去在業界累積了深厚的實戰經驗,如今卻選擇跳出 Transformer 主導的既有框架,從零開始探索截然不同的技術路線。 業界觀察指出,這項選擇背後反映的,是整個大模型產業正在經歷一場深層的技術反思。過去幾年,業界普遍將注意力集中在擴大模型參數規模與訓練資料量,認為「越大越好」是通往通用人工智慧的捷徑。然而,隨著模型規模持續攀升,現行 Transformer 架構在運算效率、長序列處理能力與推理成本上的瓶頸也日益明顯,迫使研究人員開始思考更根本的結構性變革。 Transformer 自 2017 年問世以來,憑藉其並行計算優勢與自注意力機制,成為自然語言處理乃至多模態模型的基石。但隨著上下文視窗擴展至數萬甚至數十萬 tokens,自注意力的計算複雜度呈二次方成長,導致硬體記憶體與延遲快速惡化。此外,在推理階段,Transformer 需要逐 token 生成輸出,每一次生成都需重新計算部分注意力,使得長文本生成的效率大打折扣。這些限制已成為當前大規模部署的主要痛點。 因此,下一代 AI 架構需要具備哪些能力,成為這波技術攻關的核心問題。根據目前主流觀點,新架構必須在同等或更少的算力條件下,支援更長的上下文、更低的推理延遲,同時維持甚至提升模型對複雜任務的理解與生成能力。這不僅關乎模型本身的設計,更牽動訓練與部署的整體效率,從資料流程、硬體加速到能耗成本,都需一併納入考量。 兩位關鍵人物的離職,正是對上述困境的直接回應。據了解,其中一位曾在 OpenAI 主導多個大型語言模型的核心研發,參與過從早期 GPT 到後續版本的重要技術路線決定;另一位則在 Google 長期耕耘,對 Transformer 架構的改良與擴展有深刻理解。他們在頂尖環境中累積的經驗,使他們比多數人更早意識到現有架構的極限,也讓他們更有能力去設計全新的替代方案。 目前,兩人的具體新動向尚未完全公開,但業界傳言他們可能各自成立新創公司,或加入現有研究機構,專注於開發非 Transformer 的基礎模型架構。這些實驗路線涵蓋狀態空間模型(State Space Models)、線性注意力機制、遞迴神經網路變體,以及基於物理或生物啟發的計算架構等。儘管具體技術細節仍屬保密,但其共同目標都是在運算效率與模型能力之間取得更好的平衡。 值得注意的是,這並非單一事件。過去一年間,已有數起類似的高階研究人員離開大型科技公司、自行創業的案例,而他們的共同特點,就是幾乎都將探索方向指向 Transformer 之外的架構。這股趨勢逐漸形成一股「脫離 Transformer」的運動,促使業界重新審視深度學習的基礎假設。 從產業角度來看,這波架構變革可能有深遠影響。若新架構能在不犧牲模型品質的前提下,大幅降低訓練與推理成本,那麼原本受限於算力瓶頸的中小型企業或研究機構,將有機會參與更大型的模型開發。同時,邊緣裝置上的部署也將變得更加可行,加速 AI 在手機、物聯網、自動駕駛等場景的落地。 另一方面,現有以 Transformer 為核心的生態系——包括 GPU 運算庫、框架、訓練工具鏈——勢必需要隨之調整。若新架構採用不同的計算模式,現有的硬體優化策略可能不再適用,這將催生新的軟硬體協同設計需求。對於 NVIDIA 等晶片廠商而言,這既是挑戰也是機會。 不過,也有專家提醒,架構創新並非一蹴可幾。Transformer 過去幾年之所以能快速普及,除了其本身效能優異外,也受益於大量開源工具與社群積累的經驗。新架構若要真正取代 Transformer,不僅需要理論上的突破,還需要建立完整的生態系統,包括訓練穩定性、可擴展性、以及與既有資料管線的相容性。 兩位核心負責人的行動,預示著 AI 產業可能在未來一兩年內迎來架構層面的重大突破,進而改變大模型發展的整體格局。無論最終結果如何,他們選擇離開成熟的環境、投入未知領域的勇氣,已經為學術界與產業界注入新的思考動力。業界正密切關注這條脫離 Transformer 的技術路線,將如何影響下一波人工智慧的進展。

Related

相關文章

何夕2077研究與前沿

視覺語言模型心智測試

視覺語言模型心智測試。 多模態模型存在心智斷裂現象。實驗結果見心智理論論文原文所述。測試顯示模型 ��� 任務表現差異很大。自我偏差在導演任務中達到了高位。動畫測試下其表現更接近自閉成人。

9 小時前

人形機器人做手術上《Nature》,臨床成熟度拿了2.5分

人形機器人成功完成手術任務,相關成果登上《Nature》,並首次獲得臨床成熟度評分2.5分。該分數代表技術已完成概念驗證與初步可行性測試,但距離大規模臨床應用仍有一段距離。專家指出,要真正參與臨床手術,仍需克服精密控制、即時反饋與人機協作等挑戰。

13 小時前
MarkTechPost AI研究與前沿

Cursor 開源 Mixture-of-Kittens (MoK):專為 GB300 NVL72 機架設計的確定性 MoE 訓練巨內核

Cursor Research 正式開源 Mixture-of-Kittens(MoK),這是其 Composer 模型背後的混合專家(MoE)訓練巨內核。MoK 將所有 MoE 通訊與計算步驟融合為單一確定性內核。據 Cursor 團隊報告,其吞吐量最高可達最強公開基準的 2.37 倍,目前已支援數萬顆 GPU 的 Composer 訓練。部署門檻較高:需 NVIDIA Blackwell SM100 或 SM103 GPU(即 GB200 NVL72 或 GB300 NVL72 機架),並要求 Python 3.12+、PyTorch 2.10+ 及 CUDA toolkit 13.0+,且 GPU 間緩衝區依賴 PyTorch 對稱記憶體。因此,實際採用者限於擁有或租用 NVL72 容量的機構,如前沿實驗室與資金充足的模型新創公司。MoK 以 Apache-2.0 授權發布於 GitHub。

14 小時前