Gemini 4 Pro疑似洩露,“AI減速”又成空話

2026年9月19日 10:56
Gemini 4 Pro疑似洩露,“AI減速”又成空話
站內 AI 整理稿

字母AI2026.09.19 10:54 · 來自北京全文4800字00:00 / 12:44RSI正在逼近,三巨頭誰也沒停。文 | 字母AI前幾個月,OpenAI和Anthropic輪番把旗艦模型往前推,谷歌卻顯得異常安靜。Flash幾乎3週一更,3.6、3.7、3.8連續往前,但代表最高能力上限的Pro遲遲沒有動靜。直到這兩天,大模型盲測競技場Arena裡,突然冒出一個掛著gemini-3.8-flash名字的模型。開發者一上手就發現了不對勁,真正的Gemini 3.8 Flash已經發布了,它該是什麼水平,大家心裡有數。可這個“3.

8 Flash”,寫代碼、做SVG、跑Agent,表現明顯又往上跳了一截。幾輪實測之後,一個猜測迅速擴散開來:這個模型很有可能是谷歌藏在標籤後面的下一代旗艦——Gemini 4 Pro。緊接著,一張更誇張的benchmark對比圖開始瘋傳。編碼、Agent、推理,多項成績都把GPT-6 Astra和Claude Fable壓在下面。就在幾天前,幾家最重要的AI公司還在公開討論,是不是該慢一點。現在,減速的聲音還沒落地,新一輪競賽已經開始狂飆。而這個疑似Gemini 4 Pro的“神級模型”背後,還有一個更危險的關鍵詞:RSI。

Gemini 4 Pro疑似洩露9月2日,Google剛剛正式發佈Gemini 3.8 Flash。官方稱,這是Gemini 3系列最新一代Flash,在軟件工程、Agent任務和複雜多步推理上都有明顯提升;從3.7 Flash到3.8 Flash,中間只隔了三週。所以,當Arena裡又出現一個同樣掛著gemini-3.8-flash名字的模型時,開發者很快就察覺到了異常。真正的3.8 Flash已經擺在那裡,大家有現成的參照物。而這個模型看起來明顯更強,分明是Pro模型才會有的實力。最早引發傳播的一批實測,集中在SVG、網頁和3D場景上。

開發者Harshith讓它用SVG畫一隻側面的家貓,並把結果與GPT-6 Astra Max和正式版Gemini 3.8 Flash放在一起。Arena裡的這個版本,無論輪廓、比例還是細節完整度,都和正式3.8 Flash拉開了肉眼可見的差距。從左到右依次為“4 Pro”、Astra、3.8 FlashX網友@thtbee從多個角度連續測試了這個疑似Gemini 4 Pro的模型。一個Voxel風格寶塔,模型跑了8分鐘,直接生成了一整套可交互3D場景。一架空客H145直升機,它只花大約10分鐘就搭出了完整的3D展示頁面,細節非常豐富。不過,這位網友表示,頁面底部的UI元素“看起來有點糟”。

在網頁設計上,模型花了大約14分鐘就做出了一套單色主題網站,整體非常乾淨、完整。過去Gemini經常被吐槽的設計品味問題,這次似乎終於被補上了。另一位網友@MrSalio直接拿這個疑似Gemini 4 Pro的模型去做遊戲。成品畫面足夠流暢,世界生成和遊戲設計的完成度也很高。更關鍵的一條線索來自開發者Qwinah。他聲稱自己成功“幽靈路由”到了Gemini 4 Pro的後端,並貼出了一張疑似內部終端信息的截圖。根據他的說法,這個模型的內部標識裡直接出現了G4P-ARGON和VIA3.

8FLASH,最大輸出達到256K,上下文窗口超過1000萬token,還帶有跨會話永久記憶、無需API即可聯網、後端自動編譯運行腳本,甚至物理機器人控制等能力。如果這些信息屬實,那它顯然已經不是一次普通的Flash升級。與此同時,一張Gemini 4 Pro的benchmark對比表也開始在社區瘋傳。按照圖裡的數據,Gemini 4 Pro在軟件工程測試DeepSWE v1.1拿到88.7%,在終端Agent測試Terminal-Bench 2.1達到95.3%,在專家級知識推理測試HLE-Verified衝到72.1%,在電腦操作Agent測試OSWorld 2.0達到86.8%。

更誇張的是,在衡量真實知識工作的GDPval-AA v2上,它被寫成2064 Elo,直接突破2000大關。如果這些數據屬實,Gemini 4 Pro簡直能“拳打Fable,腳踢Astra”,一舉站上前沿模型之巔。但越是誇張,越需要小心。值得注意的是,這張benchmark表,和Qwinah“挖”出來的那張疑似後端截圖,並不完全對得上;benchmark表裡作為對照項的Astra,得分也不符合官方數據;兩份材料都沒有Google、Arena或相關benchmark官方背書,目前仍然只是社區流傳的信息。唯一能被確認的只有那個名叫gemini-3.

8-flash名字的模型,和完全不符合Gemini 3.8 Flash的表現。但大家之所以會迅速把答案指向Gemini 4 Pro,還有一個非常重要的原因:Google的Pro模型,已經空窗太久了。Gemini 3.5 Pro遲遲沒有正式落地,Gemini 4早已確認進入訓練,過去幾個月,Flash一代代往前推,真正代表能力上限的Pro線始終沒有新型號出現。現在,一個能力明顯異常的“3.8 Flash”突然從Arena裡鑽了出來。於是,猜測自然越來越像樣——Google可能根本沒打算把真正的大升級留給3.5 Pro,直接憋到了Gemini 4 Pro。

Gemini 4 Pro背後,更大的關鍵詞是RSI如果說Gemini 4 Pro目前還只是社區傳言,那麼更值得注意的是,谷歌正在明顯加快AI參與模型研發的速度。在這一次的Gemini 4 Pro傳聞裡,RSI這個關鍵詞被反覆提及。RSI全稱為Recursive Self-Improvement,遞歸自我改進,簡單來說,就是AI開始參與制造更強的AI,而更強的AI又進一步加快下一代模型的研發。一旦這個循環跑起來,被加速的就不只是模型能力本身。就連模型進化的速度,也會開始被模型自己加速。

路透社今年8月披露,谷歌聯合創始人Sergey Brin近幾個月一直在推動Gemini提速,並把遞歸自我改進列為重點關注方向之一。雖然谷歌目前還沒有公開宣佈自己已經實現了這個閉環,但它正在把越來越多原本屬於研究員的工作交給Agent,包括評測模型、尋找改進方向、跑實驗,再把結果反饋回模型研發流程。9月2日發佈Gemini 3.8 Flash時,谷歌也在官方說明裡提到,一套長期運行的Agent循環正在“遞歸地評估和改進底層模型”。Google DeepMind研究員姚順宇(不是騰訊的姚順雨)則在3.

8 Flash發佈後,化用了阿姆斯特朗登月時的話來形容這次更新:“這是模型的一小步,RSI的一大步。”就在最近,谷歌還把“RSI”寫進了一篇新論文的標題裡。9月14日,谷歌、GDM等團隊發佈Dream-RSI,專門研究如何讓Agent通過不斷改進探索策略,實現遞歸自我改進。在算法工程、數學優化和GPU kernel任務上,這套方法都顯示出更高的探索效率和更低的搜索成本。也正因如此,這次Gemini 4 Pro的傳聞才會迅速和RSI綁在一起。社區裡的猜測並沒有停留在“Gemini 4 Pro很強”上,也在追問,谷歌內部到底把RSI做到了什麼程度。RSI這條路顯然不只谷歌在走。

美國時間9月17日,Anthropic公開了一組內部AI研發自動化數據。Anthropic官方表示,他們公開這些指標的原因是,他們認為外界需要知道,前沿實驗室裡的AI研發到底有多少已經開始由AI自己完成。數據顯示,截至今年8月,Claude已經能夠主導26%的Anthropic AI研發任務——也就是人類只需要給出高層目標並監督,Claude基本可以端到端完成任務。這個比例在今年2、3月還不到1%。與此同時,Anthropic內部超過90%的AI研發任務,至少已經進入AI協作的階段。

國內,智譜創始人兼首席科學家唐傑最近也表示:“我們仍遠未達到遞歸自我改進,但最小的循環已經出現:模型優化系統,系統服務模型。”唐傑在X上的長文,僅截取開頭部分在智譜公開的工程實踐中,一個由GLM-5.3驅動的Infra Agent參與了GLM-5.3-Flash推理基礎設施的設計、調試和優化。這套系統運行在超過10萬張國產AI芯片組成的集群上,從第一次跑通到承接全部生產流量,只用了兩週,把端到端吞吐提升到了初始水平的3.2倍。“減速”最後只剩下警告就在幾天前,阿莫迪還呼籲前沿AI公司攜手“減速”。他列出的第一個需要警覺的條件,就是RSI。

模型進步本身當然是好事,但問題在於,如果AI開始參與制造下一代AI,模型進步的速度可能越來越快,但人類理解、評估和控制它的速度,未必能同步加快。所以阿莫迪反覆強調,要在能力跨過某些門檻之前,把第三方評測、共同安全標準和減速機制提前建立起來。因為一旦RSI真正形成正反饋,模型可能已經越過了剎車的“安全距離”。在風險上,幾家前沿實驗室確實達成了共識。奧特曼公開認同“放慢前沿AI的發展節奏”,並承諾OpenAI也會引入擁有類似員工權限的獨立評測者;馬斯克表示“Dario是對的”;哈薩比斯也稱這是正確的方向,只是具體怎麼做還需要繼續討論。

但那篇倡議裡也提到,單獨減速沒有意義,如果AI研發繼續被AI加速,未來真正有效的減速或暫停,需要先建立一套共同規則:比如引入獨立評測者,以及讓前沿實驗室共同設定能力門檻和安全措施,必要時協調放慢研發速度。但到現在,出於各種各樣的競爭原因,共同規則並沒有被建立。大家已經可以一起說“應該謹慎”,可一到“具體怎麼減速、誰先減、其他國家減不減”,共識就迅速消失了。實驗室之間有最直接的模型競爭,國家之間還有更大的AI競爭。任何一家單獨放慢,都要承擔把領先窗口讓給對手的風險;任何一個國家單獨限制,都會擔心另一邊繼續加速。幾家前沿AI實驗室,因此多少表現得有些言行不一。

谷歌這邊,有前面提到的疑似已經在Arena匿名測試的Gemini 4 Pro。Anthropic這邊,社區最近也開始出現Opus 5.2的灰度痕跡。有Claude Code用戶稱,通過運行狀態和請求路由信息看到了新的claude-opus-5-2模型標識,懷疑部分請求已經被灰度到下一代Opus。而OpenAI那裡,有人稱在後臺模型列表裡看到了gpt-6-sol的模型名,也有人表示自己疑似已經被灰度到新模型。根據目前廣為流傳的消息,GPT 6 Sol可能會在下週發佈,或者,也可能在美國時間9月29日的Dev Day……總之也不遠了。三家前沿AI實驗室的下一輪模型,都已經開始在社區裡露出測試痕跡。

這輪“減速倡議”到現在最確定的成果,並不是任何一家真的減了速,只是這幾家最重要的AI公司,已經把風險提前公開講了一遍。模型並沒有因此放緩。但至少,如果有一天真的出事,他們可以說:我們早就提醒過了。

Related

相關文章

鈦媒體生成式AI

豆包手機發售,AI代理進入“終端”競賽

洞見新研社2026.09.19 10:54 · 來自湖南全文4998字00:00 / 14:25手機AI競爭從功能內卷轉向代理決策。文 | 洞見新研社,作者 | 鄭施婧2026年,AI手機正在從旗艦機的加分項變成市場標配。 據Counterpoint Research預測,具備生成式AI能力的智能手機將佔全球出貨量的45%,2027年升至52%。但同一份報告裡還顯示,2026年全球智能手機出貨量預計同比下降13.9%,降至10.8億部,創歷史新低。手機大盤在縮,但是AI手機的需求在漲。

剛剛
鈦媒體生成式AI

關於豆包手機二代,我最關心這10個問題

唐辰同學2026.09.19 10:25 · 來自北京全文9598字00:00 / 26:52豆包學會了“敲門”,不再野蠻硬闖。文 | 唐辰同學9月16日,努比亞NaviX Ultra(下稱豆包手機二代)正式開售,售價5999元起,新機搭載豆包手機助手(消費者版)。

剛剛
鈦媒體生成式AI

AI辦公,自費上班打工人的第一筆“首付”

縱向青年2026.09.19 10:00 · 來自遼寧全文4451字00:00 / 13:02誰能搶佔下打工人的桌面。文 | 縱向青年,作者|肆夕,編輯|李明皿過去一個普通打工人的收入規劃,是三分之一留給房租、三分之一用於日常、三分之一作為存款。

剛剛
量子位生成式AI

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向

無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。

4 小時前