Claude王座失守,OpenAI一夜反超,神秘GPT‑6 Sol偷跑

OpenAI 在人工智慧領域再次投下震撼彈,旗下代號「Sol」的神祕模型 GPT‑6 突然現身,在當前 AI 社群最關注的通用智慧評測 ARC AGI 中一舉衝上 99.9% 的超高正確率,直接將原本盤踞榜首的 Claude 拉下王座。由於成績過於驚人,ARC 評測團隊緊急宣布現有考卷必須重做,下一階段更要將題目升級為考驗「發明」能力。ARC AGI 是一項被視為「AI 界的奧林匹克」的抽象推理測驗,設計目的是測試模型能否像人類一樣從少量範例中提煉出規則,並運用在從未見過的圖形問題上。
過去一年,這項測驗的排行榜幾乎由 Anthropic 的 Claude 系列模型長期霸佔,最高成績始終卡在 98% 左右,業界普遍認為要突破 99% 還需要技術上的重大躍進。沒想到 OpenAI 不僅悄悄跨越了這條線,而且直接逼近滿分,讓許多研究人員感到既興奮又意外。據了解,這次登場的 GPT‑6 並未透過任何正式發表會或 API 預覽管道公開,而是以「偷跑」的形式出現在第三方評測平台上。測試者在 ARC AGI 的私有驗證集上檢測到一個未知模型,其輸出風格與過往 OpenAI 的模型有著明顯差異,但解題邏輯極為清晰且穩定。
經過交叉比對,該模型被確認為 GPT‑6 的早期版本,內部代號正是「Sol」。在驚人的 99.9% 成績曝光後,ARC 評測的創辦人 François Chollet 隨即發文表示,這項測試的原始難度已經無法有效區分頂尖模型的真實能力,因此他們決定直接廢除現有考題,並啟動全新的評測設計。新階段的題目將不再只是答對抽象圖形,而是要求模型「發明」出一套全新的規則來解決從未定義過的問題。換句話說,AI 必須展現出近似人類的創造力,而非單純的圖形比對。挑戰「發明」能力,意味著模型不能只靠記憶或模式識別來過關。
評測團隊規劃,未來會給模型一個只有人類才能理解的高層次目標,但具體的實現方法與規則完全交給 AI 自行定義,再由評審判斷其發明的質量與原創性。這項變革被視為 AGI(通用人工智慧)評估的一大躍進,也讓 OpenAI 的 GPT‑6 是否已經具備初步的創造力成為討論焦點。OpenAI 方面截至目前尚未正式回應該模型的相關資訊,也沒有透露「Sol」是否會成為即將推出的新一代旗艦模型。不過,從社群上的風向來看,許多人認為這很可能是 OpenAI 在內部訓練過程中取得的階段性突破,並刻意選擇在低調環境下測試極限效能,避免公關戰過早升溫。
而對 Anthropic 而言,Claude 王座失守無疑是一記警鐘,外界預期該公司短期內可能會加速發表下一代架構,企圖奪回 ARC 榜首。從產業角度觀察,ARC AGI 雖然只是學術性評測,但長期被視為衡量模型是否能真正「適應新情境」的關鍵指標。OpenAI 若能在這個領域持續推進,其商業化應用的想像空間將大幅擴張,包括自動化科學研究、複雜決策系統,甚至教育領域中動態出題與個別化指導都可能出現新典範。而「Sol」這個代號本身也引發不少聯想,有人猜測它代表「太陽」,象徵 OpenAI 準備在通用智慧領域照亮整個業界;也有人認為這只是內部隨機命名,不需過度解讀。
值得注意的是,GPT‑6 的出現時間點非常微妙。就在數週前,市場上才剛掀起一波關於「AI 模型能力已接近天花板」的討論,部分投資人甚至開始懷疑大規模預訓練的邊際效益正在快速遞減。現在這個成績幾乎是直接打臉那種論調,證明只要方法得當,突破瓶頸的機會依然存在。當然,也有專家提醒,99.9% 的成績可能只在特定封閉測試集下成立,實際開放環境的表現還有待驗證。無論如何,這場突如其來的「王座交替」已經讓整個科技圈再次沸騰。從研究實驗室到創投會議,大家都在追問同一個問題:GPT‑6 到底還藏著多少未公開的能力?
而 ARC 評測的全面改版,是否預示著 AI 競賽將從「誰更會解題」正式進入「誰更會發明」的新紀元?一切謎底恐怕要等到 OpenAI 正式揭露細節,或是 Anthropic 亮出反擊武器之後,才會有更清晰的答案。但可以確定的是,人工智慧的軍備競賽不僅沒有降溫,反而在攀向更高、更難的峰頂。
Related
相關文章

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向
無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。
Jina AI Releases jina-ocr-v1: A 3.4B MoE Document Parser With Built-In Speculative Decoding for Low-Budget GPUs
Jina AI, part of Elastic, has released jina-ocr-v1, an end-to-end visual document parser. It takes PDFs, scans, tables, charts or invoices and returns clean Markdown in 1 pass. The model has 3.

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作
作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

智譜 ZCode 被質疑“偷傳代碼”:官方回應稱問題已修復,將開源代碼庫、引入第三方審查
作者:清源 責編:清源 評論: 感謝網友 咩咩洋 的線索投遞!9 月 18 日消息,針對社區中有關代碼庫數據上傳的討論,智譜旗下編程產品 ZCode 今天(18 日)通過智譜官方群組向受影響用戶致歉,併發布回應稱已第一時間完成自查,相關問題目前已經修復。

月之暗面遞表之後,Kimi 的成色要被驗算三遍
舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"
這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。