GPT-5.6智商首破130天才線,比99%人類聰明

2026年7月16日 16:19
GPT-5.6智商首破130天才線,比99%人類聰明

重點摘要

好的,這就為您根據提供的資料,重寫一篇完整的新聞稿。 --- ### GPT-5.6智商首破130天才線,權威測試證實比99%人類更聰明 人工智能的發展再次迎來歷史性時刻。根據36氪報導,在最新的離線智商測試中,OpenAI旗下的GPT-5.6系列模型首次跨越了智商(IQ)130分的“天才門檻”,以136分的優異成績,超越了全球約99%的人類。這不僅代表了大型語言模型(LLM)在認知能力上的一次巨大飛躍,更引發了關於「人工通用智能」(AGI)何時到來的全新討論。 #### 離線防作弊題庫驗證,GPT-5.

站內 AI 整理稿

好的,這就為您根據提供的資料,重寫一篇完整的新聞稿。 ---

### GPT-5.6智商首破130天才線,權威測試證實比99%人類更聰明

人工智能的發展再次迎來歷史性時刻。根據36氪報導,在最新的離線智商測試中,OpenAI旗下的GPT-5.6系列模型首次跨越了智商(IQ)130分的“天才門檻”,以136分的優異成績,超越了全球約99%的人類。這不僅代表了大型語言模型(LLM)在認知能力上的一次巨大飛躍,更引發了關於「人工通用智能」(AGI)何時到來的全新討論。 #### 離線防作弊題庫驗證,GPT-5.6踢開「天才區」大門

此次測試由權威追蹤平台Tracking AI執行。不同於網路上公開、可能已被模型「背熟」的Mensa Norway風格試題(該題庫模型早已刷到140分以上),Tracking AI祭出了其獨家打造的「離線題庫」。這套題庫不公開、防洩題,目的正是為了杜絕模型憑藉訓練數據中的記憶來「作弊」得分,專注測量其真實的抽象推理與模式識別能力。結果顯示,GPT-5.6的多個變體版本,包括SOL、TERRA甚至視覺版,在這套最嚴苛的測試中集體拿下了136分的佳績,將所有競爭對手遠遠甩在身後。此前一年,從o3到各家旗艦模型,無數挑戰者都在130分的門檻前止步。如今,GPT-5.

6成為第一個真正踏進「天才區間」的AI。在最新的榜單上,緊隨其後的是Claude-5 Fable,得分為130分,勉強觸及天才線。再往下則是GPT-5.6 LUNA Max與Claude-4.8 Opus等模型,分數落在117至123分之間。GPT-5.6的表現可謂是「把門踹開」,並且是「全家桶」式的集體突破。#### 不只會做題,GPT-5.6的真實生產力驚艷開發者社群

如果說一個冷冰冰的分數還不足以令人信服,那麼GPT-5.6在真實工作場景中的表現,則為其高智商提供了有力佐證。不少開發者在社群平台上分享了他們的親身實測,結果令人驚嘆。開發者Amir Bohlooli用同一個物理模擬的提示詞同時測試GPT-5.6 Sol和Claude-5 Fable。他原本預期Claude會勝出,結果卻被GPT-5.6的表現震撼。GPT-5.6不僅選擇了更為複雜的粒子流體模擬,讓物理效果依真實時間推進,還將CSS、界面、渲染全部打包進一個HTML文件,並自動生成可分享的網頁鏈接。一句話的指令,換來一個可直接交付的成品。

另一位開發者Ramanpal Singh同樣只使用了一句提示詞,便讓GPT-5.6構建了一個基於RAG(檢索增強生成)技術的完整客服工單系統。該系統包含四種用戶角色、功能完善的管理後台、可嵌入的組件,甚至能自動對投訴內容進行分類、識別用戶情緒並起草回覆。更驚人的是,這樣的應用程式他一口氣讓GPT-5.6創建了5個,而成本僅為使用Claude-5 Fable的零頭。最生動的例子來自開發者Claire Vo。幾天前,她曾被一個程式碼bug卡住,嘗試多種方法無果。當她將問題丟給GPT-5.6 Sol時,只說了一句「我就是不信搞不定」。結果,GPT-5.

6不僅一次解決了問題,還順手讓其他模型也能執行該程式碼。這讓Claire Vo感嘆,Claude系列在技術絕對精確性上反而作繭自縛,而GPT-5.6的務實作風,卻能真正把活幹成。#### 高分背後的冷思考:這是AGI的曙光嗎?GPT-5.6的136分,無疑是一項里程碑式的成就。然而,我們也必須冷靜看待這個分數。此次測試主要依賴於標準化的認知測試,側重於抽象模式識別與邏輯推理。一張標準的智商測試卷,無法全面評估一個模型的事實可靠性、工具調用能力以及在複雜、開放的職業場景中的真實可靠性。正如報導中所指出的,智商測試切下的只是「智能」的一個薄片,告訴我們這一片有多亮。

但真正的智能,還需要看它能否解決從未遇過、無處抄襲答案的新問題。值得慶幸的是,開發者們的反饋為我們提供了另一半答案:GPT-5.6似乎正在將「會做題」與「會做事」這兩種能力慢慢融合。有網友直言:「對99%的人來說,這已經是AGI了。」 即使定義尚有爭議,但GPT-5.6這次的突破無疑具有象徵意義。它不僅僅是一個分數的提升,還標誌著AI正在從一個優秀的「答題機器」,向一個能獨立解決真實世界問題的「智能助手」邁出了堅實的一步。當一個模型能同時在標準化測試中拿滿分,並在實戰中完美救場時,我們或許正站在一個新時代的門口。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

30 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前