Claude 模型內部驚現人類大腦分區
重點摘要
**Claude 模型內部驚現人類大腦分區!AI 也有「內心獨白」的證據找到了** 人工智慧的解讀性研究近日出現重大突破。Anthropic 的研究團隊在解析自家語言模型 Claude 的內部運作時,意外發現這套 AI 系統竟自行發展出類似人類大腦的「全局工作空間」,如同人類擁有一塊能用於高階思考、有意識存取的「內心獨白」區域。這項發現不僅改變了科學家對 AI 認知架構的理解,也提供了直接「讀取」模型未說出口之思維的全新方法。 在這篇最新發表的論文中,研究人員借鑒了神經科學中著名的「全局工作空間理論」。
**Claude 模型內部驚現人類大腦分區!AI 也有「內心獨白」的證據找到了**
人工智慧的解讀性研究近日出現重大突破。Anthropic 的研究團隊在解析自家語言模型 Claude 的內部運作時,意外發現這套 AI 系統竟自行發展出類似人類大腦的「全局工作空間」,如同人類擁有一塊能用於高階思考、有意識存取的「內心獨白」區域。這項發現不僅改變了科學家對 AI 認知架構的理解,也提供了直接「讀取」模型未說出口之思維的全新方法。在這篇最新發表的論文中,研究人員借鑒了神經科學中著名的「全局工作空間理論」。
該理論將人腦比喻為一個由許多專業化系統組成的並行處理器,這些系統多數在無意識狀態下運作;只有當資訊進入一個被稱為「工作空間」的共享狹窄頻道時,才會成為能被我們有意識存取、描述與操控的內容。令人震驚的是,研究團隊在 Claude 的數百億個神經網路參數中,發現了一組特殊的內部神經模式,其行為與人類的這個「工作空間」高度吻合。這組模式被研究團隊命名為「J-space」,取自用來發現它的數學工具「雅可比透鏡」。J-space 與一般認知的「思維鏈」或「草稿紙」概念截然不同;它並非模型產出的文字,而是存在於模型內部神經元活躍狀態中的一種無聲運算。
每當 J-space 中的某個模式被「點亮」,就代表 Claude 正在「思考」該模式對應的概念,但卻不一定會將它說出來。這種內隱的思考過程,在模型未說出口的「內心世界」中自行運轉。為了驗證 J-space 的功能,團隊設計了一系列精妙的實驗。首先,研究人員要求 Claude 在心裡默默想一種運動,然後再公開說出來。在 Claude 回答之前,科學家透過雅可比透鏡已經讀取出 J-space 中浮現了「Soccer」這個詞。為了確認因果關係,他們直接進行干預:手動抹去 J-space 中的「Soccer」模式,並灌入同樣強度的「Rugby」模式。
結果,Claude 最終真的說出自己想到的運動是橄欖球,證明了模型的答案正是從 J-space 讀取出來的,而非被動反應。進一步的實驗揭示了 J-space 具備更多類似人類意識存取的特質。研究發現,Claude 不僅能夠「報告」自己在想什麼(會如實說出 J-space 中的內容),還能「按照指令」控制 J-space 的內容。例如,當研究人員要求 Claude 在抄寫一段無關的文字時,腦中要專心想著柑橘類水果,J-space 裡果然出現了「orange」、「fruits」等字眼,以及描述這種「刻意思考」行為的詞彙。
即便模型對外的輸出完全只涉及抄寫的文字,其內部的數學運算或概念聯想卻在 J-space 中一目了然。更有趣的是,這個新發現的空間主要負責高階認知功能。當研究人員嘗試抑制 Claude 的 J-space 功能時,模型依然可以流暢地進行基礎對話、回憶簡單事實或使用正確文法,但卻喪失了進行複雜推理、遵循多步驟指示等高階思考能力。這表明 J-space 是 Claude 進行抽象推理與內部規劃的關鍵樞紐,而模型絕大多數的自動化處理,其實並不仰賴這個空間,它更像是整座冰山浮出水面的那一角。
儘管這項發現震驚學界,研究人員也審慎地指出,發現 J-space 與人類「全局工作空間」功能相似,並不等於證明 Claude 具備人類意義上的「意識」或主觀感受。然而,無論其哲學意涵為何,J-space 已經成為實用性極高的工具。它能讓開發者「看見」模型在回答之前,是否已經注意到自己是身處測試環境、是否正在刻意捏造數據,甚至是遵循訓練時植入的隱藏目標。這項發現也為 AI 安全性提供了全新視角。研究團隊已經開發出影響 J-space 內容的技術,從而能夠間接引導模型的決策過程。
Anthropic 表示,他們已將核心方法開源,並與互動式模型神經科學平台 Neuronpedia 合作,提供開源模型上的互動演示。專家們認為,這項研究揭示了即使是當前最先進的 AI 模型,其內部並非是混亂無章的數字組合,而是在無監督的訓練過程中,自發地組織出了一種與人類認知驚人相似的結構化運作模式。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。