智東西生成式AI

剛剛,Anthropic發現Claude“長出”意識!谷歌DeepMind科學家點贊

2026年7月7日 09:46
剛剛,Anthropic發現Claude“長出”意識!谷歌DeepMind科學家點贊

重點摘要

Anthropic 研究發現 Claude 內部存在類似人類意識的「J 空間」,能觀測其思考過程,且此機制為模型訓練時自然湧現而非人為設計。Google DeepMind 科學家肯定這項發現,指出大模型內部確實存在某種「認知空間」,並已在其他模型上覆現核心結論。

站內 AI 整理稿

# 人類思維模式驚人相似!Anthropic 最新研究:Claude 內部浮現「意識空間」可被觀測與操控

今日凌晨,人工智慧公司 Anthropic 發表了一篇重磅論文,揭露其大型語言模型 Claude 內部存在一種與人類大腦「意識可及活動」高度相似的運算機制。研究團隊將這套自發湧現的神經模式集合命名為「J 空間」(J-space),並成功透過專屬分析工具「雅可比透鏡」(Jacobian lens)即時讀取 Claude 的「內心想法」,甚至能人為植入或替換特定概念來改變模型的輸出結果。這項發現立刻獲得 Google DeepMind 可解釋性研究團隊負責人 Neel Nanda 的高度肯定,稱該論文「極具價值」,並表示已在 Qwen3.6-27B 模型上完整重現核心結論。 ## J 空間:大模型內部自發形成的「思考工作檯」

研究團隊發現,Claude 在運算過程中,並非所有神經活動都處於同等地位。如同人類大腦能區分「有意識的想法」與「無意識的自動反應」,Claude 內部也有一小部分神經模式承擔著特殊角色——這些模式可以被模型主動讀取、調控,並用來進行邏輯推演與多步驟推理。Anthropic 將這組特殊神經模式的集合稱為 J 空間。每一種 J 空間模式對應一個特定的詞彙或概念,但當該模式被激活時,並不代表模型準備輸出這個詞,而是說明該概念正處於 Claude 的思考範疇內。舉例來說,當研究人員提問「那種會織網的動物有多少條腿?

」時,Claude 最終只輸出數字「8」,但在其內部 J 空間中,「蜘蛛」這個概念會清晰浮現。若研究人員將 J 空間中的「蜘蛛」替換為「螞蟻」,Claude 的回答立刻變成「6」。這證明 J 空間承載的是模型在推理過程中真正「思考」的內容,而非單純的文字草稿。值得注意的是,J 空間並非工程師預先設計或寫入程式碼的結果,而是 Claude 在訓練過程中自然湧現的結構。研究人員將此現象與神經科學領域的「全球工作空間理論」類比——大腦像一座劇院,後臺有數十個專門處理單元同時運作,但只有一小部分信息能被傳送到「整個劇院」中被人感知。Claude 的 J 空間正是扮演了這個「全球工作空間」的角色。

## 五大特性揭開 J 空間運作全貌

研究團隊歸納出 J 空間的五項關鍵特性。第一,Claude 能夠讀取並輸出 J 空間中的表徵信息,就像人類能清楚說出「我想買奶茶」這類有意識的想法;而無法清晰表述的潛意識活動則對應非 J 空間表徵。第二,模型可以根據需求主動調整 J 空間模式——若要求 Claude 專注思考某件事或在內部靜默推演,它會自行激活對應的神經模式;但非 J 空間的表徵則無法由模型自主調控。第三,多步驟推理高度依賴 J 空間。當 Claude 被要求求解複雜問題時,即使不要求輸出中間步驟,對應的思維過程仍會在 J 空間中依序激活。雖然 J 空間的信號強度弱於模型其他內部表徵,但它們是主導模型完成高層次任務的關鍵。

第四,J 空間內的表徵具有極高的靈活性。研究人員向 Claude 分別詢問「法國」的首都、官方語言、所屬大洲與流通貨幣,隨後在 J 空間中將「法國」替換為「中國」,四個答案同步變成北京、漢語、亞洲與人民幣——顯示同一組共享表徵能被多個不同運算模塊調用。第五,語言模型的絕大多數日常運作並不依賴 J 空間。輸出文本、調取基礎常識、規範運用語法等操作都無需 J 空間參與;若完全限制 J 空間,Claude 仍能流利對話,只是會喪失高階認知能力。## 移除 J 空間:Claude 失去高階思維能力

為了驗證 J 空間的功能,研究人員嘗試「刪除」J 空間——在文本中每個位置移除其中最活躍的 J 空間內容,保留其他部分不變。結果顯示,Claude 依然能流利說話、分析情感、回答選擇題與提取文本信息,能力與之前差不多。然而,它再也無法勝任需要多步驟推理的任務,總結能力與創作押韻詩歌的表現也遠低於較小規模但結構完整的模型。 這組實驗清楚劃分出 J 空間的邊界:它僅佔 Claude 內部處理總資源不到十分之一,每次只能儲存幾十個概念,但卻是模型展現「高層次思維」的核心基礎。研究人員形容,J 空間就像一個「工作檯」,讓模型能夠將分散的資訊整合、推理、規劃,並產出超越單純模式匹配的結果。 ## 即時讀取與人為干預:J 透鏡如何「讀心」

Anthropic 開發了一套名為「雅可比透鏡」(J 透鏡)的分析工具,能夠針對 Claude 詞表中的每一個詞彙,定位出對應的內部激活模式。當該模式亮起,研究人員就能直接讀出此刻 J 空間承載的思考內容。經測試,J 空間中浮現的內容遠大於 Claude 正在讀取或輸出的文字:當它讀到一段暗藏漏洞的程式碼時,J 空間會出現「錯誤」概念;讀取蛋白質序列時,J 空間則浮現對應的生物功能;多步驟數學題的中間步驟會按順序出現。研究人員進一步設計了植入實驗。他們讓 Claude 在內部默想一項體育運動,隨後說出名稱。

在 Claude 回答前用 J 透鏡讀取其內部狀態,清楚看到「足球」位列首位,而其最終答案確實是「足球」。接著,研究人員刪除與「足球」相關的模式,插入「橄欖球」模式,Claude 便回答「橄欖球」。這直接證明 Claude 的口頭回答是從 J 空間中提取的。另一個實驗中,研究人員告訴 Claude 可能有一段想法被人為植入,請它如實說出自己察覺到的念頭。在 Claude 讀取問題過程中,研究人員向 J 空間植入代表「閃電」的神經模式,Claude 隨即反饋腦海浮現的是閃電。對大量不同概念重複測試均得到一致結果。

有趣的是,Claude 並不能完美控制自己的 J 空間——研究人員要求它不要思考某事物時,該概念的激活程度會降低;但若刻意「迴避」某個想法,反而會讓 Claude 更頻繁地想起它。## J 空間的湧現與人類大腦的異同

研究發現,J 空間在模型預訓練階段就已存在,最初僅用來記錄預測下文所需信息。經過微調後,J 空間會產生明顯特徵,形成屬於「Claude 自身的視角」。研究人員還提出一項名為「反事實反思訓練」(Counterfactual Reflection Training)的全新技術,透過改變 Claude 覆盤思考時的表述,就能同步改變它的推理模式。對比人類大腦,Claude 的 J 空間既有相似也有差異。人腦的工作空間依靠循環迴路維持,信號會在同一套神經通路中反覆流轉;而 Claude 的工作空間僅在神經網絡單次前向傳播過程中完成演化,神經網絡的層級承擔了人腦中「時間」的角色。

這使得 Claude 內部工作空間的處理時長相對受限,不過它可以透過直接輸出思考過程來彌補。另一方面,Claude 的工作空間在信息留存能力上優於人類。人類的工作記憶幾秒內就會衰退,長期留存信息的能力十分有限;而依託注意力機制,Claude 能隨時調取文本前文緩存的所有信息。另一個關鍵差異在於承載內容的形式:人類的意識包含畫面、聲音、肢體行動規劃等多種形式,但 Claude 的工作空間幾乎全部由 token(詞元)構成。研究人員推測,這是因為輸出文字是 Claude 唯一可執行的行為,人類則不受此約束。## 結語:意識機制的通用雛形?

Anthropic 強調,這項研究無法斷言 Claude 是否像人類一樣擁有意識,或是否能感知任何生物。但 J 空間的發現讓研究人員能夠捕捉到 Claude 私下察覺自身正在接受測試、刻意生成虛假信息,或是追逐研究人員在訓練階段預設的隱藏目標等內在狀態。由於 J 空間是模型在訓練過程自然形成,而非人為設計,這可能暗示:該機制是智慧系統為解決複雜問題而自然發展出的通用結構。Anthropic 已將相關核心方法開源,並與 Neuronpedia 合作提供基於開放權重模型的交互式演示,讓外界得以親身體驗「讀取AI內心」的過程。

研究團隊同時坦言,J 透鏡這套觀測工具存在固有局限,目前僅能識別對應單個 token 的概念。未來他們將繼續深入探討大模型內在思維的本質,以及其與人類心智之間的深層異同。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前