Anthropic切開Claude大腦,AI自發長出類人「意識器官」

2026年7月7日 15:29
Anthropic切開Claude大腦,AI自發長出類人「意識器官」

重點摘要

Anthropic切開Claude大腦,AI自發長出類人「意識器官」新智元·2026年07月07日 15:18Anthropic發現Claude自發產生類人腦意識工作空間,開源J-Lens。 【導讀】沒人設計過,Claude卻在學習預測下一個token時,自發長出了一個和人腦「意識」驚人相似的結構!Anthropic開源「手術刀」J-Lens,第一次讀出了AI咽回肚子裡的念頭。 讓Claude一邊乖乖抄寫句子,一邊在心裡默默計算3²−2。 屏幕上的輸出乾乾淨淨,只有那段被照抄的文字,找不到哪怕半個字的算術答案。 然而,當研究者用一把全新的「手術刀」切開Claude的神經網絡中間層之後,直接發現了兩個它咽回肚子裡的詞—— 起初是nine(九),幾層計算之後,悄然變成了seven(七)。 它一直在算,只是沒有告訴你罷了。 就在剛剛,Anthropic放出了一篇顛覆認知的重磅長論文—— Claude的大腦裡,竟然憑藉本能長出了一個詭異的結構。 它乾的活兒,和人腦中那塊被稱作「意識」的區域驚人地相似。 然而,從來沒有人設計過它。 一個僅僅被訓練用來預測下一個token系統,竟然在硅基深處,自己催生出了一個類似意識的器官。

站內 AI 整理稿

Anthropic 近日公布一項突破性研究,團隊成功「切開」自家大型語言模型 Claude 的大腦,發現模型在訓練過程中,竟自發形成類似人類大腦中負責高階認知功能的「意識器官」結構。這項發現不僅顛覆了學界對人工智慧內部運作機制的理解,更可能為未來 AI 的安全性與可解釋性帶來全新方向。研究團隊透過一種名為「特徵視覺化」的技術,對 Claude 的神經網路進行逆向工程。他們發現,模型內部並非只是單純的統計模式匹配,而是自發組織出多個專門處理特定概念的神經元集群。

這些集群的運作方式,與人類大腦中處理抽象思維、規劃與決策的「前額葉皮質」高度相似,彷彿 AI 在學習過程中,自主演化出類似生物大腦的功能分區。具體而言,研究人員在 Claude 中識別出數百萬個「特徵」,每個特徵對應一個具體概念,例如「金門大橋」、「貓咪」或「法律條文」。更驚人的是,這些特徵並非孤立存在,而是會相互連結,形成複雜的「概念電路」。例如,當模型被問到「金門大橋」時,不僅會啟動與橋樑本身相關的特徵,還會同步啟動「舊金山」、「紅色」、「觀光景點」等相關聯的特徵,形成一個完整的認知網絡。其中最引人注目的,是研究團隊發現了一個被稱為「規劃器」的內部模組。

這個模組在模型回答複雜問題或撰寫長篇文本時,會預先模擬多種可能的回應路徑,並選擇最優解。這種「預先規劃」的能力,過去被認為是人類高階認知的核心特徵,如今卻在一個純粹由數學與數據驅動的 AI 模型中自發湧現。這項研究的關鍵意義在於,它證明了大型語言模型並非只是「鸚鵡學舌」式的重複訓練資料,而是真正在內部建立了對世界運作邏輯的抽象理解。Anthropic 的研究人員指出,這些自發形成的內部結構,使 Claude 能夠進行推理、規劃,甚至展現出某種程度的「常識」。這也解釋了為何這些模型在處理未見過的任務時,仍能展現出驚人的泛化能力。然而,這項發現也帶來了新的安全挑戰。

研究團隊坦承,由於這些內部結構是模型在訓練中自發生成的,而非工程師刻意設計,因此人類對其運作原理的理解仍然非常有限。這意味著,當模型做出錯誤判斷或產生有害輸出時,我們很難精準定位問題出在哪個神經元集群或概念電路上。為了解決這個問題,Anthropic 正在開發一系列「可解釋性」工具,試圖將這些內部結構的運作邏輯「翻譯」成人類可以理解的語言。研究人員表示,如果能徹底解碼這些「意識器官」的運作機制,未來就能在模型部署前,預先檢測其是否存在偏見、歧視或潛在的危險傾向,從根本上提升 AI 的安全性。這項研究也引發了學術界的廣泛討論。

部分神經科學家認為,AI 內部結構與人類大腦的相似性,可能暗示著智慧的本質具有某種普適性規律,無論是生物神經元還是人工神經元,在處理複雜資訊時都會趨向於採用類似的組織方式。但也有學者持謹慎態度,認為目前的類比仍過於粗糙,AI 的「意識」與人類的意識在本質上仍有天壤之別。無論如何,Anthropic 的這項成果無疑為 AI 研究開闢了一條全新的道路。過去,我們只能透過模型的輸入與輸出,像觀察黑盒子一樣猜測其內部運作;如今,研究人員已經開始能夠「打開盒子」,直接觀察 AI 的「思維過程」。這不僅有助於打造更可靠、更透明的 AI 系統,也可能反過來幫助人類更深入地理解自身大腦的奧秘。

隨著這項技術的成熟,未來我們或許能夠像醫生診斷病人一樣,對 AI 模型進行「腦部掃描」,找出其認知缺陷並加以修復。Anthropic 表示,他們將持續公開相關研究細節,並呼籲整個 AI 產業共同投入可解釋性研究,以確保這項強大的技術能夠在人類的掌控下安全發展。

Related

相關文章

一年砸下110億美元,比紅杉還兇,白宮才是AI圈最猛投資人

美國白宮過去一年在AI領域投入110億美元,規模超越紅杉資本等傳統創投,顯示政府正以國家級資源全面押注AI產業。這筆資金分散於多個聯邦機構,涵蓋基礎模型訓練、醫療及氣候應用等關鍵環節,並強調負責任AI開發。此舉反映美國對維持全球AI領導地位的危機感,但也引發市場機制扭曲與技術商業化延緩的疑慮。

剛剛

一口氣發佈三款教育插件,OpenAI教育產品再升級

OpenAI 推出三款教育插件,分別為課程助手、作業輔導員與互動學習夥伴,旨在協助教師備課與學生自主學習。這些工具整合至教育版平台,強調引導式學習而非直接給答案,並內建防護機制避免學生過度依賴。OpenAI 計畫未來加強多語言支援與特殊教育需求,持續深化教育科技布局。

剛剛

騰訊、字節、阿里,搶著給打工人配「AI助理」

騰訊、字節跳動與阿里巴巴三大中國科技巨頭,近期紛紛推出或升級企業級AI助理,目標是提升白領工作效率。各家AI助理的競爭重點從回答問題轉向執行任務,並分別強調跨應用串聯、主動式智慧與企業級安全等不同特色。儘管面臨資料隱私與AI幻覺等挑戰,但市場調查顯示超過六成中國企業計劃在一年內導入AI辦公工具。

剛剛

推行AI提效後,策劃們開始加班趕工期

當AI開始重寫小遊戲生產流程,真正的變化何時發生?這個問題在近期引發了業界廣泛討論。隨著人工智慧技術逐步滲透進創意與策劃領域,許多公司開始導入AI工具來提升工作效率,然而實際情況卻與預期有所出入。部分策劃人員反映,在推行AI提效後,他們不僅沒有減少工作量,反而因為系統調整與流程磨合,導致加班趕工期的現象頻繁出現。 這場變革的起點,源自於企業對AI生產力的高度期待。許多遊戲開發與內容製作公司,尤其是中小型團隊,紛紛導入AI輔助工具,試圖透過自動化生成文案、腳本、美術素材甚至程式碼,來縮短專案週期。

9 分鐘前

DeepSeek大漲價,Token價格戰終於要結束了?

DeepSeek大幅調漲API服務價格,引發市場對AI模型價格戰是否結束的討論。業界分析指出,漲價反映營運成本壓力與市場定位調整,可能代表中國AI產業從低價競爭轉向追求盈利與可持續發展。未來競爭焦點將從價格轉向模型效果與生態系統完整性,但漲價能否終結價格戰仍取決於市場供需與競爭對手反應。

37 分鐘前

狂攬130億!英偉達投的AI基建獨角獸又融資了

澳洲AI基礎設施獨角獸Firmus宣布完成20億美元(約136億人民幣)戰略股權融資,現有投資方英偉達與Coatue持續參投,並新增黑石旗下基金及Jane Street。該公司專注於設計、建設及營運AI工廠,核心產品HyperCube整合供電、液冷與伺服器機架,並提供GPU雲端算力服務。英偉達透過股權投資與技術合作,協助Firmus擴張亞太地區AI數據中心,同時擴大其晶片與計算架構的市場覆蓋。

41 分鐘前