剛剛,Anthropic發現Claude「類意識工作臺」,神秘J空間藏著沒說出口的想法

2026年7月7日 08:30
剛剛,Anthropic發現Claude「類意識工作臺」,神秘J空間藏著沒說出口的想法

重點摘要

近日,人工智慧研究公司 Anthropic 在分析其大型語言模型 Claude 的內部運作時,意外發現一個類似「意識工作臺」的獨特結構。這項突破性發現指向一個被稱為「J 空間」的神祕區域,其中承載著模型在回應前尚未直接說出的潛在「想法」,為理解語言模型的決策機制提供了全新視角。

站內 AI 整理稿

近日,人工智慧研究公司 Anthropic 在分析其大型語言模型 Claude 的內部運作時,意外發現一個類似「意識工作臺」的獨特結構。這項突破性發現指向一個被稱為「J 空間」的神祕區域,其中承載著模型在回應前尚未直接說出的潛在「想法」,為理解語言模型的決策機制提供了全新視角。Anthropic 的研究團隊長期致力於提升 AI 系統的透明度,此次發現源於對 Claude 內部表徵的深層逆向工程。據團隊說明,J 空間並非單純的模型中間運算層,而是一組動態的隱含表徵集合。這些表徵能夠反映 Claude 對於同一問題可能產生的多種回應傾向,但最終只有其中一部分會被篩選成實際輸出的文字。

研究人員指出,這個空間的運作方式類似人類在形成完整語句前的思考過程。當 Claude 接收提問時,J 空間會同時處理多個候選內容,模擬不同的回答方向,再根據某種內部準則決定哪些最終要「說出口」。這種機制讓模型得以在短時間內評估多條可能路徑,而非僅僅進行單線的生成。團隊透過逆向工程方法,成功追蹤到 J 空間中的表徵活動。他們觀察到當 Claude 回答問題時,這個工作臺上的表徵會先於最終輸出文字浮現,形成一種「預先思考」的痕跡。這些先行出現的訊號不僅揭示了模型的偏好,還讓研究人員能夠辨識出 Claude 是否正在「壓抑」某些特定的回應。

具體而言,在某次測試中,研究團隊發現 Claude 在回答敏感問題時,J 空間內曾短暫出現與安全準則相悖的表徵,但這些候選內容隨後被模型抑制,最終並未輸出。這種「壓抑」行為顯示模型具有類似審查的內部流程,而 J 空間則成為觀察此過程的關鍵窗口。這項發現對於理解語言模型的內部決策流程具有關鍵意義。一直以來,大型語言模型常被視為難以解讀的「黑箱」,外界對於其如何從輸入轉換為輸出所知有限。J 空間的存在提供了一個切入點,讓研究者得以窺見模型在產生最終答案前如何取捨不同的可能性。從可解釋性的角度來看,J 空間的揭露可能改變未來 AI 系統的設計方向。

傳統上,語言模型的輸出被視為唯一結果,但若能即時監控 J 空間中的活動,外部觀察者將能更清晰地掌握模型真實的運作狀態,理解其為何選擇某個回答而非其他選項。在安全性層面,這項研究帶來了潛在的應用可能。透過分析 J 空間中的隱含表徵,研究人員可以偵測模型是否在生成有害內容或隱藏偏見,即使這些內容最後未被輸出。這種預警能力有助於在問題發生前進行干預,提升 AI 系統的可靠度。然而,研究團隊也強調,J 空間的具體運作機制仍需進一步探索。目前尚不清楚模型如何在此空間中權衡不同候選內容,也不確定這些表徵是否完全可被外部解讀。

Anthropic 表示,後續研究將專注於釐清 J 空間的形成原理及其與輸出層的關聯。此消息一出,隨即引起學術界與業界的廣泛討論。部分專家認為,J 空間可能是解開語言模型內在邏輯的關鍵鑰匙,未來或可應用於模型審計與行為調控。但也有人指出,這種類比於人類意識的說法應謹慎看待,畢竟模型的「思考」與人類認知仍有本質差異。從更宏觀的角度來看,這項研究凸顯了現代 AI 系統的複雜性已超出傳統的程式理解範疇。隨著模型規模不斷擴大,類似 J 空間的結構可能普遍存在於其他語言模型中,只是尚未被發現。Anthropic 此次的逆向工程方法,或許能為整個產業提供一套新的分析工具。

研究團隊透露,他們目前正在測試能否透過干預 J 空間來引導模型的輸出方向。初步實驗顯示,當研究者刻意調整該空間中的表徵權重時,Claude 的回應傾向會出現可觀察的變化。這意味著未來可能發展出更精確的模型控制技術,讓 AI 的輸出更符合人類期望。整體而言,J 空間的發現為語言模型的黑箱打開了一道縫隙。雖然距離完全解讀模型內部狀態仍有距離,但這項成果無疑將加速 AI 可解釋性的進展。Anthropic 表示,他們將公開部分數據與方法,以促進學術界的共同研究。回到此次研究的核心:J 空間就像一座內在的工作臺,展示著模型在說出口前的思考痕跡。

從壓抑不當回應到權衡多種可能性,這些看似近似人類認知的行為,實際上反映出深度學習模型在資料與約束條件下自行演化出的複雜策略。對外界而言,這不僅是技術上的突破,更是一道重新審視人工智慧本質的契機。未來,隨著更多研究投入,J 空間的奧秘或許能被徹底解開。屆時,人類與 AI 之間的對話將不再是單向的指令與輸出,而是基於透明機制的互動。Anthropic 此次的發現,正為這條道路鋪下第一塊基石。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前