10美元、兩小時、5500行代碼,卡帕西讓Claude Opus 5搭出《指環王》3D世界
重點摘要
智東西 編譯 | 茄子 編輯 | 程茜 智東西8月3日消息,昨天,OpenAI聯合創始人、現Anthropic預訓練團隊成員、AI大神安德烈·卡帕西(Andrej Karpathy)在X展示了一種模型測試的新方法。他讓Claude Opus 5將《指環王》開篇的故事用Three.js製作成3D動畫,預算100萬token。
# 10美元、兩小時、5500行代碼,卡帕西讓Claude Opus 5搭出《指環王》3D世界
智東西8月3日消息,昨日,OpenAI聯合創始人、現Anthropic預訓練團隊成員、AI大神安德烈·卡帕西(Andrej Karpathy)在X平台展示了一種模型測試的新方法。他讓Claude Opus 5將《指環王》開篇的故事用Three.js製作成3D動畫,預算100萬token。最終,Claude Opus 5運行約2小時,寫出約5500行代碼,任務成本約為10美元(約合人民幣68元)。卡帕西認為成片雖然有些粗糙,但很有趣。 ## 從靜態測試到長程任務:模型測試的新思路
過去測試大模型視覺編程能力時,開發者經常讓模型"用SVG畫一隻騎自行車的鵜鶘"。這類任務結果直觀,生成時間短,也方便比較模型能否正確理解物體、空間關係和代碼語法。卡帕西認為,模型能力已經開始越過這類單幅圖像測試的範圍。他此次將任務擴展為一個長程項目,向Claude Opus 5輸入《指環王》開篇第一段,提供100萬token預算,並要求該模型用Three.js把文字內容渲染出來。Three.js是一款面向網頁的JavaScript 3D庫。開發者可以用它處理場景、燈光、陰影、材質、紋理和三維數學運算,並在瀏覽器中繪製3D內容。
這意味著Claude Opus 5面對的並不是一次簡單的"文字轉畫面"請求。該模型需要先理解原文涉及的場景和敘事元素,再將這些內容拆解為程序能夠調用的幾何資產,確定它們在x、y、z三個座標軸上的位置,並編寫鏡頭、動作和時間線代碼。經過約2小時運行,Claude Opus 5生成了約5500行代碼,用程序化方式完成了故事渲染。卡帕西評價成片"有些粗糙,但很有趣"。並且,令他感到難以置信的是,Claude Opus 5能夠在三維座標中擺放和組織多種多邊形資產,編寫動畫代碼,並最終生成可以運行的內容。
卡帕西在評論區附上了"鵜鶘騎自行車"測試提出者西蒙·威利森(Simon Willison)的博客鏈接,供用戶查看更多測試案例。他還公開了此次項目的源碼和瀏覽器版本,用戶可以直接運行或繼續修改。卡帕西隨後調侃稱,可以期待"《俠盜獵車手》霍比屯版",它說不定會趕在《俠盜獵車手6》之前問世。## 模型的能力邊界:擅長代碼生成,弱於視覺審查
這次實驗也暴露了模型的短板。Claude Opus 5不能高效觀看連續視頻,也無法進入場景試玩,只能緩慢截取不同時點的畫面逐張檢查。卡帕西稱,Claude Opus 5因此出現了數次錯誤,最終成片仍有不少粗糙之處。這種方式不僅速度慢,還會丟失動作和鏡頭之間的連續信息。 卡帕西稱,Claude Opus 5在檢查和修改過程中數次出錯。該模型雖然能夠生成5500行代碼,卻無法確認最終結果在畫面、空間和時間線上是否全部正確。與靜態SVG相比,這項測試不再只看模型能否生成一張圖,而是觀察模型能否持續規劃、運行程序、檢查結果並修復錯誤。實驗說明,Claude Opus 5已經可以把一段文字轉化為可運行的3D場景,但視覺審查和錯誤修復能力仍未跟上代碼生成能力。 ## 外部反饋與協作:實例化網格優化
Three.js官方賬號在評論區給出專業建議,提示模型應當合理使用"實例化網格"優化渲染性能。實例化網格能夠批量渲染外形、材質一致、位置不同的物體,削減GPU渲染指令開銷。卡帕西將這條建議交給Claude Opus 5後,模型檢查了場景代碼。按照模型給出的統計,原版霍比屯場景包含1569次獨立渲染調用;如果對草地、野花等重複物體使用實例化網格,只需4次調用即可渲染1154個同類物體。這組數據說明,Claude Opus 5生成的初版程序雖然能夠運行,但沒有主動採用這一常見的3D渲染優化方式,仍需外部專業反饋。 ## 配音由ElevenLabs生成,非Claude Opus 5所為
這段作品並非全部由Claude Opus 5獨立完成。有網友在評論區詢問,視頻中的音頻是否也由Claude Opus生成。卡帕西回覆稱,配音來自AI語音公司ElevenLabs,而且由他手動選擇聲音,因為他對配音效果有明確偏好。卡帕西同時稱,大模型可以比較容易地調用此類語音API。此次實驗中,Claude Opus 5主要負責Three.js場景、資產和動畫代碼,ElevenLabs則承擔配音生成。 ## AI生成定制化世界:可能性與局限
芬蘭手遊公司Supercell創意AI主管、AIGC創作者魯普·雷尼斯托(Roope Rainisto)提議,將程序化動畫輸入Seedance等視頻模型,提高畫面質量。卡帕西贊同這一思路,認為程序化代碼可以負責分鏡和控制,視頻到視頻模型則負責紋理和最終視覺效果。卡帕西沒有披露輸入、輸出和工具調用分別消耗了多少token,因此100萬token是任務預算,不能直接理解為模型最終輸出了100萬token。此次實驗的價值,不在於用10美元替代一部專業動畫電影,而在於讓過去投入產出比過低、幾乎沒人願意製作的一次性項目變得可行。大模型能夠連續工作約2小時,完成數千行只服務於特定場景的代碼。
卡帕西認為,這類能力可能催生按需生成的高度定製化世界。未來用戶只需給出一個主題,大模型就能臨時生成一個類似《俠盜獵車手》的可探索世界。例如,用戶可以進入模型生成的中土世界,以旁觀者、非玩家角色或原作人物的身份參與《指環王》的故事。## 結語:從生成到閉環,仍有長路要走
卡帕西的實驗沒有提供一個新的標準化評測分數,但提出了另一種觀察模型的方法:將模型放進開放式、跨模態、長時間運行的任務中,檢查它能否把文字理解、代碼生成、空間推理和視覺反饋串成完整工作流。 從靜態SVG到可運行的3D程序,大模型能夠承擔的任務長度和複雜度都在增加。一些過去因製作成本過高而無人實施的定製內容,已經可以用較低成本快速驗證。要讓這類程序進一步變成可玩的遊戲,模型還需要理解連續視頻、操作遊戲角色,並根據試玩結果定位和修改代碼。目前,這些環節仍需人類參與。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。