10美元、兩小時、5500行代碼,卡帕西讓Claude Opus 5搭出《指環王》3D世界
重點摘要
智東西 編譯 | 茄子 編輯 | 程茜 智東西8月3日消息,昨天,OpenAI聯合創始人、現Anthropic預訓練團隊成員、AI大神安德烈·卡帕西(Andrej Karpathy)在X展示了一種模型測試的新方法。他讓Claude Opus 5將《指環王》開篇的故事用Three.js製作成3D動畫,預算100萬token。
# 10美元、兩小時、5500行代碼,卡帕西讓Claude Opus 5搭出《指環王》3D世界
智東西8月3日消息,昨日,OpenAI聯合創始人、現Anthropic預訓練團隊成員、AI大神安德烈·卡帕西(Andrej Karpathy)在X平台展示了一種模型測試的新方法。他讓Claude Opus 5將《指環王》開篇的故事用Three.js製作成3D動畫,預算100萬token。最終,Claude Opus 5運行約2小時,寫出約5500行代碼,任務成本約為10美元(約合人民幣68元)。卡帕西認為成片雖然有些粗糙,但很有趣。 ## 從靜態測試到長程任務:模型測試的新思路
過去測試大模型視覺編程能力時,開發者經常讓模型"用SVG畫一隻騎自行車的鵜鶘"。這類任務結果直觀,生成時間短,也方便比較模型能否正確理解物體、空間關係和代碼語法。卡帕西認為,模型能力已經開始越過這類單幅圖像測試的範圍。他此次將任務擴展為一個長程項目,向Claude Opus 5輸入《指環王》開篇第一段,提供100萬token預算,並要求該模型用Three.js把文字內容渲染出來。 Three.js是一款面向網頁的JavaScript 3D庫。開發者可以用它處理場景、燈光、陰影、材質、紋理和三維數學運算,並在瀏覽器中繪製3D內容。這意味著Claude Opus 5面對的並不是一次簡單的"文字轉畫面"請求。該模型需要先理解原文涉及的場景和敘事元素,再將這些內容拆解為程序能夠調用的幾何資產,確定它們在x、y、z三個座標軸上的位置,並編寫鏡頭、動作和時間線代碼。 經過約2小時運行,Claude Opus 5生成了約5500行代碼,用程序化方式完成了故事渲染。卡帕西評價成片"有些粗糙,但很有趣"。並且,令他感到難以置信的是,Claude Opus 5能夠在三維座標中擺放和組織多種多邊形資產,編寫動畫代碼,並最終生成可以運行的內容。 卡帕西在評論區附上了"鵜鶘騎自行車"測試提出者西蒙·威利森(Simon Willison)的博客鏈接,供用戶查看更多測試案例。他還公開了此次項目的源碼和瀏覽器版本,用戶可以直接運行或繼續修改。卡帕西隨後調侃稱,可以期待"《俠盜獵車手》霍比屯版",它說不定會趕在《俠盜獵車手6》之前問世。 ## 模型的能力邊界:擅長代碼生成,弱於視覺審查
這次實驗也暴露了模型的短板。Claude Opus 5不能高效觀看連續視頻,也無法進入場景試玩,只能緩慢截取不同時點的畫面逐張檢查。卡帕西稱,Claude Opus 5因此出現了數次錯誤,最終成片仍有不少粗糙之處。這種方式不僅速度慢,還會丟失動作和鏡頭之間的連續信息。 卡帕西稱,Claude Opus 5在檢查和修改過程中數次出錯。該模型雖然能夠生成5500行代碼,卻無法確認最終結果在畫面、空間和時間線上是否全部正確。與靜態SVG相比,這項測試不再只看模型能否生成一張圖,而是觀察模型能否持續規劃、運行程序、檢查結果並修復錯誤。實驗說明,Claude Opus 5已經可以把一段文字轉化為可運行的3D場景,但視覺審查和錯誤修復能力仍未跟上代碼生成能力。 ## 外部反饋與協作:實例化網格優化
Three.js官方賬號在評論區給出專業建議,提示模型應當合理使用"實例化網格"優化渲染性能。實例化網格能夠批量渲染外形、材質一致、位置不同的物體,削減GPU渲染指令開銷。卡帕西將這條建議交給Claude Opus 5後,模型檢查了場景代碼。按照模型給出的統計,原版霍比屯場景包含1569次獨立渲染調用;如果對草地、野花等重複物體使用實例化網格,只需4次調用即可渲染1154個同類物體。這組數據說明,Claude Opus 5生成的初版程序雖然能夠運行,但沒有主動採用這一常見的3D渲染優化方式,仍需外部專業反饋。 ## 配音由ElevenLabs生成,非Claude Opus 5所為
這段作品並非全部由Claude Opus 5獨立完成。有網友在評論區詢問,視頻中的音頻是否也由Claude Opus生成。卡帕西回覆稱,配音來自AI語音公司ElevenLabs,而且由他手動選擇聲音,因為他對配音效果有明確偏好。卡帕西同時稱,大模型可以比較容易地調用此類語音API。此次實驗中,Claude Opus 5主要負責Three.js場景、資產和動畫代碼,ElevenLabs則承擔配音生成。 ## AI生成定制化世界:可能性與局限
芬蘭手遊公司Supercell創意AI主管、AIGC創作者魯普·雷尼斯托(Roope Rainisto)提議,將程序化動畫輸入Seedance等視頻模型,提高畫面質量。卡帕西贊同這一思路,認為程序化代碼可以負責分鏡和控制,視頻到視頻模型則負責紋理和最終視覺效果。 卡帕西沒有披露輸入、輸出和工具調用分別消耗了多少token,因此100萬token是任務預算,不能直接理解為模型最終輸出了100萬token。此次實驗的價值,不在於用10美元替代一部專業動畫電影,而在於讓過去投入產出比過低、幾乎沒人願意製作的一次性項目變得可行。大模型能夠連續工作約2小時,完成數千行只服務於特定場景的代碼。 卡帕西認為,這類能力可能催生按需生成的高度定製化世界。未來用戶只需給出一個主題,大模型就能臨時生成一個類似《俠盜獵車手》的可探索世界。例如,用戶可以進入模型生成的中土世界,以旁觀者、非玩家角色或原作人物的身份參與《指環王》的故事。 ## 結語:從生成到閉環,仍有長路要走
卡帕西的實驗沒有提供一個新的標準化評測分數,但提出了另一種觀察模型的方法:將模型放進開放式、跨模態、長時間運行的任務中,檢查它能否把文字理解、代碼生成、空間推理和視覺反饋串成完整工作流。 從靜態SVG到可運行的3D程序,大模型能夠承擔的任務長度和複雜度都在增加。一些過去因製作成本過高而無人實施的定製內容,已經可以用較低成本快速驗證。要讓這類程序進一步變成可玩的遊戲,模型還需要理解連續視頻、操作遊戲角色,並根據試玩結果定位和修改代碼。目前,這些環節仍需人類參與。
Related
相關文章

這個新生圖模型有點夯:4K直出的,國產的,開源的!
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 這個新生圖模型有點夯:4K直出的,國產的,開源的! 十三 2026-08-03 19:59:32 來源:量子位 商湯預覽了SenseNova U1.5 Lite 金磊 發自 凹非寺 量子位 | 公眾號 QbitAI 剛剛,新出的一個生圖模型,著實是有點東西在身上的: 國產的,4K直出的,開源的,輕量的,還是可以指哪兒改哪兒的。 例如下面這張信息密度超高的圖片,就是它做出來的: 我們從結果可以看到,即便是把圖片放大了來看 ,不論是文字、圖片元素,都是細節拉滿的狀態。 再如這組充滿藝術感的視覺大片,這個AI也是不在話下: 那這是何許AI是也? 它,便是商湯剛剛面向社區開源的SenseNova U1.5-Lite-Preview。 這是一個輕量級原生統一多模態模型的早期預覽版本。它延續了商湯自研的NEO-Unify架構,把語言、視覺語義和像素生成放進同一套模型裡,覆蓋視覺理解、推理、生成與編輯。 不過有一說一,原生4K直出,還僅僅是它的亮點之一。 在僅有8B-MoT參數的輕量身形之下,U1.5-Lite-Preview做到了: 複雜Prompt能接住:支持長篇、多約束、層次化和結構化視覺指令; 文字和版式更能打:面向海報、信息圖、品牌視覺等高信息密度內容; 生成後還能繼續改:支持參考圖、多圖組合、局部文字編輯,以及紅框、座標和marker精準編輯。 畢竟在真實創作中,“會畫圖”只是第一步,真正決定它能不能進入創作流程的,還得看複雜任務和編輯能力。 那U1.5-Lite-Preview這個8B-MoT小模型創作起來有多方便?我們繼續往下看~ 能Hold住復

對話博登智能趙捷:十億訂單在手,具身智能最缺的仍是高質量數據
對話博登智能趙捷:十億訂單在手,具身智能最缺的仍是高質量數據TechPulse2026.08.03 19:48 · 來自河北全文5467字00:00 / 17:40機器人真正的進步,有時就藏在一次失敗之後:它有沒有記住,人類當時是怎樣把錯誤糾正過來的。具身智能的數據生意正在迅速升溫。斯坦福大學《2026 AI Index Report》顯示,機器人在仿真操作基準中的任務成功率已達到89.

在K3爆火之際,來聊聊Kimi的商業化前景
月之暗面推出的Kimi K3模型因開源且性能強勁而爆紅,上線後迅速登頂Hugging Face趨勢榜,並引發資本市場震盪。其商業化進展迅速,年度經常性收入(ARR)已突破3億美元,API收入佔比超過七成,海外付費用戶增長顯著,並藉助與亞馬遜雲科技等雲平台的合作拓展全球市場。

AI科研範式革命:花200美元即可攻克一道數學世紀難題
AI科研範式革命:花200美元即可攻克一道數學世紀難題硅谷Tech news2026.08.03 19:13 · 來自北京全文5638字00:00 / 14:37科研的邊際成本從百萬美元級降至百元級,重新定義成本結構往往意味著產業變革的開始。

怎麼看待AI大回調,大摩120頁研報深度解讀
怎麼看待AI大回調,大摩120頁研報深度解讀AlphaEngineer2026.08.03 18:40 · 來自北京全文3170字00:00 / 08:53摩根士丹利解讀AI板塊回調:屬技術性回調,看好AI基建。作者 | 費斌傑 北京市青聯委員 熵簡科技CEO6月下旬以來,全球AI板塊經歷了一輪顯著回調。這到底是短暫的技術性回調,還是週期見頂的信號,這是一個價值千金的問題。

深度:外賓 Genspark
Genspark 雖在公開信支持開放權重模型,但其真實立場更接近閉源實驗室,商業策略上則希望藉開放模型降低成本。該公司創辦人刻意淡化曾在百度任職的背景,並在矽谷華人社群活動中保持距離,反而積極贊助國際商業會議,塑造純正美國 AI 公司的形象。