近300萬人圍觀卡帕西親測Opus 5:兩小時寫完5500行代碼, 卻連自己寫的遊戲都玩不了

重點摘要
卡帕西直播實測 Opus 5 模型,兩小時內生成 5500 行程式碼嘗試開發遊戲,但最終遊戲無法正常遊玩,凸顯模型在邏輯驗證與除錯上的侷限。這場測試吸引近 300 萬人次觀看,反映當前 AI 生成程式碼雖快速,但離真正可用的工程師角色仍有明顯差距。
AI 領域知名人物、前 OpenAI 研究員與特斯拉自動駕駛技術負責人卡帕西(Andrej Karpathy)近日在社群平台上進行了一場長達兩小時的直播實測,親自挑戰一款名為「Opus 5」的模型。這場直播不僅吸引近 300 萬人次圍觀,更因為他在短短兩小時內利用該模型生成了 5500 行程式碼,嘗試寫出一款可玩的遊戲,最後卻發現連自己都無法順利遊玩,引發熱烈討論與大量轉發。卡帕西向來以深入淺出的技術分享著稱,這次他刻意選擇從零開始建構一款遊戲,涵蓋遊戲邏輯、畫面渲染與互動機制等完整環節。
在直播過程中,他幾乎全程仰賴 Opus 5 自動產出程式碼,只見模型以驚人的速度一行一行吐出程式,短時間內就累積了超過五千行的程式碼庫。卡帕西不時驚嘆於模型的生成效率,並與觀眾互動,展示每個階段的進度。然而當遊戲初步完成,卡帕西實際操作時,卻發現遊戲存在多處錯誤與邏輯缺陷。例如角色移動會卡住、碰撞判定異常、關卡無法觸發切換,甚至連基本操作都無法順暢執行。他試圖手動調整幾處關鍵參數,但由於程式碼數量龐大且結構複雜,除錯過程耗費不少時間,最終仍無法讓遊戲順利運作。卡帕西在直播尾聲苦笑表示,自己連這款由 AI 協助寫出的遊戲都玩不了,凸顯了當前模型在複雜邏輯驗證與除錯層面的明顯侷限。
這場親測不僅展現了 Opus 5 在程式碼生成方面的驚人速度與產量,也讓外界清楚看到「寫得多」與「寫得對」之間仍有不小的差距。卡帕西在直播中多次強調,大型語言模型在生成代碼時,往往能快速給出看似合理的結構,但實質上缺乏對整體系統一致性的掌握,尤其當程式碼彼此依賴、狀態共享時,錯誤很容易層層疊加。業界人士分析,Opus 5 這類模型在自動化生成程式碼方面確實具備潛力,但距離真正的「AI 工程師」還有很長的路要走。卡帕西的測試結果正好提供了一個真實對照:模型可以幫你寫出大量程式碼,卻無法保證這些程式碼能正確運作,尤其當專案規模變大、邏輯鏈條變長時,模型的弱點會更加明顯。
值得注意的是,卡帕西並非首次公開測試大型語言模型的程式碼能力。過去他曾多次使用不同模型進行類似實驗,包括撰寫簡單的演算法、自動補全程式碼片段等,但這次的遊戲開發挑戰規模更大、互動性更強,也更貼近真實開發情境。他選擇將完整過程直播,讓觀眾親眼見證模型從快速生成到陷入除錯困境的完整過程,引發了許多開發者的共鳴。不少網友在觀看直播後留言表示,自己也曾遇過類似情況:AI 幫你寫了一大堆程式碼,但實際上線時卻漏洞百出,除錯時間甚至比從頭自己寫還長。卡帕西則在直播中總結,當前的 AI 程式碼生成工具比較適合當作「加速器」或「靈感來源」,而非取代工程師的思考與驗證。
他認為,未來模型的進步方向應該著重於邏輯推理與錯誤檢測,而非僅追求生成速度與字數。這場直播也讓 Opus 5 模型在技術圈內獲得大量關注。雖然卡帕西並未公開模型的具體技術細節,但從其輸出品質與速度來看,Opus 5 在參數規模與訓練資料量上應該處於業界領先水準。然而,正如卡帕西所展示的,參數量大並不代表邏輯正確,尤其是在需要持續維護狀態與處理邊界條件的遊戲開發場景中,模型的表現仍有待提升。從更宏觀的角度來看,卡帕西的親測經驗為 AI 輔助開發的實用性提供了真實的參考數據。開發者可以藉此評估何時適合讓 AI 介入,以及何時需要人類工程師的介入。
業界普遍認為,未來 AI 與人類協作的最佳模式,可能是讓 AI 負責大量模板化、重複性的編碼工作,而由人類主導邏輯設計、架構規劃與最終驗證。卡帕西在直播最後並未放棄這款遊戲,他預告將在後續影片中嘗試手動修正錯誤,並與 Opus 5 模型合作完成除錯。這也暗示著,即使模型當下無法完美產出可執行的遊戲,但透過人機協作的反覆迭代,仍有機會逐步縮小差距。對於廣大開發者而言,這場直播不僅是一次技術展示,更是一堂關於 AI 能力邊界與開發思維的寶貴課程。
Related
相關文章

大廠搶灘辦公入口:AI正在吃掉Office
科技巨頭積極搶進AI辦公領域,試圖以AI技術重新定義辦公入口,挑戰傳統Office軟體市場。各廠商透過整合AI能力,推出智慧辦公產品,使辦公場景更高效。這場競爭正加劇,傳統辦公軟體版圖面臨前所未有的挑戰。

騰訊混元Hy ASR 3.0 preview:讓語音識別理解上下文
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 騰訊混元Hy ASR 3.0 preview:讓語音識別理解上下文 允中 2026-08-04 16:58:21 來源:量子位 元寶已接入 8 月 4 日,騰訊混元正式發佈新一代語音識別模型 Hy ASR 3.
騰訊混元發佈 Hy ASR 3.0 preview:語音識別不再逐字硬轉,而是真的聽懂了語境
AI資訊AI新閒資訊正文騰訊混元發佈 Hy ASR 3.0 preview:語音識別不再逐字硬轉,而是真的聽懂了語境發布於AI新閒資訊時間 :Aug 4, 2026閱讀 :1分鐘騰訊混元今天正式端出了新一代語音識別模型 Hy ASR3.0preview。

博導稱月之暗面 Kimi 創始人楊植麟有很多機會留在美國,但他毅然拒絕蘋果、堅持回國創業
月之暗面創辦人楊植麟的博士生導師透露,楊植麟在攻讀博士期間及畢業後,曾收到蘋果等美國科技巨頭的優渥工作邀約,但他最終放棄這些機會,毅然選擇回國創業。這項決定催生了月之暗面公司及其AI產品Kimi,讓他在短時間內成為中國AI領域的重要人物。
歐盟AI透明度新規生效
歐盟AI透明度新規生效。 歐盟正式實施透明度規則���️方案。詳情可以參考歐盟透明規則執行條例細則。大模型生成的內容必須帶機讀標記。深偽視頻必須向公眾進行明確告知。
大模型抗汙染對齊評測框架
大模型抗污染对齐评测框架近日成为关注焦点。该框架旨在系统评估大语言模型在数据污染或对抗干扰下的对齐表现,为检验模型的安全性与鲁棒性提供新的评测维度。 站内已清除先前混入的模型思考或安全判断文字,保持内容纯净,并保留来源可确认的主题供读者追踪,以确保信息准确可溯。