“氛圍編程”命名人卡帕西提高 AI 回答質量的竅門:與它閒聊 10 分鐘

重點摘要
AI研究員卡帕西建議,使用AI時不必費心打磨提示詞,直接與它閒聊約10分鐘,讓模型理解用戶的模糊想法,再整理成清晰內容。他認為這種漫談方式能讓用戶與聊天機器人更合理分工,並減少後續修正。目前硅谷企業正積極改進AI語音功能,推動用戶從鍵盤輸入轉向語音交流。
知名 AI 研究員、同時也是「氛圍編程」概念提出者的安德烈·卡帕西(Andrej Karpathy)近日分享了一個與大型語言模型互動的實用技巧:不必費心雕琢提示詞,只需要打開語音模式,對著 AI 連續閒聊大約 10 分鐘,就能讓模型更準確地理解使用者的需求。卡帕西目前任職於 AI 公司 Anthropic,他認為許多人過度專注於撰寫精確的提示詞,反而忽略了人與模型之間最自然的溝通方式。卡帕西表示,自己經常在使用 AI 時開啟語音模式,然後一口氣說上十來分鐘,想到什麼就說什麼,完全不需要提前組織語言或整理思路。
整個過程可能聽起來雜亂無章,甚至包含許多語無倫次的片段,但正是這種「亂七八糟」的閒聊,反而能讓大語言模型獲得更多背景資訊,從而真正掌握使用者想完成的目標。他強調,漫談式對話可以讓使用者與聊天機器人形成更合理的分工:使用者只需將腦中尚未成形的項目想法全部傾倒出來,再由 AI 整理成清晰、有條理的內容。為了讓模型更適應這種隨性的交流方式,卡帕西通常會在對話一開始就先提醒聊天機器人,自己的思路可能比較混亂,語音轉寫的結果也可能出現錯別字。他認為,這樣做能讓人和模型更好地理解彼此,後續需要修正的內容也會大幅減少。
換句話說,與其花時間琢磨如何寫出完美的提示詞,不如放鬆心情,像跟朋友聊天一樣,把腦中的零碎點子一股腦兒說出來,讓 AI 自行消化與重組。卡帕西的建議與當前硅谷企業的發展方向不謀而合。目前多家科技巨頭正積極改進 AI 的語音功能,努力讓使用者從傳統的鍵盤輸入轉向直接開口交流。OpenAI 在本月早些時候推出了 GPT-Live,為 ChatGPT 的語音互動提供更流暢的支援;同時還發布了一款售價 230 美元(約合新台幣 1560 元)的迷你鍵盤,鍵盤上設有語音錄製按鍵,使用者按下後就能直接對 AI 說話,將語音提示交由智能體處理。
這款產品明顯是為了降低語音互動的門檻,讓使用者不再需要打字就能快速獲得 AI 回應。另一家 AI 公司 Anthropic 則在本週四升級了自家的語音模型,讓使用者可以根據需求選擇 Opus、Sonnet 或 Haiku 等不同版本。這些模型在語音識別與自然語言理解方面都有顯著提升,能夠更準確地處理口語化的表達,甚至容忍一定程度的語音轉寫錯誤。卡帕西所屬的 Anthropic 本身也在語音 AI 領域持續投入,這次升級正好呼應了他提出的「閒聊式互動」概念。卡帕西的觀點並非孤例,愈來愈多研究人員與開發者意識到,大型語言模型其實相當擅長從混亂的輸入中提取關鍵資訊。
傳統上,使用者為了讓 AI 產出理想的結果,往往會花大量時間撰寫結構化提示詞,甚至使用各種提示工程技巧。但卡帕西認為,這種做法可能過於僵化,反而限制了模型的潛力。當使用者以自然、隨意的方式說話時,模型能夠接觸到更多上下文脈絡,例如使用者對某個項目的模糊想法、未說明的假設,甚至是情緒與語氣的變化,這些都是簡潔提示詞難以傳達的。當然,這種方法並非適用於所有場景。如果使用者的需求非常明確,例如查詢天氣、計算數學公式,那麼直接給出精確提示詞仍然是最有效率的方式。但對於需要創意發想、專案規劃、頭腦風暴等開放式任務,卡帕西的「10 分鐘閒聊法」或許能帶來意想不到的效果。
使用者可以先將腦中的碎片化想法全部說出來,讓 AI 幫忙整理成結構化的摘要,再從中挑選有價值的部分進行深化。隨著語音 AI 技術的成熟,以及像 GPT-Live、Anthropic 語音模型等產品的推出,人機互動的方式正在經歷轉變。鍵盤輸入雖然精確,但對於許多使用者來說,開口說話遠比打字來得直覺與快速。卡帕西的建議正好為這個趨勢提供了實用指引:不要害怕讓 AI 聽到你的「混亂」,因為正是這些混亂,才能讓模型真正理解你的意圖。未來,或許我們會看到更多使用者拋開提示詞模板,轉而用最自然的方式與 AI 對話。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。