揭秘 OpenAI 的“終極野心”:讓智能體像人類一樣熟練操作電腦

作者:清源 責編:清源 評論: 8 月 20 日消息,據《商業內幕》今天(20 日)報道,OpenAI 員工樂觀估計,公司正接近實現從創立之初就設定的目標:讓 AI 智能體像人類一樣熟練地操作電腦,尤其是使用瀏覽器。自 2015 年成立以來,OpenAI 一直希望實現這一能力,最大的難題之一是獲得足夠的訓練數據。經過多年開發,公司現在已經有信心開始向客戶逐步開放電腦操作功能。OpenAI 電腦操作團隊經理阿里 · 韋恩斯坦指出:“一旦 ChatGPT 操作電腦和軟件的速度超過你我,就會改變人們默認與電腦交互的方式。
”OpenAI 最新模型從訓練初期到後期的各個階段,都加入了專門提升電腦操作能力的數據和訓練流程。參與開發熱門電腦操作智能體基準測試的哥倫比亞大學 AI 研究員周宇(音譯)解釋稱,這些訓練是在通用 AI 模型已有能力之上繼續強化,讓模型學會完成更多電腦任務。在最初的大規模基礎訓練階段,OpenAI 很可能加入了逐幀屏幕截圖,讓模型提前接觸有助於電腦操作的信息。進入後續訓練階段後,開發人員會向模型展示完成特定任務所需的正確操作。例如,要得到填寫完畢的稅務表格,或者完成一個物體的 3D 模型,就需要讓模型學習對應的一系列電腦操作。其中一部分訓練數據來自真人示範。
OpenAI 公佈 2025 年版電腦操作功能時曾透露,公司使用過由人類演示任務完成過程的數據集,但沒有透露最新訓練數據的具體情況。周宇指出,這類數據很昂貴,因為獲取困難,整理成能夠直接用於訓練的形式也需要大量工作。OpenAI 很可能還利用強化學習繼續提高模型的電腦操作能力,讓模型反覆嘗試虛擬任務,並獎勵成功完成任務的行為。周宇認為,模型可以學會更多執行這些“獲得過獎勵的操作”。OpenAI 也改變了模型實際操作電腦時獲取信息的方式。韋恩斯坦表示,過去 ChatGPT 需要反覆截取屏幕、分析像素、發送操作指令,再重新截屏分析。
而目前在打開網站後,系統可以直接快速讀取網頁的底層信息,從內存結構、無障礙信息到鏈接關係都能應對。屏幕截圖仍然是工作流程的一部分。用戶開啟電腦操作功能時,需要允許 ChatGPT 錄屏,以便系統迅速識別當前顯示的內容。韋恩斯坦表示,這些能力結合後,Codex 就能自行測試生成的代碼、發現問題並繼續修改,形成“完整閉環”。韋恩斯坦和負責 OpenAI 瀏覽器能力的詹姆斯 · 孫認為,電腦操作技術的一大價值,是讓 ChatGPT 智能體能夠進入互聯網中大量彼此獨立的服務和“長尾”網站。從預約網站、企業內部庫存系統到社媒平臺,許多在線工具起初就是為人類手動點擊和輸入而設計的。
兩人透露,已經有用戶利用電腦操作功能自動處理數據錄入、合規任務和日程安排。韋恩斯坦指出,OpenAI 模型能力提高後,也越來越能主動發現錯誤並自行修正,因此更容易把任務做完,也更不容易在網絡環境中被無關內容帶偏。周宇認為,目前電腦操作技術的速度距離普通消費者期待的水平仍有明顯差距。“在訓練數據非常充足的有限領域,電腦操作智能體確實可以表現得很好。想讓它適應任何網頁、任何應用程序和任何操作系統,仍然非常困難。”目前,電腦操作功能還不能迅速批量處理郵件回覆,瀏覽社交媒體信息流時也顯得較為遲緩。
詹姆斯 · 孫和韋恩斯坦希望,隨著 OpenAI 模型繼續升級,電腦操作最終能夠達到 AI 編程目前的效率,讓 AI 直接操作網絡工具比用戶親自動手更快。詹姆斯 · 孫表示:“對很多工程師來說,現在已經是讓智能體寫代碼比自己寫更快。根本不用權衡,直接讓它做就行。我認為電腦操作以後也會越來越接近這種狀態。”2025 年,OpenAI CEO 薩姆 · 奧爾特曼談到早期電腦操作功能時曾公開示警:“實用價值很大,潛在風險也同樣不小。我們建議只向智能體提供完成任務所必需的最低權限,以降低隱私和安全風險。
”詹姆斯 · 孫表示,OpenAI 一直在研究“確認策略”,也就是 AI 執行下一步操作前,究竟應該在什麼情況下向用戶請求授權。目前的原則是,只要智能體準備向外傳輸數據或者刪除內容,就必須先徵得用戶同意。網絡工作往往需要連續快速地做出決定,因此 OpenAI 仍在尋找易用性和安全性之間的平衡。他坦言:“你可以把某個東西做到 100% 安全,但那樣就非常非常難用了。也可以把它做得非常容易使用,但同時非常危險。所以我們真正想解決的問題,是如何做出既有幫助、又容易使用的產品。
” 投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:ChatGPT,OpenAI,AI 智能體,CodexChatGPT 突發全球大規模服務中斷,OpenAI 稱正在修復OpenAI 回應少量 Codex 用戶調用 GPT-5.6 系列 AI 模型誤刪文件問題不再僅限 API 密鑰:Codex 中的 GPT‑5.
6 Sol 百萬上下文能力已可通過 ChatGPT 賬號使用OpenAI 推出預覽版 ChatGPT for Linux 桌面端應用OpenAI 總裁布羅克曼承認新 ChatGPT AI 桌面應用“有點亂”,目標打造“零標籤”OpenAI 突發服務器故障,ChatGPT、Codex 出現宕機
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

企業AI最後一公里:三路人馬在此交鋒
鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。