AI語音交互再升級:OpenAI桌面端ChatGPT上線新功能,支持語音操控電腦執行多步驟任務
OpenAI 持續拓展 ChatGPT 的應用邊界,近日正式為桌面版用戶推出語音互動功能,讓電腦操作變得更像與真人助手對話。這項更新不僅讓 ChatGPT 能夠「聽見」使用者的口語指令,還能自動執行多步驟的複雜任務,大幅提升人機協作效率。過去使用者只能透過鍵盤輸入文字來與 AI 溝通,如今只需開口說話,就能要求 AI 搜尋資料、整理文件、安排行程,甚至完成跨應用程式的連動操作。這項新功能的核心技術來自 OpenAI 最新發表的 ChatGPT-Live 語音模型系列。該模型專為即時語音互動設計,能夠在極短的時間內理解自然語音中的意圖與上下文,並精準對應到作業系統或應用程式中的操作指令。
相較於傳統語音助手只能處理簡單的單一指令,ChatGPT-Live 更能串聯多個步驟,例如使用者可以說「幫我找出上週的會議記錄,整理成重點摘要,然後寄給團隊」,AI 便會自動完成搜尋、彙整與發送郵件等流程。在桌面端整合語音控制,是 OpenAI 在人機介面設計上的一大突破。過去 ChatGPT 的語音功能主要限於手機 App 與網頁版,讓使用者以對話方式進行問答,但桌面版一直以文字輸入為主。此次更新意味著電腦使用者也能享受到免持操作、多工並行的便利。對於需要同時處理大量資訊的知識工作者而言,這項功能尤其實用:一邊瀏覽資料一邊口頭下達指令,無需頻繁切換視窗或打子,工作效率可望明顯提升。
從技術層面來看,ChatGPT-Live 語音模型延續了 OpenAI 在自然語言處理上的優勢,但進一步強化對口語變化、語速、停頓與情緒的辨識能力。即使使用者說話帶有口音或使用非標準文法,模型也能正確解讀意圖。此外,模型還支援打斷與修正:如果使用者在中途改變心意或需要調整指令,可以直接說話打斷 AI 正在進行的操作,重新下達新指令,互動過程更接近人類對話的自然流暢。OpenAI 表示,這項功能目前正逐步推送到 ChatGPT Plus 與 Team 付費用訂戶的桌面版應用程式中,免費用戶預計在未來數週內也能體會到部分語音能力。
由於語音處理需要較多的運算資源,OpenAI 建議使用者在穩定的網路環境下使用,以取得最佳體驗。此外,為保護使用者的隱私與資料安全,語音指令的處理全程採用加密串流,且不會永久儲存語音錄記。這項更新也引發業界對於 AI 語音助手未來的討輪。長期以來,語音互動一直被視為下一代人機介面的關鍵技術,但過去因辨識率、延遲時間與場景限制而未能全面普及。OpenAI 借助大語言模型的語意理解能力,讓語音控制不再只是「說一句做一件」的工具,而是能主體理解脈絡、自主規畫步驟的智能體。這使得電腦操作從「指今驅動」進化為「目標導向」:使用者只需告訴 AI 想要達成的結果,剩下的細部流程由 AI 自動拆解與執行。
除了提升個人生產力,這項功能也為特殊需求用戶帶來便利。對於行動不便或無法長時間使用鍵盤滑鼠的人來說,語音操控桌面電腦將大幅降低數位參與的門檻。開發者亦可透過 API 將語音能力整合到自家應用程式中,創造更多元的服務場景,例如醫療記錄自動摘要、廚房免觸控食譜查詢、工廠設備聲控操作等。業界分析指出,OpenAI 此舉是為了鞏固其在 AI 辦公領域的領導地位。微軟、Google、亞馬遜等競爭對手同樣積極發展語音助理,但大多仍停留在問答與家用情境,鮮少能直接操作桌面應用程式執行複雜任務。
ChatGPT 桌面語音功能的推出,等於將對話式 AI 的戰場從手機與智慧音箱延伸到個人電腦,進一步模糊了人機之間的互動邊界。未來,OpenAI 還計畫讓語音功能支援更多第三方應用,例如直接透過語音操作 Excel、Photoshop 或程式碼編輯器,並且讓 AI 能夠同時參考螢幕上的內容進行上下文理解。例如使用者看著一份報表說「把這個數字改成上季度的數據」,AI 便能自動定位該數字並完成更新。這種「看即所說、說即所做」的體驗,正是 OpenAI 描繪的下一階段人機協作願景。總體來說,ChatGPT 桌面版語音功能的上線,不僅讓既有的文字互動多了一個直覺選項,更重新定義了電腦操作的效率標準。
當開口說話就能完成繁瑣任務,使用者將能把更多心力專注於創意與決策,而非機械式操作。隨著語音模型持續進化,AI 助手從「會聽話」進化到「會辦事」,這場人機互動的變革才剛剛開始。
Related
相關文章

王興興“錯配”梁文鋒?
王興興“錯配”梁文鋒?字母榜2026.08.24 17:44 · 來自河北全文4818字00:00 / 13:21關於世界模型,宇樹和DeepSeek理念分歧明顯。文 | 字母榜宇樹科技的股價還在持續下跌。市值從上市首日的4449億元高點,跌至2400億元,截至8月24日收盤,市值較最高點蒸發了2000億元。然而比股價更值得關注的是,宇樹接下來要怎麼走。8月20日,也就是宇樹上市第二天,王興興出現在北京世界機器人大會論壇。十多分鐘的分享裡,AI成為了高頻詞彙。他談到AI實時生成、實時識別,也談到AI模型投入,更透露了宇樹正在預研的一件事:讓物理AI機器人實現“自進化”。王興興講的每一件事,最後都指向一個關鍵要素:AI大模型。特別是最後一點,王興興說,要實現“物理AI自進化”,要用目前最前沿、最頂尖的AI大模型來驅動。而這恰恰是宇樹目前不太擅長的部分。不過,宇樹找到了DeepSeek。今年8月,兩家公司已經達成合作,圍繞AI大模型與具身智能相關技術展開合作。說到具身智能公司和AI大模型公司的合作,就不得不提當年Figure AI和OpenAI的合作。2024年,OpenAI在投資Figure AI後,雙方簽署了三年合作協議,合作開發人形機器人AI模型。但是僅一年後,FigureAI終止合作,轉向自研。於是問題來了:王興興和梁文鋒,會不會重走Figure AI和OpenAI的老路?01為什麼宇樹需要DeepSeek?對於宇樹來說,過去幾年,模型研發已經有了一些積累,但顯然投入不足,進展緩慢,所以找到一個頂尖的AI大模型公司合作,是一個比較自然的選擇。先來看宇樹目前的模型研發進展。當前,具身智能大模型沒有一個統一的技術路線,但VLA和世界模型,是行業重點探索的兩個方向。行業甚至也在探索兩者融合的技術路線。宇樹也在摸索,採取了“兩條腿走路”的策略,並行研發兩種模型。所謂VLA(視覺

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。