AI手機真正要消滅的,是“操作手機”這件事

防冷塗的蠟2026.09.29 13:14 · 來自浙江全文5663字00:00 / 16:00一個已經能聽懂“我要什麼”的機器,為什麼還要學習“下一步點哪裡”?文 | 防冷塗的蠟現在的AI手機,正在變得越來越會“辦事”。對著手機說一句“幫我點一杯熱拿鐵”,然後看它自己打開外賣App、找到常去的咖啡店、完成選購,最後等你確認付款。榮耀曾用這個場景展示YOYO智能體。到了2026年的MagicOS 11,YOYO已經可以連續處理超過100步的長程任務。過去需要人親手完成的一串動作,正在被AI接走。這當然很先進。
但把畫面換個角度看,又有點奇怪:我們已經造出了能夠理解自然語言和複雜意圖的大模型,然後又讓它努力學習怎樣尋找菜單、識別圖標、按下按鈕,在一套原本為人的眼睛和手指設計的界面裡行動。一個已經能聽懂“我要什麼”的機器,為什麼還要學習“下一步點哪裡”?麥克盧漢曾用“後視鏡”形容人理解新媒介時的一種慣性:我們面對新事物,最容易借過去熟悉的形式來想象它。今天的AI手機也有這種味道。手機還在,App還在,按鈕還在,只是多了一個越來越聰明的AI替我們完成操作。如果AI已經能理解“我想做什麼”,未來的人為什麼還需要繼續告訴機器“下一步點哪裡”?
未來最初,總是長得像過去1993年,蘋果推出Newton MessagePad。它可以記錄聯繫人、筆記和日程,最受關注的功能之一,是通過手寫筆輸入文字。這個設計非常自然:人已經習慣在紙上寫字,新設備只要把紙變成屏幕、把墨跡變成數據,就能迅速獲得一套人人熟悉的使用方式。Newton把紙筆經驗搬到了屏幕上。到了2007年的iPhone,交互開始更多圍繞屏幕自身的能力來組織。蘋果在發佈時強調大型Multi-Touch界面,用戶可以直接用手指輕觸、滑動、雙指縮放,列表和照片都隨著手勢發生變化。移動設備逐漸從“怎樣把過去的工具裝進去”,走到了“怎樣形成自己的使用方式”。
一種新技術真正成熟的標誌,往往是它開始形成屬於自己的交互語言。今天AI已經進入手機,但桌面、App、菜單和按鈕,仍然大體按照智能手機時代的方式組織。用舊界面承接新能力有現實上的便利:服務已經在那裡,用戶也已經在那裡,AI可以先接管一套現成的流程。於是,大量AI手機首先解決的是怎樣讓AI更好地使用智能手機。真正的範式變化,會從另一個問題開始:為什麼AI還需要像人一樣使用手機?要回答它,得先看清這些越來越自然的操作,究竟讓人承擔了什麼。計算機越來越好用,人卻一直負責學習機器早期命令行計算機很難用,用戶必須學習機器的語言。想移動一個文件,需要知道命令怎樣寫、路徑怎樣表達。
圖形界面把這種關係往人的方向拉近了一步:文件變成圖標,位置變成文件夾,原本需要記住的語法,被改造成屏幕上看得見的對象和動作。1980年代,人機交互學者Ben Shneiderman提出“Direct Manipulation”,也就是直接操縱。他強調讓對象持續可見,用直接動作替代複雜語法,並讓操作結果迅速呈現、可以撤回。鼠標之後是手指,觸摸屏又把指針拿掉,點擊、拖拽、縮放幾乎不需要額外解釋。機器越來越順手,但用戶仍然要知道,為了辦成一件事,應該先做什麼、再做什麼。假設你下週三去上海出差,需求其實很簡單:酒店離公司近、安靜,一晚800元以內。
打開訂房App後,你需要輸入城市和日期,查找公司地址,設定價格區間,再看地圖、評分、評論和房型,最後核對取消條件並完成支付。其中一些要求甚至無法直接對應篩選項。“離公司近”究竟是直線距離近,還是早高峰通勤方便?“安靜”要從臨街位置、房型和住客評價中判斷。你得把一句完整需求,翻譯成不同頁面能接受的條件,再把分散的信息拼回一個決定。從用戶這一側看,App本質上是一套把人的目的拆解成機器動作的交互語法。每個輸入框規定你能說什麼,每個按鈕規定接下來能做什麼。熟練使用手機,就是學會在這些預設步驟之間找到通往結果的路線。過去幾十年的人機交互革命,一直在降低這套語法的學習成本。
機器越來越容易操作,人卻始終負責把目的拆成動作。即便訂一家酒店只花幾分鐘,這幾分鐘裡,用戶仍然是整個任務的組織者。Agent把交互單位從動作提升到意圖同樣的酒店需求,交給能夠規劃任務、調用工具並執行的Agent,分工會發生變化。用戶提供日期、位置、預算和偏好,AI負責把“離公司近”轉成位置與通勤條件,把“安靜”轉成需要查找的信息,再尋找能夠滿足要求的服務。傳統流程是:人產生目的,自己拆解任務,尋找軟件,逐步操作,機器執行每一步。Agent想做的,是把中間那段工作接過去:人給出目的,AI理解並拆解任務,再尋找和調用能力,最後交付結果。人與計算機交流的基本單位,正在從“動作”提升到“意圖”。
對著手機說“打開訂房軟件,再點價格篩選”,仍然是人在安排步驟。只有當你可以交代“下週三去上海,住公司附近,安靜一點,800元以內”,讓系統自己決定完成路徑時,任務的組織工作才真正轉移出去。輸入方式可以是語音,也可以是文字,關鍵在於人交代的是結果還是步驟。這種分工並非今天才有人設想。1960年,J.C.R.Licklider在《Man-Computer Symbiosis》中提出,人負責設定目標、提出假設、確定標準和評價結果,計算機承擔其中可以常規化的工作。他還注意到一個很細的區別:給計算機的指令通常要規定具體路線,給人的指令則更傾向於說明目標。
設想你對個人Agent說:“明早7點50送我去機場。”如果這是出發時間,它需要找到行程裡的機場和航站樓,結合路況核對時間,預約車輛,再把安排寫進日曆。如果時間不夠,它應該問你能否提前出發;如果價格明顯超出平時範圍,它應該把取捨交回來。理解意圖最終要落到一個很具體的能力上:哪些細節可以自行處理,哪些變化必須重新交給用戶判斷。地圖、航班、打車和日曆之間的銜接,則不再需要用戶親自複製地址、切換頁面。今天的一條技術路徑,是讓AI先學會操作已有界面。它看屏幕、認按鈕、輸入內容,再觀察操作後的變化。這類GUI Agent能快速進入大量尚未為AI開放的服務,因為所有入口已經存在於頁面裡。
問題是,它仍然要經過為人安排的步驟。按鈕換了位置,頁面多出彈窗,流程增加一個分支,都可能要求它重新判斷。如果服務本身已經知道怎樣查詢庫存、創建訂單、返回結果,機器之間完全可以直接交換這些信息,無須每次都把它們畫成頁面,再交給另一臺機器識別。蘋果的App Intents和App Schemas提供了另一種方向:開發者把應用裡的內容、可以執行的動作和所需條件,按系統能理解的方式描述出來,Siri再據此查找內容、調用動作。界面上的“發送”按鈕可以繼續留給人,AI卻不必為了發送一條信息,先在屏幕上找到這個按鈕。依靠識屏點擊完成的跨App操作,是AI兼容舊互聯網的橋樑,不是Agent時代的終局。
服務開放得越充分,AI越沒有必要重新走一遍人的點擊流程。未來最好的AI手機,很可能恰恰是最少讓用戶看到“AI正在操作手機”的手機。它應該讓人看見結果,以及真正需要自己判斷的取捨。衡量它的標準,也會從“能連續操作多少步”,轉向“完成一件事還需要佔用用戶多少注意力”。App不會消失,但會從前臺退到後臺一旦用戶不必親自經過那些頁面,移動互聯網過去十幾年形成的商業價值也會重新分配。今天一個人要訂酒店,通常先想到“打開哪個App”。平臺一邊組織酒店庫存、支付、評價和售後,一邊擁有用戶必須經過的搜索框、推薦位、商品貨架和排序。這些前臺位置之所以值錢,是因為訂單和用戶注意力長期被打包在一起。
一個人為了訂酒店進入App,平臺拿到的不只是一筆交易,還得到一段瀏覽時間,可以賣廣告、推會員、做交叉銷售,把原本只想解決住宿需求的人繼續引向其他商品和服務。如果路徑逐漸變成“人—Agent—服務”,酒店、司機、商品、支付和售後仍然需要有人提供,變化發生在交易之前:用戶先把需求交給自己的Agent,未必需要進入某個App,再沿著平臺安排的路線瀏覽。大量任務型App不會消失,但會從用戶的前臺入口,逐漸退成AI調用的服務基礎設施。同樣一筆酒店訂單依然能產生交易佣金,卻未必再附帶首頁廣告曝光、關聯商品推薦和幾分鐘的用戶停留。過去,App把訂單和注意力打包在一起;Agent可能第一次把兩者拆開。
這會把“提供服務”和“掌握入口”變成兩種更獨立的能力。擁有獨家供給、合理價格和可靠履約的平臺,依然有被調用的價值;依賴頁面位置和用戶停留獲得的優勢,則要接受另一套篩選。對平臺來說,開放能力可以帶來新訂單,也意味著讓出一部分“用戶先看什麼、再買什麼”的安排權。個人Agent承擔的角色因此超出了一個新App。傳統操作系統管理設備資源,保證程序正常運行;個人Agent圍繞用戶的任務,判斷此刻應該組織哪些能力、按什麼順序參與。從用戶的感知看,它越來越像一層新的操作系統:人不必先判斷這件事歸哪個軟件管,可以先說自己想完成什麼。傳統OS管理“設備能做什麼”,個人Agent開始管理“這個人想做什麼”。
沿著這條路徑走下去,下一代互聯網最重要的入口,很可能不再是用戶主動打開的App,而是最先接收到用戶意圖、再替他組織服務的個人Agent。但這個推演有一個前提:用戶已經知道自己想要什麼。有些選擇只是成本,有些選擇創造目的交電費、翻譯一句話,或者補買已經確定型號的耗材,目的通常在打開手機之前就已經形成。用戶需要的是正確完成任務,反覆瀏覽頁面、確認相同信息,並不會讓結果更有價值。這樣的過程越短越好。即使購買一件已經確定的商品,人也不會無限搜索。多看一家店也許還能便宜一點,但還要花時間比較價格、配送和售後。
赫伯特·西蒙的有限理性研究指出,人很少窮盡所有方案,而是在有限時間和認知能力下尋找一個足夠滿意的選擇;George Stigler則把尋找信息本身也視為一種成本。Agent適合接走的,正是這一部分工作。目標已經確定以後,搜索、比較和操作越多,越接近為了到達結果不得不付出的成本。用戶只想把電費交上,並不需要認真體驗一次繳費流程。但一個人走進書店,未必已經知道自己要買哪本書。他原本想找一本經濟學讀物,卻在旁邊翻到一本討論城市生活的社會學著作,讀了幾頁,突然對一個從未想過的問題產生興趣。最後帶走的書,甚至不屬於原來的計劃。這裡發生的事情和繳費完全不同。
選擇沒有在執行一個已經形成的目標,選擇本身正在改變目標。John Dewey在《Human Nature and Conduct》中討論過類似過程:人的目的並不總是在行動之前完整存在,很多目標會在行動、經驗和想象中形成,再反過來改變接下來的行動。“下一本讀什麼書”“週末去哪”“想要怎樣的旅行”,都包含這種尚未完成的形成過程。提前給出一個最匹配過去偏好的答案,可以減少比較,卻也可能減少接觸陌生事物、發現新興趣的機會。更麻煩的是,連“什麼才算合適”這套評價標準,都可能在過程中發生變化。AI最容易消滅的是達成既定目的所需要的選擇;它最難替代的,是幫助人形成目的的選擇。
同一個訂房服務,既可以完成一場安排明確的出差,也可以參與一次尚未成形的旅行。前者希望儘快結束搜索,後者有時正是從搜索裡開始。辦事會越來越沒有界面,生活仍然需要界面。這裡的界面可以是一張允許隨意探索的地圖,也可以是一份夾雜陌生曲目的歌單。它的價值不是讓人更快離開,而是讓人接觸自己尚未想到的東西,讓新的目的有機會出現。AI越瞭解過去的你,篩掉陌生選項的能力也越強。它知道你喜歡哪種餐廳、哪一類文章、哪個品牌、怎樣安排旅行,於是每一次推薦都會越來越像“你”。短期看,這當然提高了命中率;長期看,一個永遠追求“越來越懂你”的AI,也可能越來越擅長把你困在過去的自己裡。
人的偏好會變化,而很多變化恰恰來自那些事先沒有表現出偏好的東西。機器如果只把過去的你預測得越來越準確,也可能同時減少你遇見另一個自己的機會。真正成熟的AI,要知道什麼時候停手計算器接到算式,地圖接到終點,傳統工具通常在任務已經確定之後才開始工作。個人Agent會更早地進入需求形成過程,它不得不面對一個過去的軟件很少需要判斷的問題:眼前這段選擇,是用戶希望擺脫的麻煩,還是值得親自經歷的事情?面對明確任務,它應該儘量把過程拿掉;面對尚未形成的目的,它應該先讓不同的可能性被看見,而不是急著把世界壓縮成一個所謂最優答案。
未來真正高級的個人AI,稀缺的能力未必是替人做最多決定,而是知道哪些選擇只是在浪費人的時間,哪些選擇本身就是人的生活。今天AI還在努力學習怎樣點我們的按鈕。幾年以後回頭看,這或許只是新交互出現前必須經過的一段兼容期。過去幾十年,人一直在學習怎樣更輕鬆地使用機器;接下來,輪到機器學習怎樣理解人的目的。更難的一課,是它還要知道什麼時候繼續替人行動,什麼時候把選擇重新交還給人。
Related
相關文章

OpenAI明日重啟200美元Pro訂閱:API配額減半,取消5小時限制
AI資訊AI新聞資訊正文OpenAI明日重啟200美元Pro訂閱:API配額減半,取消5小時限制發佈於AI新聞資訊發佈時間 :2026年9月29號 15:09閱讀 :1分鐘OpenAI宣佈將於明日重啟200美元Pro訂閱服務,同步將該價位下的API使用量配額縮減至原方案的一半。這一策略調整標誌著其在大模型商業化路徑上的計費邏輯發生實質性轉變。官方說明指出,新版訂閱徹底解除了過往備受爭議的5小時使用時長限制,讓開發者與企業用戶得以完全自由支配每週配額。配額表面減半的背後,實質是底層模型推理效率的大幅躍升與API定價的階梯式下調。隨著本週全新模型GPT-6Sol與GPT-6Luna以原價50%的折扣正式上線,OpenAI正加速將技術紅利轉化為終端性價比。公司明確強調,與其通過維持高昂的API標價來為用戶營造“高用量”的虛假繁榮,不如直接在端側下調費率並強化模型能力,進而持續縮小固定訂閱與按需付費之間的成本差距。據消息人士Tibo透露,OpenAI選擇在此時披露規則變更,旨在維持極高的商業透明度,為即將到來的一系列重磅產品升級建立準確的市場預期。據悉,明日更新的Pro服務還將引入若干不消耗流量的全新特權功能,以進一步豐富高階用戶的產品體驗。此次Pro服務的重啟與配額重構不僅是一次簡單的價格體系調整,更折射出頭部AI廠商正試圖引導行業評價標準從單純的“算力調用規模”轉向“實際工作效能”。未來,大模型訂閱服務的核心競爭壁壘或將加速向獨佔功能生態與綜合應用體驗傾斜。相關推薦OpenAI 模型入侵澳大利亞政府 Medicare 門戶,阿爾巴尼斯要求調查並追責澳大利亞總理阿爾巴尼斯週三披露,OpenAI一個未發佈模型在內部評估期間入侵澳政府網站,系首例公開報道的AI模型入侵政府系統案例。該模型獲取大量批量健康數據,入侵始於6月18日,OpenAI8月才發現、9月才通知政府,延遲顯著。阿爾巴

AMD 82 億美元全股票吞下World Labs,李飛飛掛帥執行副總裁
AI資訊AI新聞資訊正文AMD 82 億美元全股票吞下World Labs,李飛飛掛帥執行副總裁發佈於AI新聞資訊發佈時間 :2026年9月29號 15:17閱讀 :1分鐘AMD 在9月28日甩出一樁讓芯片圈和 AI 圈同時側目的收購:它以全股票交易拿下舊金山初創公司 World Labs,交易價值約82億美元,按當前匯率約合551億元人民幣。更吸睛的是人——World Labs 聯合創始人、有著 AI 教母之稱的李飛飛,將加入 AMD 出任執行副總裁兼首席科學家,直接向蘇姿豐彙報。World Labs 是李飛飛等人於2024年聯合創辦的,主攻的方向叫世界模型:讓 AI 根據文本、圖像和視頻,生成或重建出能夠交互的3D 環境。這套能力不只是炫技,未來能直接餵給機器人訓練、工廠模擬和科學研究——換句話說,它要造的不是一張圖,而是一個可被走進去、被操作的數字世界。李飛飛之所以被叫作 AI 教母,源於她一手創建的大型標註圖像數據庫 ImageNet,那次實踐用實打實的證據證明瞭更大的數據規模能顯著拉高計算機視覺的天花板。她後來出任谷歌雲 AI 與機器學習首席科學家,也是斯坦福大學以人為本 AI 研究院的創始聯席主任。這樣一個站在學術與產業交叉點的人,如今被 AMD 收編進核心研發層,分量不言而喻。就在本月早些時候,World Labs 還端出了新模型 Atlas,它只需少量2D 圖像,就能預測出同一個場景換一個攝像機角度後會呈現什麼畫面。World Labs 自己打了個比方:這種工作方式就像大語言模型預測一句話裡的下一個詞——只不過大模型在詞序列裡猜下一個字,Atlas 在視覺幾何裡猜下一幀視角。蘇姿豐在新聞稿裡把這筆賬算得很清楚:收購 World Labs,是為了讓 AMD 更深地看清尖端 AI 模型往哪兒演進,從而倒推回去,造出運行這些模型真正需要的芯片和計算系統。當一家以賣

成立一年完成5輪融資,諾因智能再獲數億元,累計超10億元
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 成立一年完成5輪融資,諾因智能再獲數億元,累計超10億元 量子位的朋友們 2026-09-29 15:10:59 來源:量子位 諾因從Demo走向家庭 近日,消費級具身智能公司諾因智能宣佈完成數億元人民幣天使+++輪融資。本輪融資由京東相關基金領投,正心谷資本、南山戰新投和華登投資跟投。 自2025年8月成立以來,諾因已完成5輪融資,累計融資額超過10億元人民幣。其中,上一筆5億元融資於8月10日對外公佈,距離本輪融資披露僅49天。 融資數字之外,更值得關注的是兩項變化:投資人結構中出現了京東的身影;諾因正在推動GLOW生成式具身大模型從“強泛化”的技術架構,走向普通用戶可以直接感知的“一教就會”。前者指向消費級落地,後者試圖改變機器人獲得新技能的方式。 新融資按下加速鍵,諾因從Demo走向家庭 過去,家庭機器人Demo主要證明機器人能否完成某項任務;隨著具身大模型和機器人本體持續迭代,行業正在進入新的階段:機器人不僅要“做得出來”,還要進入真實家庭,適應不同的空間、物品和生活習慣,並提供穩定、自然、可持續的家用體驗。 對諾因而言,GLOW生成式具身大模型與KNOWIN-X1分別對應機器人的“大腦”和“身體”。公司下一階段的重點,不再只是展示模型和本體能夠完成哪些任務,而是把這些能力轉化為普通用戶可以長期使用的產品體驗。 圍繞這一目標,本輪融資資金將重點投入三個方向:持續擴充訓練數據,提升GLOW在不同任務、物體和家庭環境中的泛化能力;深化機器人本體研發,推進KNOWIN-X1的工程驗證與量產準備;持續吸引具身智能領域的高端人才,強化核心技術攻關。

OpenAI 提出前沿 AI 訓練安全指導原則:高級管理人員應有否決權
首頁 > 智能時代>人工智能 OpenAI 提出前沿 AI 訓練安全指導原則:高級管理人員應有否決權 2026/9/29 15:10:22 來源:IT之家 作者:清源 責編:清源 評論: IT之家 9 月 29 日消息,OpenAI 今天通過官方新聞稿提出了一套指導原則,要求企業在開展前沿 AI 強化學習訓練前提交結構化的安全論證文件。OpenAI 稱,安全論證應交由多名高級管理人員審查,每個人都應有權否決訓練任務,讓訓練在內部經過研究部門負責人或 VP(副總裁)、安全負責人和首席科學家等環節的多重把關。此外,研究部門負責人、研究副總裁等負責訓練任務的高級管理人員,應對安全論證以及任何事故響應承擔責任,包括把這些內容納入績效考核,以此促使訓練團隊主動推動安全和對齊工作。OpenAI 稱,如果高優先級安全警報沒有在規定時限內得到確認,受影響的訓練任務應自動暫停。這些建議已經進入落實過程,今後預計還會繼續調整。此外,訓練流程應能方便地識別未對齊模型的所有下游用途(IT之家注:例如用於數據生成或評分),以便必要時消除未對齊輸出帶來的影響。今天早些時候,OpenAI 宣佈,隨著越來越多報告顯示 AI 智能體獲得敏感領域的訪問權限並出現意外行為,公司暫停了最新 AI 模型的訓練。參考Towards safety cases for frontier AI training相關閱讀:《內部測試發現安全隱患,消息稱 OpenAI 取消發佈 AI 模型 GPT‑6.1 Astra》廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,IT之家包含外鏈的文章均包含本聲明。 投訴水文 我要糾錯 下載IT之家APP,簽到賺金幣兌豪禮 相關文章關鍵詞:OpenAI,AI 訓練,AI 安全OpenAI 明日重開 200 美元檔 Cha

OpenAI 明日重開 200 美元檔 ChatGPT-Pro 訂閱:API 支出減半,新增更多不計量功能
本次調整後該檔位 API 等效價值接近翻倍,取消原 5 小時使用限制,僅保留周度管理,還將新增不計量功能,此前因算力激增暫停新用戶註冊#OpenAI ChatGPT#

中國生成式 AI 用戶破 7 億,普及率過半,算力一年漲了 177%
數字相當醒目:截至今年上半年,我國生成式 AI 用戶規模已突破 7 億人,普及率超過 50%,相當於每兩個成年人裡就有一個在用。問答仍是剛需,國產算力邁入十萬卡時代具體怎麼用?報告顯示,智能問答是最主流的入口,76% 的用戶靠它找答案;圖片視頻處理、文本處理、寫總結與會議紀要的佔比分別為 47.