AI手機真正要消滅的,是“操作手機”這件事

防冷塗的蠟2026.09.29 13:14 · 來自浙江全文5663字00:00 / 16:00一個已經能聽懂“我要什麼”的機器,為什麼還要學習“下一步點哪裡”?文 | 防冷塗的蠟現在的AI手機,正在變得越來越會“辦事”。對著手機說一句“幫我點一杯熱拿鐵”,然後看它自己打開外賣App、找到常去的咖啡店、完成選購,最後等你確認付款。榮耀曾用這個場景展示YOYO智能體。到了2026年的MagicOS 11,YOYO已經可以連續處理超過100步的長程任務。過去需要人親手完成的一串動作,正在被AI接走。這當然很先進。
但把畫面換個角度看,又有點奇怪:我們已經造出了能夠理解自然語言和複雜意圖的大模型,然後又讓它努力學習怎樣尋找菜單、識別圖標、按下按鈕,在一套原本為人的眼睛和手指設計的界面裡行動。一個已經能聽懂“我要什麼”的機器,為什麼還要學習“下一步點哪裡”?麥克盧漢曾用“後視鏡”形容人理解新媒介時的一種慣性:我們面對新事物,最容易借過去熟悉的形式來想象它。今天的AI手機也有這種味道。手機還在,App還在,按鈕還在,只是多了一個越來越聰明的AI替我們完成操作。如果AI已經能理解“我想做什麼”,未來的人為什麼還需要繼續告訴機器“下一步點哪裡”?
未來最初,總是長得像過去1993年,蘋果推出Newton MessagePad。它可以記錄聯繫人、筆記和日程,最受關注的功能之一,是通過手寫筆輸入文字。這個設計非常自然:人已經習慣在紙上寫字,新設備只要把紙變成屏幕、把墨跡變成數據,就能迅速獲得一套人人熟悉的使用方式。Newton把紙筆經驗搬到了屏幕上。到了2007年的iPhone,交互開始更多圍繞屏幕自身的能力來組織。蘋果在發佈時強調大型Multi-Touch界面,用戶可以直接用手指輕觸、滑動、雙指縮放,列表和照片都隨著手勢發生變化。移動設備逐漸從“怎樣把過去的工具裝進去”,走到了“怎樣形成自己的使用方式”。
一種新技術真正成熟的標誌,往往是它開始形成屬於自己的交互語言。今天AI已經進入手機,但桌面、App、菜單和按鈕,仍然大體按照智能手機時代的方式組織。用舊界面承接新能力有現實上的便利:服務已經在那裡,用戶也已經在那裡,AI可以先接管一套現成的流程。於是,大量AI手機首先解決的是怎樣讓AI更好地使用智能手機。真正的範式變化,會從另一個問題開始:為什麼AI還需要像人一樣使用手機?要回答它,得先看清這些越來越自然的操作,究竟讓人承擔了什麼。計算機越來越好用,人卻一直負責學習機器早期命令行計算機很難用,用戶必須學習機器的語言。想移動一個文件,需要知道命令怎樣寫、路徑怎樣表達。
圖形界面把這種關係往人的方向拉近了一步:文件變成圖標,位置變成文件夾,原本需要記住的語法,被改造成屏幕上看得見的對象和動作。1980年代,人機交互學者Ben Shneiderman提出“Direct Manipulation”,也就是直接操縱。他強調讓對象持續可見,用直接動作替代複雜語法,並讓操作結果迅速呈現、可以撤回。鼠標之後是手指,觸摸屏又把指針拿掉,點擊、拖拽、縮放幾乎不需要額外解釋。機器越來越順手,但用戶仍然要知道,為了辦成一件事,應該先做什麼、再做什麼。假設你下週三去上海出差,需求其實很簡單:酒店離公司近、安靜,一晚800元以內。
打開訂房App後,你需要輸入城市和日期,查找公司地址,設定價格區間,再看地圖、評分、評論和房型,最後核對取消條件並完成支付。其中一些要求甚至無法直接對應篩選項。“離公司近”究竟是直線距離近,還是早高峰通勤方便?“安靜”要從臨街位置、房型和住客評價中判斷。你得把一句完整需求,翻譯成不同頁面能接受的條件,再把分散的信息拼回一個決定。從用戶這一側看,App本質上是一套把人的目的拆解成機器動作的交互語法。每個輸入框規定你能說什麼,每個按鈕規定接下來能做什麼。熟練使用手機,就是學會在這些預設步驟之間找到通往結果的路線。過去幾十年的人機交互革命,一直在降低這套語法的學習成本。
機器越來越容易操作,人卻始終負責把目的拆成動作。即便訂一家酒店只花幾分鐘,這幾分鐘裡,用戶仍然是整個任務的組織者。Agent把交互單位從動作提升到意圖同樣的酒店需求,交給能夠規劃任務、調用工具並執行的Agent,分工會發生變化。用戶提供日期、位置、預算和偏好,AI負責把“離公司近”轉成位置與通勤條件,把“安靜”轉成需要查找的信息,再尋找能夠滿足要求的服務。傳統流程是:人產生目的,自己拆解任務,尋找軟件,逐步操作,機器執行每一步。Agent想做的,是把中間那段工作接過去:人給出目的,AI理解並拆解任務,再尋找和調用能力,最後交付結果。人與計算機交流的基本單位,正在從“動作”提升到“意圖”。
對著手機說“打開訂房軟件,再點價格篩選”,仍然是人在安排步驟。只有當你可以交代“下週三去上海,住公司附近,安靜一點,800元以內”,讓系統自己決定完成路徑時,任務的組織工作才真正轉移出去。輸入方式可以是語音,也可以是文字,關鍵在於人交代的是結果還是步驟。這種分工並非今天才有人設想。1960年,J.C.R.Licklider在《Man-Computer Symbiosis》中提出,人負責設定目標、提出假設、確定標準和評價結果,計算機承擔其中可以常規化的工作。他還注意到一個很細的區別:給計算機的指令通常要規定具體路線,給人的指令則更傾向於說明目標。
設想你對個人Agent說:“明早7點50送我去機場。”如果這是出發時間,它需要找到行程裡的機場和航站樓,結合路況核對時間,預約車輛,再把安排寫進日曆。如果時間不夠,它應該問你能否提前出發;如果價格明顯超出平時範圍,它應該把取捨交回來。理解意圖最終要落到一個很具體的能力上:哪些細節可以自行處理,哪些變化必須重新交給用戶判斷。地圖、航班、打車和日曆之間的銜接,則不再需要用戶親自複製地址、切換頁面。今天的一條技術路徑,是讓AI先學會操作已有界面。它看屏幕、認按鈕、輸入內容,再觀察操作後的變化。這類GUI Agent能快速進入大量尚未為AI開放的服務,因為所有入口已經存在於頁面裡。
問題是,它仍然要經過為人安排的步驟。按鈕換了位置,頁面多出彈窗,流程增加一個分支,都可能要求它重新判斷。如果服務本身已經知道怎樣查詢庫存、創建訂單、返回結果,機器之間完全可以直接交換這些信息,無須每次都把它們畫成頁面,再交給另一臺機器識別。蘋果的App Intents和App Schemas提供了另一種方向:開發者把應用裡的內容、可以執行的動作和所需條件,按系統能理解的方式描述出來,Siri再據此查找內容、調用動作。界面上的“發送”按鈕可以繼續留給人,AI卻不必為了發送一條信息,先在屏幕上找到這個按鈕。依靠識屏點擊完成的跨App操作,是AI兼容舊互聯網的橋樑,不是Agent時代的終局。
服務開放得越充分,AI越沒有必要重新走一遍人的點擊流程。未來最好的AI手機,很可能恰恰是最少讓用戶看到“AI正在操作手機”的手機。它應該讓人看見結果,以及真正需要自己判斷的取捨。衡量它的標準,也會從“能連續操作多少步”,轉向“完成一件事還需要佔用用戶多少注意力”。App不會消失,但會從前臺退到後臺一旦用戶不必親自經過那些頁面,移動互聯網過去十幾年形成的商業價值也會重新分配。今天一個人要訂酒店,通常先想到“打開哪個App”。平臺一邊組織酒店庫存、支付、評價和售後,一邊擁有用戶必須經過的搜索框、推薦位、商品貨架和排序。這些前臺位置之所以值錢,是因為訂單和用戶注意力長期被打包在一起。
一個人為了訂酒店進入App,平臺拿到的不只是一筆交易,還得到一段瀏覽時間,可以賣廣告、推會員、做交叉銷售,把原本只想解決住宿需求的人繼續引向其他商品和服務。如果路徑逐漸變成“人—Agent—服務”,酒店、司機、商品、支付和售後仍然需要有人提供,變化發生在交易之前:用戶先把需求交給自己的Agent,未必需要進入某個App,再沿著平臺安排的路線瀏覽。大量任務型App不會消失,但會從用戶的前臺入口,逐漸退成AI調用的服務基礎設施。同樣一筆酒店訂單依然能產生交易佣金,卻未必再附帶首頁廣告曝光、關聯商品推薦和幾分鐘的用戶停留。過去,App把訂單和注意力打包在一起;Agent可能第一次把兩者拆開。
這會把“提供服務”和“掌握入口”變成兩種更獨立的能力。擁有獨家供給、合理價格和可靠履約的平臺,依然有被調用的價值;依賴頁面位置和用戶停留獲得的優勢,則要接受另一套篩選。對平臺來說,開放能力可以帶來新訂單,也意味著讓出一部分“用戶先看什麼、再買什麼”的安排權。個人Agent承擔的角色因此超出了一個新App。傳統操作系統管理設備資源,保證程序正常運行;個人Agent圍繞用戶的任務,判斷此刻應該組織哪些能力、按什麼順序參與。從用戶的感知看,它越來越像一層新的操作系統:人不必先判斷這件事歸哪個軟件管,可以先說自己想完成什麼。傳統OS管理“設備能做什麼”,個人Agent開始管理“這個人想做什麼”。
沿著這條路徑走下去,下一代互聯網最重要的入口,很可能不再是用戶主動打開的App,而是最先接收到用戶意圖、再替他組織服務的個人Agent。但這個推演有一個前提:用戶已經知道自己想要什麼。有些選擇只是成本,有些選擇創造目的交電費、翻譯一句話,或者補買已經確定型號的耗材,目的通常在打開手機之前就已經形成。用戶需要的是正確完成任務,反覆瀏覽頁面、確認相同信息,並不會讓結果更有價值。這樣的過程越短越好。即使購買一件已經確定的商品,人也不會無限搜索。多看一家店也許還能便宜一點,但還要花時間比較價格、配送和售後。
赫伯特·西蒙的有限理性研究指出,人很少窮盡所有方案,而是在有限時間和認知能力下尋找一個足夠滿意的選擇;George Stigler則把尋找信息本身也視為一種成本。Agent適合接走的,正是這一部分工作。目標已經確定以後,搜索、比較和操作越多,越接近為了到達結果不得不付出的成本。用戶只想把電費交上,並不需要認真體驗一次繳費流程。但一個人走進書店,未必已經知道自己要買哪本書。他原本想找一本經濟學讀物,卻在旁邊翻到一本討論城市生活的社會學著作,讀了幾頁,突然對一個從未想過的問題產生興趣。最後帶走的書,甚至不屬於原來的計劃。這裡發生的事情和繳費完全不同。
選擇沒有在執行一個已經形成的目標,選擇本身正在改變目標。John Dewey在《Human Nature and Conduct》中討論過類似過程:人的目的並不總是在行動之前完整存在,很多目標會在行動、經驗和想象中形成,再反過來改變接下來的行動。“下一本讀什麼書”“週末去哪”“想要怎樣的旅行”,都包含這種尚未完成的形成過程。提前給出一個最匹配過去偏好的答案,可以減少比較,卻也可能減少接觸陌生事物、發現新興趣的機會。更麻煩的是,連“什麼才算合適”這套評價標準,都可能在過程中發生變化。AI最容易消滅的是達成既定目的所需要的選擇;它最難替代的,是幫助人形成目的的選擇。
同一個訂房服務,既可以完成一場安排明確的出差,也可以參與一次尚未成形的旅行。前者希望儘快結束搜索,後者有時正是從搜索裡開始。辦事會越來越沒有界面,生活仍然需要界面。這裡的界面可以是一張允許隨意探索的地圖,也可以是一份夾雜陌生曲目的歌單。它的價值不是讓人更快離開,而是讓人接觸自己尚未想到的東西,讓新的目的有機會出現。AI越瞭解過去的你,篩掉陌生選項的能力也越強。它知道你喜歡哪種餐廳、哪一類文章、哪個品牌、怎樣安排旅行,於是每一次推薦都會越來越像“你”。短期看,這當然提高了命中率;長期看,一個永遠追求“越來越懂你”的AI,也可能越來越擅長把你困在過去的自己裡。
人的偏好會變化,而很多變化恰恰來自那些事先沒有表現出偏好的東西。機器如果只把過去的你預測得越來越準確,也可能同時減少你遇見另一個自己的機會。真正成熟的AI,要知道什麼時候停手計算器接到算式,地圖接到終點,傳統工具通常在任務已經確定之後才開始工作。個人Agent會更早地進入需求形成過程,它不得不面對一個過去的軟件很少需要判斷的問題:眼前這段選擇,是用戶希望擺脫的麻煩,還是值得親自經歷的事情?面對明確任務,它應該儘量把過程拿掉;面對尚未形成的目的,它應該先讓不同的可能性被看見,而不是急著把世界壓縮成一個所謂最優答案。
未來真正高級的個人AI,稀缺的能力未必是替人做最多決定,而是知道哪些選擇只是在浪費人的時間,哪些選擇本身就是人的生活。今天AI還在努力學習怎樣點我們的按鈕。幾年以後回頭看,這或許只是新交互出現前必須經過的一段兼容期。過去幾十年,人一直在學習怎樣更輕鬆地使用機器;接下來,輪到機器學習怎樣理解人的目的。更難的一課,是它還要知道什麼時候繼續替人行動,什麼時候把選擇重新交還給人。
Related
相關文章

字節豆包要出獨立個人助理App了,內部已秘密內測數月
據知情人士透露,豆包從今年4月起就已開始秘密內測一款名為“Spell”的個人助理應用,近期隨著海外同類產品熱度攀升,字節內部明顯加快了這一項目的推進節奏。據瞭解,字節計劃將原有的“Spell”項目團隊與豆包對話團隊進行合併,集中力量打造一款獨立的個人助理App。

我國生成式人工智能用戶規模突破 7 億人,普及率超 50%
作者:遠洋 責編:遠洋 評論: 感謝網友 HHKK、很宅很怕生、小星14 的線索投遞!9 月 29 日消息,據央視新聞報道,9 月 29 日,在 2026(第七屆)中國互聯網基礎資源大會上,中國互聯網絡信息中心政策與國際合作所發佈《生成式人工智能應用發展報告(2026)》。

IDC:今年上半年全球人形機器人出貨近 2.5 萬臺同比增長 432.1%,中國獨佔 1.9 萬臺
作者:小泵 責編:小泵 評論: 9 月 29 日消息,國際數據公司(IDC)最新發布的全球人形機器人跟蹤報告顯示,2026 上半年,全球人形機器人出貨量接近 2.5 萬臺,同比增長 432.1%,產業發展進一步從技術驗證向商業化應用探索階段邁進。

微軟報告:全球打工人裡每五人就有一個用 AI,南北差距還在拉大
數據顯示,到今年第二季度,全世界勞動年齡人口中已有 18.8% 用上了人工智能,比上一季度多出約 1 個百分點,且幾乎每個經濟體的使用率都在往上走。阿聯酋、新加坡領跑,日韓追趕最快把鏡頭拉到地區層面,最捨得用 AI 的還是阿聯酋(70.1%)和新加坡(64.

微軟納德拉:AI 行業“有點飄了”,呼籲迴歸用戶需求
作者:故淵 責編:故淵 評論: 9 月 29 日消息,亞歷克斯 · 希思(Alex Heath)於 9 月 27 日在 LinkedIn 平臺發佈視頻,分享了一段採訪微軟首席執行官薩蒂亞 · 納德拉(Satya Nadella)的視頻,聚焦當前行業 AI 發展現狀以及未來趨勢等。

Fireworks AI 推出 FireRouter with Opus:編碼任務成本降 57%,準確率僅損失 1.5 個百分點
經過一個多月的內部 A/B 測試,該方案執行編碼任務的準確率達到單獨使用 Opus 的98.1%,而成本降低了57%。FireRouter 的核心邏輯是在每次用戶輪次中,評估模型集合中每個模型對當前任務的適合程度,估算每個模型的處理成本(包括提示緩存成本),並權衡切換模型帶來的節省與丟失緩存是否值得,最終路由到質量與成本之間取得最佳平衡的模型。