從“會回答”到“會辦事”,vivo如何解AI手機這道題?

來說,AI能力更強,並不意味著用戶「體驗更好」。一條航班延誤通知彈出來,AI當然可以總結內容、回答晚點多久。但真要繼續往下處理,事情立刻複雜起來:轉機要不要改、酒店會不會受影響、明早的會議還能不能趕上,一籮筐任務需要解決。更麻煩的是,它還未必記得你的習慣:你願不願意坐凌晨的航班、在不在意多花幾百塊、第二天那場會到底能不能遲到。想要在手機上vibe個應用程序,還要考慮接口、MCP等各種問題。於是我們會發現如今的AI,好像什麼都會一點,但真遇到事情,最後經常還是得自己動手。
△AI生成 這也解釋了AI手機這兩年越來越明顯的一層落差: 模型能力一路上漲,Benchmark卷得飛起,但手機端體驗卻並沒有隨著模型變強自動升級。一臺手機想真正替用戶把事情接過去,光聽懂一句話遠遠不夠。它還得在用戶授權和隱私保護的前提下,看懂你此刻發生了什麼,記得此前發生過什麼,再調動合適的模型、上下文、App和服務,把後面的事情一環接一環做完。到了這一步,手機面對的已經不只是一道模型能力題,而是一道關於感知、記憶、調度、執行和協同的系統題。
就在剛剛結束的2026 vivo開發者大會(後簡稱VDC)人工智能分會場上,vivo給出的技術路徑,也恰好切中了這一輪個人智能落地的核心命題: 以「大模型+Harness」構建個人化智能底座,重構OS體驗。讓AI個人助理更好地為人所用,讓系統更智能好用,也讓手機真正開始理解用戶本身。一套端雲模型矩陣,構建個體專屬AI助理 今天再聊Agent,有一個詞幾乎已經繞不開:端側。Counterpoint Research預測,今年生成式AI手機出貨佔比將達到45%,去年這一數字還是36%。AI兜兜轉轉幾年,手機又一次站到了風暴眼。
原因很樸素直接,在所有終端裡它離人足夠「近」,也掌握著最完整的個人「上下文」。屏幕里正在看的內容、相冊、位置、應用使用習慣、長期積累的個人信息,都天然圍繞這塊幾英寸的屏幕發生。但技術史上有個很常見的規律:那就是一種技術離真實世界越近,約束往往越多。當AI真正進入個人設備,時延、成本、隱私和能力,也開始被壓進同一道選擇題—— 複雜推理和長鏈路任務需要更強的模型,卻伴隨著更高成本和響應時間;本地小模型足夠快、足夠輕,能力上限又更早出現,更麻煩的是,一項真實任務經常橫跨兩端。過去那種一個模型包打天下的法子,有點行不通了。△AI生成 類似的問題,芯片行業其實早就遇到過一次。
計算任務越來越複雜之後,單靠CPU承擔所有工作,很快撞上功耗、效率和性能的天花板。最後跑出來的答案,是異構計算。CPU負責通用控制,GPU接管並行計算,NPU專門處理AI,ISP則負責圖像,系統根據任務不同,把計算動態分配給最合適的單元。也就是說,不是讓最強的單元幹所有活,而是讓最合適的單元幹最合適的活。到了端側模型這事兒上,vivo也給出了一個很「終端廠商」的解法—— 相較於大多數大模型廠商不斷訓練一個更強更通用的AI而言,vivo更關心的是,如何給每個人在手機上組織出一套屬於自己的AI。既然一個模型無法平衡所有能力,那不如讓多個模型各司其職和自動調度,實現端雲協同。
△AI生成 今年VDC人工智能分會場上亮相的「藍心大模型端雲矩陣」,本質上做的就是這個事情。識別聲音,到理解語義、語氣和意圖,交給端到端語音大模型BlueLM-Realtime;需要長期駐留在設備上的感知和記憶,由端側大模型BlueLM-Nano承擔。信息查詢、日程管理、跨App操作這類高頻場景,則交給能快速執行任務的雲側模型BlueLM-Flash;碰到複雜推理、長程規劃,則交給BlueLM-Pro接手。此外,進入專業領域後,系統還能繼續自動調動外部頂尖模型補位。於是,模型也開始組團,從一個需要用戶主動選擇的產品,退到後臺成為被系統自動調度的基礎能力。
但問題是,一個長期運行在個人設備上的智能體,還會遇到第二道更難的題—— 人,本身就是一種「不斷變化」的上下文。AI真正要理解的,從來不是一條孤立的指令,而是一個人此刻所處的狀態,以及此前一路留下來的軌跡,它需要懂當下也需要懂過去。隨之而來的,還有另一道更棘手的問題:隱私和權限邊界。個人AI想越用越懂你,就得持續感知設備上的信息,並逐漸積累日程、位置、操作習慣、歷史任務等個人上下文。但感知範圍越廣、記憶時間越長,涉及的個人信息也越多,權限管理和隱私保護的壓力自然會同步上升。
因此,個人AI真正難的地方,其實是同時解決兩件看似矛盾的事—— 既讓AI擁有足夠連續的個人上下文,又讓這些感知和記憶始終運行在明確的授權邊界之內。圍繞這個問題痛點,vivo則把目光押在兩個關鍵詞上:「感知」和「記憶」。在用戶授權和隱私保護前提下,把一次次零散的端側交互,慢慢拼成對一個人的長期理解。面向感知,端側模型BlueLM-Nano通過輕量視覺編碼器和UI專用Token,高效理解屏幕、圖像、視頻和文本;面向記憶,則通過SwiftKV、混合稀疏注意力和PLE逐層嵌入,將端側上下文擴展至32K。感知不斷沉澱為記憶,記憶又讓下一次服務更貼合你個體需求,一套越用越懂人的個人智能飛輪,也開始跑起來。
當一個AI能夠看懂你此刻在做什麼,記得你過去做過什麼,又能在不同任務之間自動找到最合適的模型和能力,所謂個體專屬AI助理,才真正開始有了個體二字的含義。從模型能力到系統體驗,Harness補上工程閉環 如果說模型能力解決的是會不會的問題,那麼Agent真正進入系統之後,還要面對另一個更現實的事情: AI能不能把一個任務,從頭到尾自主地做完。以前軟件行業把這些統稱為工程,Agent時代給工程重新起了個更時髦的名字:Harness。但有意思的是同樣叫Harness,大模型廠商和終端廠商真正要解決的問題,並不完全在一個層面。
對於大模型廠商來說,Harness更多圍繞模型展開:怎麼讓一個Agent穩定調用工具、保持更長上下文、跑更久的任務,以及在Sandbox裡安全執行。到了手機這裡,問題會再往系統深處走一層,難度也上了一個臺階: 手機面對的重點,是怎麼讓AI執行過去由用戶自己完成的那套手機操作流程。過去十幾年,智能手機建立起來的是一套以App為中心的「服務秩序」。打車要先找到打車軟件,訂酒店要打開旅行App,換句話說過去的手機系統,核心任務是讓成千上萬個App穩定地共享算力、存儲、網絡和硬件能力。
但Agent進入終端之後,雖然App依然承載具體服務,但用戶與這些服務打交道的方式也開始發生「變化」: Agent執行過程天然會穿透應用邊界,連續調用不同服務、繼承上下文,原本被App邊界隔開的能力,開始需要在一次任務裡被動態組合。當越來越多Agent都要處理意圖理解、服務調用和跨設備協同,這些能力就不該再被每個應用和開發者重複造輪子。△AI生成 也正是在這套終端範式開始鬆動的過程中,vivo把其中一層關鍵能力,提前收進了手機系統,做出了一套「Agent原生的藍心繫統級Harness開發者平臺」。把App時代的能力孤島,改造成Agent時代的公共基礎設施。
具體來說,感知和記憶層負責理解用戶與環境,前者通過多模態信息獲取當下狀態,後者沉澱場景、偏好和歷史交互,讓不同Agent能夠共享長期上下文。規劃層負責路由、任務編排和反思優化,並持續調整執行路徑、Token和成本;執行層則藉助6000+系統級工具,以及MCP、A2A、CLI和統一API,把模型、Agent、Skill和外部服務真正接進手機、IoT乃至現實世界。由此,理解、規劃、調用、執行也就形成了一個閉環,當底層的苦活被系統吃掉之後,開發者才終於能把時間花在真正值錢的地方。此外,Harness還得解決一個Agent行業非常現實的問題:經驗怎麼留下來。人幹同一件事十次,多少會學聰明一點。
Agent今天繞八個彎完成任務,明天如果還原樣繞八個彎,那它充其量是個擁有無限耐心的實習生。而在vivo的這套系統級Harness中,這種「自進化」的能力也被進一步做成了一套具體運行機制。基於觀察—反思—沉澱框架,系統可以在用戶授權下持續學習行為與反饋,並利用設備閒時覆盤任務路徑,把新的經驗重新沉澱進系統能力。與此同時,統一意圖、跨設備Runtime和上下文隨行,讓任務可以在手機、PC和平板之間繼續跑;MCP和A2A再負責讓Agent、模型和工具接力。這也意味著,個人AI長期積累的,開始從靜態的用戶信息,進一步延伸到動態的執行經驗。
當系統層足夠成熟,對於開發者而言,剩下只需要考慮一件事:just do it。AI行業過去幾年花了大量時間研究怎麼降低Token成本。到了Agent時代,另一項成本可能會越來越貴——協調成本。放在當前這個時間節點看,協調成本也正在迅速變成一項顯性的系統成本。能力越多,調度、上下文、權限和執行鏈路就越複雜;模型能力越強,系統工程的重要性也隨之上升。最後真正決定體驗的,依舊是那條越來越清楚的分工:模型決定能力上限,系統決定這些能力最終能夠兌現多少。讓服務接得「進」,讓生態長得「開」 讓個性化服務接進來,讓真實意圖跑出去 互聯網過去二十年的商業史,某種程度上就是一部「搶入口」的歷史。
門戶時代搶首頁,搜索時代搶關鍵詞,移動互聯網搶桌面圖標和App時長,超級App再把越來越多服務收進自己的圍牆裡。但Agent開始出現之後,這套規則有些不適用了。當用戶只需要對AI說一句「幫我訂一家川菜餐廳」,他已經不太關心背後打開了哪個App、調用了哪個服務。App時代爭的是入口,Agent時代開始爭的是誰能更靠近「用戶意圖」。這也是為什麼今年從Cursor、Codex到GitHub Copilot,Skills、MCP等機制越來越往意圖核心靠。△AI生成 但在一眾全球主流AI公司中,作為一家終端廠商,vivo在生態層給自己的定位,顯得有些剋制。
他們並不試圖成為一個包辦所有服務的全能選手,而是把自己放在了意圖和服務之間,做一個「搭橋人」—— 一頭,連接具體的Agent服務;另一頭,連接真實的用戶需求。藍心小V升級到Pro模式之後,vivo試圖做的,就是把這中間那層連接成本儘可能壓低:開發者接入一次,能力就能被系統在不同入口中統一理解、調度和觸達。與此同時,Agent、Skills、MCP、原子技能乃至端側模型,也被逐步納入同一套能力底座。意圖服務的競爭單位,也開始從一個完整App,逐漸下沉到一項項可以被智能調度的能力。這也意味著,移動互聯網過去十幾年建立起來的「App即服務邊界」,開始鬆動了。
生態合作共建,開始長出真實立體的註腳 2008年,蘋果上線App Store時,真正把iPhone變成智能手機平臺的,其實是一批批第三方開發者。從遊戲到社交、打車、支付,這個應用商店的可用性很大程度上取決於外部服務能在這套系統里長出多少新的能力。平臺比的是連接效率,生態共建比的是協同深度。真正能把生態做厚的,最終還是第三方夥伴有沒有在裡面跑出新的產品形態和真實結果。而在這個事情上,一家頭部終端廠商也長出了不少具體註腳—— 在民生服務場景,vivo聯合支付寶重構終端服務形態,將能力拆為服務直達、服務執行和MCP Skill,讓更多生活服務一句話辦完。
在本地生活領域,美團將吃喝玩樂等能力接入小V,通過Agent,串起原本分散的服務入口。在出行場景,深度聯動高德地圖,小V一句話即可完成導航、路線規劃、生活服務與POI查詢。在電商消費端,京東進一步打通跨App圈選、多模態識別、商品搜索到支付的完整鏈路。在剛剛結束的VDC圓桌討論上,圍繞第三方生態,來自京東和支付寶的合作伙伴圍繞各自與vivo的合作實踐,分享了Agent服務在終端落地過程中遇到的真實問題,以及生態協同帶來的新解法。而這些,也正是終端生態從「把服務接進來」,繼續走向「讓服務真正跑起來」必須補上的一環。當然,技術賦能到底有沒有價值,還要看它是否照顧到那些容易被忽略的需求。
事實上從2021年發起「聲聲有息」公益計劃至今,vivo也已經開放27項無障礙功能,覆蓋超過110萬殘障用戶。其多模態手語大模型也基於8000多個國標詞彙、100萬段視頻訓練,從單個手勢識別走向連續手語理解,並已用於實時翻譯和手語學習。當AI開始聽懂那些過去常被系統遺漏的表達,所謂個人化智能,也就有了更有溫度的意義。△AI生成 今天,當整個行業再聊端側、手機、模型和Harness,會發現幾者之間的界限其實正在變得越來越模糊—— 模型開始進入系統,系統開始接管執行,端側負責理解和記憶,雲端補足更復雜的能力。
但站在用戶這一邊,所有技術名詞最後其實都會收斂成一個很簡單的體驗: 能不能真正懂我,能不能幫我辦事。真實生活從來都不是一道孤立的Prompt,它是一連串習慣、偏好、臨時變化和前後關聯的小事。用戶不需要知道背後跑的是端側模型還是雲端模型,也不需要理解Harness、MCP和A2A分別做了什麼。他只會慢慢發現,很多事情不用再從頭解釋,很多操作也不用再自己一層層點下去。這或許就是「個人化智能」更實際的一層含義:AI開始從理解一條指令,走向理解一個具體的人。vivo這次給出的大模型+Harness路徑,最終要縮短的正是這段距離:讓模型能力穿過系統工程,真正落到每一次具體的日常需求裡。
手機,由此也不再只是一個裝著AI的設備,而開始有點像一臺屬於「我」的專屬助理。版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向
無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。
Jina AI Releases jina-ocr-v1: A 3.4B MoE Document Parser With Built-In Speculative Decoding for Low-Budget GPUs
Jina AI, part of Elastic, has released jina-ocr-v1, an end-to-end visual document parser. It takes PDFs, scans, tables, charts or invoices and returns clean Markdown in 1 pass. The model has 3.

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作
作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

智譜 ZCode 被質疑“偷傳代碼”:官方回應稱問題已修復,將開源代碼庫、引入第三方審查
作者:清源 責編:清源 評論: 感謝網友 咩咩洋 的線索投遞!9 月 18 日消息,針對社區中有關代碼庫數據上傳的討論,智譜旗下編程產品 ZCode 今天(18 日)通過智譜官方群組向受影響用戶致歉,併發布回應稱已第一時間完成自查,相關問題目前已經修復。

月之暗面遞表之後,Kimi 的成色要被驗算三遍
舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"
這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。