深度對話聯想:自主把事辦完,成AI終端L3級智能“分水嶺”
作者 | 雲鵬 編輯 | 李水青 在一項人工智能終端測試中,題目不是寫詩、總結文章,也不是讓模型回答一道知識題,而是在平板上通過購物軟件,購買一張過去買過的電影票。乍看之下,這個任務平常得不能再平常。用戶甚至不需要知道背後用了什麼模型,只會關心票有沒有買對:影片、影院、場次、座位和支付環節能否被準確銜接,遇到權限確認、頁面變化或網絡波動時,系統是否知道下一步該做什麼。但對AI終端而言,這恰恰是一道比聊天難得多的綜合題。它要求設備先理解一句自然語言背後的真實意圖,再從歷史記錄中定位對象,調用應用和系統服務,跨越多個界面完成操作,並在涉及支付等敏感環節時把控制權交還用戶。
任何一個節點掉鏈子,前面再聰明的回答都沒有意義。近期,《人工智能終端智能化分級》系列國家標準發佈。在首批公佈的66款產品中,聯想拯救者Y900系列是唯一達到人工智能國標最高L3級平板產品。與其把這理解為又一項產品認證,不如把它看成一個行業信號:AI終端的評價尺度,正在從“能不能生成”推進到“能不能交付”。聯想集團高級副總裁、全球創新中心負責人賈朝暉將L3稱為“從工具到智能夥伴的標尺”。這句話的關鍵不在“夥伴”這個擬人化稱呼,而在於角色變化。工具等待用戶一步步操作;智能夥伴則要理解目標、組織步驟、調度資源,並對結果負責。這也意味著,AI硬件競爭正在進入更難的一段。
大模型可以為終端提供一顆更聰明的大腦,但一臺設備能不能穩定把事情辦完,取決於整套任務執行鏈是否成熟。一、L3把AI終端從“生成”能力推向“任務交付” 過去兩年,終端廠商展示AI時,最常見的項目是問答、翻譯、摘要、文生圖。這些能力容易演示,也容易用模型參數、響應速度和榜單分數比較。但它們大多停留在“給出內容”的層面,輸入和輸出之間的路徑相對短。任務執行完全不同。以電影票任務為例,系統至少要完成五個環節:識別用戶意圖,讀取與當前任務相關的上下文,規劃操作步驟,調用系統或第三方應用,確認結果並處理異常。它不只是在概率意義上生成一段“像答案的文字”,而是要改變真實世界中的狀態。
這一區別決定了任務型AI的容錯率更低。生成一段摘要時,措辭略有不同往往不影響使用;訂錯日期、選錯影院或重複提交訂單,卻會直接造成損失。模型的單點能力越強,並不必然意味著整條鏈路越可靠。一個執行任務成功率為95%的步驟,連續經過多個步驟後,整體成功率會不斷折損;如果鏈路中還有應用更新、彈窗、權限和網絡等變量,穩定性會進一步下降。因此,L3的意義不只是給AI能力劃等級,而是把測試對象從“模型回答”擴大到“整機交付”。終端需要證明自己能把理解、規劃、調用、執行、校驗串成閉環。所謂“會辦事”,不是自動點擊得越多越好,而是在該自動化的地方自動化,在需要確認的地方停下來,並且能向用戶說明當前進度和結果。
這也重新定義了終端智能化。把一個大模型應用裝進設備,只能解決“入口在哪裡”;要完成跨應用任務,則必須讓AI深入系統權限、服務接口、硬件資源和設備生態。賈朝暉對此區分得很直接:在設備上裝AI應用是“+AI”,依據AI的特點重新設計系統才是“AI+”。前者增加一個功能,後者改變設備組織能力的方式。L3所測試的,正是後者有沒有真正落地。二、拆解AI任務執行鏈的三層門檻:系統、算力與連續狀態 AI終端要穩定完成任務,至少要跨過三層門檻。它們分別解決“能不能動手”“把任務放在哪裡算”以及“換設備後還能不能接著做”。第一層,是進入系統層。
聊天機器人通常只需讀取用戶輸入並生成回覆;任務型智能體必須獲得受控調用能力。它要知道設備上有哪些服務、哪些應用能夠完成當前步驟,如何傳遞參數,又該怎樣處理授權和返回結果。據聯想介紹,其基於天禧AI底座組合調度端側模型與雲端模型,並基於MCP協議貫通系統服務,用於跨應用自動化和多設備互動。這裡真正困難的不是讓AI“看見”按鈕,而是建立一套可管理、可確認、可回退的調用機制。應用界面會改版,登錄狀態會變化,同一句指令也可能對應不同條件。成熟的任務鏈需要把意圖理解、工具選擇、權限邊界、異常處理和結果校驗都納入系統設計。否則,所謂智能體只是更復雜的自動點擊器。第二層,是組織端、邊、雲算力。
在聯想的體系中,“端-邊-雲”架構於2026年5月19日隨天禧AI 4.0發佈並落地,負責算力與數據的組織方式;9月初迭代至4.3版本後,重點推進的是智能體自主執行與多設備協同能力。底座與執行分屬兩層,任務執行建立在算力組織之上。任務為何不能全部扔給雲端?一方面,個人知識、歷史記錄和敏感數據需要更清晰的隱私邊界;另一方面,頻繁調用雲端模型會帶來時延和Token成本。反過來,若所有任務都壓在端側,受限於功耗、內存和模型規模,也難以覆蓋複雜長尾需求。端邊雲協同的價值,在於按任務動態分配資源:低時延、強隱私、與設備狀態緊密相關的部分儘可能在端側或邊側處理;需要更強泛化能力的部分再調用雲端。
它不是三個算力節點的簡單疊加,而是調度問題。系統要判斷哪些數據可以離開設備、哪種模型適合當前步驟,以及失敗後如何切換路徑。第三層,是維持跨設備的連續狀態。真實任務很少永遠鎖在一塊屏幕裡。用戶可能在平板發起任務,讓PC調用更強算力或本地知識庫處理,再把結果返回平板;也可能在手機上補充信息。聯想將天禧AI 4.3的多設備協同概括為數據庫、上下文與記憶、任務執行與接力三個一體化。這比普通的文件互傳更難。跨設備任務需要攜帶的不只是結果文件,還包括任務處於哪一步、已經調用過什麼、用戶做過哪些確認,以及後續應該由哪臺設備繼續。只有狀態連續,設備矩陣才不是多個AI入口,而是一條可以遷移的執行鏈。
從這個角度看,L3背後測的其實是一套系統工程:模型負責理解和規劃,操作系統提供受控能力,端邊雲提供算力,設備生態保存任務狀態。任何一層缺位,“一句話辦事”都可能停在演示階段。三、為什麼說平板更適合成為AI綜合交互與任務入口?在手機、PC和平板之間,平板未必擁有最強算力,也不是用戶隨身時間最長的設備,但它具備一種特殊的平衡:屏幕足夠大,又比PC輕便;可以觸控、手寫、鍵盤輸入,也適合語音和視覺交互。聯想集團高級副總裁、中國消費業務群總經理張華把AI平板稱為“AI天生的容器”。如果把這句話拆開看,平板的價值不只在承載更多AI功能,而在於它更適合呈現任務全過程。
聊天只需要一個輸入框,任務執行卻需要讓用戶隨時理解系統正在做什麼:目標是否識別正確,哪些資料被調用,當前執行到哪一步,哪個環節需要確認,最終結果是什麼。相比手機的小屏,平板更能同時容納任務上下文、候選結果和操作反饋;相比PC,它又天然支持拿起即用、語音、觸控與手寫等低門檻交互。手寫筆在這裡也不應只被視為配件參數競爭。根據現場介紹,聯想希望把筆從輸入工具變成意圖入口:提筆書寫、轉筆擦除,圈選不同類型內容後觸發相應處理。其價值不在多一個AI按鈕,而在於用戶沿用原本熟悉的動作,系統在背後識別對象和意圖。這符合任務型AI的一條重要原則:最好的智能不應該要求用戶先學習一套複雜指令。
賈朝暉所說的“真正的AI隱形於設備、無所不在”,如果落到產品層面,就是用戶表達目標的方式越來越自然,而系統承擔更多理解和編排工作。不過,平板適合作為入口,不等於所有任務都必須在平板本地完成。恰恰相反,它更像一個綜合交互面板:負責收集語音、觸控、筆跡和視覺信息,展示任務進度,並在需要時調用PC算力、個人知識庫或雲端服務。平板的競爭力由此不再只取決於屏幕和芯片,而取決於它能否把多種輸入和多端能力組織成一條順暢鏈路。值得一提的是,聯想面向課堂的研學方案——根據課程安排推送知識、彙總錄音課件與照片並生成個性化課堂筆記——目前仍處於規劃階段,尚未上市。
它說明的是任務鏈未來可能延伸的方向,也提示外界:把規劃寫成既有能力,同樣是對這類產品的一種誤讀。四、從實驗室通過到日常穩定,中間還差一個反饋閉環 標準測試的價值,是用一致題目驗證能力邊界;但用戶每天遇到的環境遠比實驗室複雜。應用版本更新、頁面佈局變化、網絡中斷、賬號狀態異常,都可能令原本可用的執行鏈失效。因此,通過L3不是終點,而是獲得了一張進入真實世界的入場券。任務型AI上線後,廠商真正要盯的不是“功能是否存在”,而是每個環節為何失敗:是意圖識別偏差,還是工具選擇錯誤;是權限被拒絕,還是第三方應用改版;是端側模型能力不足,還是雲端調用延遲;用戶在哪一步主動接管,又在哪一步直接放棄。
聯想介紹的“月月新”和“超核社區”,對應的正是這一問題。前者以月度節奏推送體驗和優化,後者讓用戶在設備內反饋問題,再由團隊和AI歸納共性需求。對傳統硬件而言,產品上市往往意味著主要功能已經定型;對AI終端而言,上市只是任務成功率開始接受大規模檢驗。這種閉環還有一個容易被忽略的價值:判斷哪些任務值得自動化。並非所有能做的功能都有必要做,也不是執行步驟越長越能體現技術實力。真正高頻、剛需、容錯邊界清晰的任務,才適合優先進入自動執行。用戶反饋不僅幫助修復失敗案例,也幫助廠商避免為了展示AI而製造需求。聯想所強調的“用得上、用得起、用得好”,最終都要落到這裡。
用得上,是用戶可以用自然方式發起真實任務;用得起,是算力調度和商業成本能夠長期支撐;用得好,則是任務在日常環境下保持穩定,並且持續改善。五、AI終端的下一張考卷:任務完成率 當大模型能力逐漸成為公共底座,終端發佈會仍然可以展示模型規模、推理速度和生成效果,但這些指標與用戶價值之間的距離正在拉大。用戶不會因為設備調用了更大的模型,就原諒一張買錯日期的電影票;也不會因為智能體規劃了十個步驟,就接受任務在第九步失敗。對任務型AI而言,最樸素也最嚴格的指標,是完成率。但“任務完成率”不能只是一個孤立數字。
它至少應包含一次成功率、平均完成時長、人工接管次數、異常恢復率、敏感操作確認準確率,以及跨設備接力成功率。更進一步,還應區分演示環境與真實環境、高頻任務與長尾任務、首次使用與長期使用。這套尺度會倒逼終端行業改變競爭方式。模型參數仍然重要,卻只是必要條件;芯片算力仍然重要,卻必須轉化為穩定執行;應用數量也不再等於生態能力,關鍵要看接口是否能被安全調用、任務是否可以閉環。電影票測試之所以值得關注,就在於它把宏大的“智能夥伴”敘事壓縮成一個可驗證的問題:用戶交代一件事,設備到底能不能辦成。聯想平板通過L3,證明其在當前測試範圍內已經把模型、系統、應用調用和設備能力串了起來。
但對聯想以及整個行業來說,更艱難的比賽才剛剛開始:從規定場景走向千人千面的日常,從一次通過走向長期穩定,從能執行走向值得託付。未來,AI終端真正拉開差距的時刻,可能不是它說出一句多驚豔的話,而是用戶回過神來,發現事情已經被準確、透明、安全地辦完了。
Related
相關文章

騰訊混元推出"騰訊 Hy 翻譯"App:支持 33 種語言互譯,覆蓋 5 種民族語言
該產品基於騰訊混元 Hy-MT2 翻譯模型打造,支持 33 種語言互譯,並覆蓋 5 種中國少數民族語言及方言,提供語音翻譯、拍照翻譯與離線翻譯等多種方式。離線可用、覆蓋港澳臺及東南亞據介紹,離線翻譯模式下用戶可提前將翻譯模型下載至手機,在沒有網絡或信號不佳時仍能穩定使用。

谷歌確認新一代旗艦 Gemini 4 即將推出:已進入後訓練,有望遠早於年底
所謂後訓練,是在基礎模型完成後進一步調整、提升行為可靠性的階段。跳過 3.5 Pro,直接押注 Gemini 4卡武克奧盧希望 Gemini 4 在"遠早於年底"的時間點推出,並稱正儘快拿出後訓練階段的早期成果,"因為我們看到了結果,也很振奮",隨後谷歌會繼續快速迭代。

消息稱DeepSeek年化收入突破10億美元,擬募資500億元衝刺上交所上市
該業績躍升主要得益於近期產品定價的上調,以及其系列模型在開發者與企業端持續攀升的採用率。DeepSeek首席執行官梁文峰在近期舉辦的投資者會議上披露了這一核心財務數據。此舉被視為在資本市場關鍵節點提振投資人信心的重要舉措——目前DeepSeek正接近完成第二輪融資,並緊鑼密鼓地籌備在上海證券交易所上市。

谷歌確認新一代旗艦模型 Gemini 4 即將推出,有望不用等到年底
作者:清源 責編:清源 評論: 9 月 24 日消息,The Information 當地時間 23 日舉辦的 AI Agenda Live 峰會上,谷歌 DeepMind 負責人科拉伊 · 卡武克奧盧透露,谷歌新一代旗艦模型 Gemini 4 即將推出,現已進入開發流程中的後訓練初期。

ChatGPT 移動端上新語音智能體:動動嘴就能寫文檔、總結郵件
據瞭解,Pro 和 Plus 訂閱用戶可在手機上使用"工作"創建文檔、撰寫電子郵件或總結 Slack 消息,還能執行創建網站、製作 PPT、使用雲端瀏覽器等進階操作;Free 和 Go 訂閱用戶則可使用插件與已連接的應用。OpenAI 表示,ChatGPT 的語音對話將提供更豐富的文本輸出,Plus 訂閱用戶可在文本與語音之間輕鬆切換,或者先在手機上處理工作、再轉移到電腦上繼續。

騰訊混元把經典臨界批大小理論搬進大模型強化學習,PPO生成吞吐最高拉到2.29倍、GRPO省下29%訓練時間
騰訊混元團隊最新研究把目光投向了一個被忽視已久的老問題:當模型自己生成訓練數據、且rollout生成與訓練本身以不同節奏縮放時,批大小這門手藝該怎麼重做。研究從經典的臨界批大小理論出發,把它重新推演到在線大語言模型強化學習這個新場景。結論很務實:在GRPO和PPO這兩類主流算法裡,只要在擴大批大小的有界範圍內重新調一調學習率,就能保住"每條響應"該學到的東西不被稀釋。