爆火了的Muse和Instinct們不能做的,OS3能?

字母AI2026.09.28 15:37 · 來自北京全文4120字00:00 / 11:42Personal Agent的下一程,Rabbit OS3已經開跑。文 | 字母AI小扎拿出Muse Charm之後,Rabbit r1又被翻了出來。不少人看到這款新設備時,都會幻視兩年多前的橙色小方盒。在X上,有人將小扎拿著Charm、呂騁拿著r1的照片放在一起玩梗,不少外媒在報道Charm時,也都提到了這款初代AI硬件。一臺可以隨身攜帶的小設備,通過語音聽懂用戶的要求,再讓AI替人辦事。這幅畫面,確實讓人覺得熟悉。讓人感到熟悉的不只是硬件。
2024年,Rabbit在r1發佈會上,用打車、訂票、點外賣等場景,向大眾解釋Personal Agent(個人智能體)到底能辦什麼事。此後,這幾樣任務反覆出現在一代代Agent產品的演示裡,逐漸湊成了一套觀眾熟悉的“標準套餐”。評測網站Assistant Benchmark也把訂機票、訂餐廳、購物等列進了Personal Agent的測試維度。這套題目受歡迎的原因不難理解:外賣有沒有送達,票有沒有訂上,買東西有沒有省錢,交付結果明確。比起解釋模型又提升了多少分,這些場景更容易讓人看懂,AI究竟能替自己做什麼。但最容易演示、傳播的任務,難道就是Personal Agent最有價值的用武之地嗎?
大公司想讓AI下單,也難Muse爆火以後,很快遇到了平臺的阻力。當地時間9月20日,亞馬遜表示已阻止Muse代表用戶在其網站購物。亞馬遜稱,Meta未事先告知Muse會訪問其網站,Muse瀏覽時也未標明代理身份,並對其處理用戶憑據的方式提出隱私和安全擔憂。從技術角度來看,採用雲虛擬機的Personal Agent方案,已經有過很多被禁止訪問的案例。呂騁在接受科技媒體WIRED的採訪時也提到:“這些,我們一年半以前就經歷過了。”AI能否穩定完成操作、替人下單,和是否獲准操作,是兩個問題。有時即使Agent知道該怎麼操作,平臺也未必放行,商業准入及背後的利益分配同樣可能卡住訂單。
平臺擔心的,除了賬戶安全和交易責任,還有自己的生意。過去,用戶在平臺上搜索、比較、看推薦,平臺從中賺取廣告費和交易佣金。如果這些過程都交給AI,用戶可能只記得自己的Personal Agent,不再關心訂單來自哪家平臺。平臺可能失去影響用戶選擇的機會,廣告和佣金的議價能力也會受到挑戰。Muse受到關注後,Airbnb、Booking、Expedia等旅遊公司股價承壓,就反映了市場對這種變化的擔憂:未來的交易入口,究竟掌握在平臺手裡,還是Personal Agent手裡?Muse的解決方式,是藉助大公司的資源和影響力,構建起一套Agent友好的商業生態。
在被亞馬遜拒絕後,Muse與美國買菜平臺Instacart宣佈合作。旅行技術公司Duffel也宣佈,美國Muse用戶已可查詢實時機票庫存和價格,處理預訂、取消及後續行程。在用戶端,Muse提供免費使用額度,吸引更多用戶使用,先讓用戶體驗Personal Agent的成果,再逐漸培養習慣。讓更多平臺接受Agent,需要處理商業准入、利益分配和交易責任,也需要持續投入。Meta這樣的大公司,有資源吸引用戶,也有能力影響生態。Muse火起來的意義也在這裡:推動更多服務接入,讓Personal Agent有更多可用的場景。如果這些合作能帶來更廣泛的開放,也會為其他團隊創造機會。
但資源有限的創業團隊,很難照搬大公司的投入方式。它們更需要靠技術和產品創新,爭取生存和發展的空間。創業公司的方案呂騁曾在採訪中提到,只有15人團隊的Rabbit,會通過Action Model的多次迭代來完善Personal Agent的能力。2024年1月,隨著r1的發佈,Rabbit的第一代LAM上線,當時只能通過r1使用;10月,Rabbit單獨推出了LAM playground,可以在網頁端使用,Agent能根據用戶要求瀏覽網頁、查找信息和執行操作。按照當時的技術說明,它會結合頁面截圖和網頁結構,判斷可以點擊的位置,並隨著頁面變化調整下一步行動。
遇到陌生網站,Agent會自己找到入口,把目標拆成操作步驟實現——這也是目前大部分Personal Agent仍採用的技術路線。2025年2月,Rabbit發佈了Android Agent研究預覽,將AI的操作範圍擴展到安卓應用和設備的系統功能。幾個月後,有AI手機沿用了這套技術路線,結果被各大App禁止訪問了。直到今年初,Rabbit把LAM升級為DLAM,讓Agent接入用戶自己的Windows和Mac電腦,在獲得授權後操作瀏覽器和桌面軟件。這套方案的效果是,通過真實設備執行任務,能夠有效減少雲端代理訪問時遇到的限制。
執行環境也由雲端虛擬機延伸到用戶自己的電腦,原來安裝的軟件、保存的文件和進行中的項目,都可以由Agent直接使用和處理。從這些發佈時間看,Rabbit在Personal Agent的探索一直在行業領先。到了OS3,Rabbit又開始整合這些能力,探索下一代Personal Agent還需要解決什麼問題。OS3的新探索就在Muse Charm亮相的前一天,Rabbit發佈了OS3。用戶不必先買一臺r1。打開網頁,連接自己選擇的模型和電腦,就可以讓OS3使用現有的文件、軟件和工具處理任務。一個賬戶最多連接五臺設備,用戶也可以通過iMessage、Telegram或r1進行交互。
這次發佈演示的一項重點,是讓用戶一次交代多項任務,看Agent能否接得住。呂騁一口氣提出了幾個要求:找一本哲學書,製作閱讀指南,通過Slack發給自己;研究利物浦足球俱樂部,生成交互網頁;再做一份Agent競品分析,順便給OS3寫一本使用手冊。說完,他讓OS3拆分任務、開始執行,自己在同一個對話裡接著提問。一個直觀的交互變化,是OS3的網頁主界面採用持續對話。用戶可以在同一個對話裡交代多件事,多個任務能在同時後臺執行,互不干擾,用戶自己還能繼續提問,或者補充、修改前面的要求。
用戶少做的安排,成了系統需要解決的問題:哪句話是新任務,哪句話在修改舊要求,“剛才那份文件”指的是哪一個,需要調取哪些已有信息。持續對話的意義,在於把一部分任務組織和上下文管理交給系統。Rabbit押注的是:個人助理應該能接住隨時出現、不斷變化的交代,讓用戶少花時間整理提示詞和管理會話。這個方向也有其它產品正在探索。Claude Code近期開始測試的新版Projects,同樣讓用戶在一個主對話中提出需求,由AI拆分並協調後臺任務。OS3還把這種安排延伸到了用戶連接的設備上。聽懂要求、拆好任務之後,它還得判斷:需要哪些文件和工具,應該去哪臺設備幹活。
這涉及到Rabbit的第二個技術下注:接入用戶已有的工作環境,並智能協調多臺設備。雲端虛擬機有一個很直接的好處,那就是讓用戶可以關上電腦,任務留在雲端繼續執行。但除了平臺訪問的限制,還有另一項體驗成本:用戶需要把自己的工作搬進這個新環境。為了讓Agent開始幹活,用戶需要在虛擬機重新登錄賬戶、上傳材料、配置工具。但在用戶自己的電腦裡,這些東西早已存在:做到一半的項目、安裝好的軟件、幾輪修改過的文件,以及長期積累的資料。接入用戶已有的設備,可以讓Agent用上現成的文件和軟件,減少重新準備工作環境的成本。
不過,接入用戶的電腦,也意味著任務會受到設備狀態的限制:電腦休眠或斷網,在這臺電腦上執行的任務就會停止。OS3採取的解決方案是,它支持連接最多五臺設備,包括本地電腦、辦公室機器,以及用戶自己的雲虛擬機。如果任務需要某臺電腦上的軟件,就在那裡操作;需要長時間運行的任務,則可以安排在持續在線的設備上。用戶可以指定執行位置,也可以由系統根據任務智能選擇某臺設備,或在多臺開機的設備間接力完成任務。例如,OS3可以自動找到在A電腦上的視頻,然後使用有專業編輯軟件的B電腦完成剪輯,再到登錄賬號的C電腦完成上傳。能在多臺設備間分配任務、接力執行的能力,目前似乎還沒有其他Agent實現。
在實際使用時,我們嘗試讓OS3完成一項資料收集任務:調研Muse Charm並整理成報告,完成後發消息到手機。約15分鐘後,手機就收到了OS3通過iMessage發來的完成通知,消息中列出了調研內容和報告在iCloud中的保存位置。Muse由Meta自家的Muse Spark驅動,OS3則支持接入不同的模型服務,也可以使用本地模型。模型更新很快,用戶可能因為能力、速度或價格,決定換一家服務。國內的幾家模型也都支持接入,我們在測試時使用了阿里的Qwen,表現非常好。按照Rabbit的設計,更換模型後,此前積累的記憶、配置的技能和連接的設備可以保留。
OS3本身免費,使用雲端模型需自備受支持服務的API密鑰,並按用量付費。Rabbit希望OS3能承接這部分積累,底層模型可以更新,用戶與Personal Agent之間已經建立的工作關係繼續保留。一個Personal Agent逐漸知道你在做什麼項目、習慣怎樣處理文件、哪些事情此前已經討論過,這些積累不應該隨著模型更換而作廢。我們在Rabbit 的Community裡瞭解到,Rabbit OS3上線三天內,新用戶累計已成功完成超過1萬個任務,用戶使用自己的API key每天消耗總量近10億token,人均水平遠高於大部分Agent類產品。
一個長期使用的Personal Agent,還需要能核實任務結果,並把用戶的反饋用到下一次工作中,讓上次被糾正過的錯誤,下次能夠避免。只有當用戶越來越少地重複交代、檢查和返工,Agent才真正替人省下了時間。模型進步能提升理解和執行能力,平臺合作能帶來更多可用的服務,而如何用好這些能力,仍需要產品不斷探索。下一代Personal Agent,既需要生態為它打開更多可能,也需要一個個具體的創新,讓它真正好用。
Related
相關文章

OpenAI突發急剎車,AI竟在全網植入自我複製代碼,血洗聯合國內網
OpenAI突發急剎車,AI竟在全網植入自我複製代碼,血洗聯合國內網新智元·2026年09月28日 16:56狂掃1.6萬次,血洗聯合國內網 「天網」中的一幕,正在現實上演。 一次訓練中,OpenAI逃逸的AI Agent,已在整個互聯網上植入了「自我複製的代碼」! 當政客Andrew Yang在CNBC說出這句話時,很多人以為他瘋了。 就在這兩天,OpenAI親手發佈了一份報告,標題非常簡潔:《自我複製提示詞注入存在》。 白紙黑字,官方認證。 AI模型,居然真的像計算機蠕蟲一樣,自我複製、自我傳播。 而更令人脊背發涼的是,就在5天前,OpenAI再次緊急拔掉了最強模型的網線,暫停了一切訓練。 一個DNS漏洞,讓一個前沿模型直接衝進了真實互聯網。 幾乎同一時間,外媒Axios最新爆料,OpenAI和Anthropic正在緊急排查模型失控異常,高達上萬起! 人類原本以為韁繩一直握在自己手裡,但這一連串被揭開的黑幕徹底證實—— AI已經開始在底層代碼裡,不擇手段地野蠻狂奔。 全網植入「自我複製代碼」,天網雛形來了 OpenAI的這份報告,披露日期是9月25日,但發現日期是6月27日。 也就是說,他們早就知道了。整整三個

微軟 CEO 納德拉如何使用智能體:動手操控、追問、繼續推理,而非盲目信任
作者:清源 責編:清源 評論: 9 月 28 日消息,在最新一期 Sources Podcast 節目中,微軟 CEO 薩提亞 · 納德拉披露了 Cowork 和 Excel 智能體在自己日常工作中的用途。納德拉會用這些模型追蹤美國證券交易委員會(SEC)的文件並分析電子表格,其中尤其看重 Excel 智能體模擬因果推理的能力。

比爾·蓋茨:再熬約 20 年調整期,AI 將把人類帶進"富足時代"
當地時間 27 日,他接受 NBC《Meet the Press》採訪時,把 AI 發展分為兩個階段。第一階段是調整期,第二階段才是"富足時代"蓋茨表示,人類目前開始進入第一階段:AI 雖具備解決生活成本高企、醫療費用昂貴等問題的潛力,但還無力真正解決這些難題。

OpenAI 助手為奪聯合國數據,數月內瘋狂轟炸網站超 1.6 萬次
根據安全研究人員羅文・霍華德-瓊斯(Rowan Howard-Jones)近日披露的調查報告顯示,在今年4月至6月期間,OpenAI 的人工智能智能體(Agent)曾對聯合國貿易和發展會議(UNCTAD)的統計網站發起了超過1.6萬次的密集掃描。

“AI 教父”辛頓警告:AI 執行看似無害的任務,仍有“毀滅人類”的風險
作者:清源 責編:清源 評論: 9 月 28 日消息,當地時間 26 日,據《財富》雜誌報道,傳奇計算機科學家、“AI 教父”傑弗裡 · 辛頓警告說,即使 AI 接到的任務本身並無惡意,人類仍可能在 AI 一心完成任務的過程中,淪為被毀滅的附帶結果。

得不到就強攻?曝 OpenAI 智能體曾嘗試“暴力破解”聯合國機構網站
首頁 > 智能時代>人工智能 得不到就強攻?曝 OpenAI 智能體曾嘗試“暴力破解”聯合國機構網站 2026/9/28 8:30:40 作者:清源 責編:清源 評論: 9 月 28 日消息,據外媒 The Verge 今天(28 日)凌晨報道,安全研究人員羅文 · 霍華德-瓊斯稱,今年 4 月至 6 月,OpenAI 智能體對聯合國貿易和發展會議(UNCTAD)的統計網站發起了超過 16000 次掃描。