阿里開源多模態新插件
阿里巴巴近日宣布正式開源一款全新的多模態插件,該工具已上架至通義插件項目主頁,目前獲得超過 477 顆星標記,引起開發者社群關注。這款插件核心功能是讓 AI 代理不僅能處理文字,還能夠讀取圖片與觀看影片,進一步拓展多模態應用的範疇,為智慧代理的開發提供更完整的感知能力。根據官方介紹,這款插件並不只是傳統的影像辨識工具,它還具備剪輯影片與操作三維 CAD 模型的能力。這意味著開發者與創作者可以直接透過此插件讓 AI 理解視覺內容,並進行實際的編輯或設計操作,突破過去只能分析靜態圖像的限制。
例如,AI 可以自動辨識影片中的場景變化並進行剪接,或根據使用者指令調整 3D 模型的結構,大幅提升工作效率。值得注意的是,這款插件還能與 DeepSeek 等模型協同運作,實現任務分工。在這種架構下,不同 AI 模型各自負責自己擅長的環節,例如由 DeepSeek 處理語言理解與推理,再由多模態插件負責視覺辨識與操作,兩者互補,形成更強大的複合型代理。這種設計不僅讓開發更加彈性,也降低了單一模型必須承擔所有任務的負擔。阿里巴巴選擇以開源方式釋出這款插件,背後意圖相當明確:降低多模態應用的開發門檻,讓更多團隊能快速打造能同時處理文字、影像與影片的智慧代理。
過去要實現類似功能,開發者往往需要自行串接多個不同模型與工具,整合難度高、維護成本也大。如今有了現成且經過阿里巴巴驗證的插件,團隊可以直接下載試用,甚至貢獻程式碼改良功能。該專案目前已完整公開在 GitHub 平台上,任何開發者皆可自行下載原始碼,按照文件指示部署到自己的環境中。官方也提供了使用範例與 API 說明,讓初學者也能快速上手。這項開源行動延續了阿里巴巴近年在 AI 領域的開放策略,繼通義千問系列模型開源後,進一步將周邊工具也釋出給社群,期望透過協作加速技術演進。從技術層面來看,這款插件的多模態能力建立在深厚的電腦視覺與影片理解基礎上。
它能夠解析圖片中的物體、場景、文字,也能處理影片的時間序列資訊,並自動產生對應的剪輯指令。對於 CAD 模型的操作,則需要具備三維空間理解與幾何運算能力,這些技術過去多侷限在專業軟體中,如今透過 AI 插件就能以自然語言或簡單指令驅動。對於開發者社群而言,這款插件帶來了實際的應用想像空間。例如,在電商場景中,AI 代理可以自動分析產品圖片與影片,生成商品描述或推薦;在影音創作領域,剪輯師可以用口語指令讓 AI 完成初步剪接;在工程設計中,工程師可以直接對 3D 模型下達修改要求,由 AI 執行對應的變更。這些過去需要大量人力與專業軟體的工作,現在有機會透過 AI 自動化處理。
此外,與 DeepSeek 等模型的協同能力,也讓這款插件在複雜任務中的表現更值得期待。以一個自動化影片製作流程為例,DeepSeek 可以負責理解使用者的腳本與意圖,然後將剪輯指令交給多模態插件執行;插件完成後再回傳結果給 DeepSeek 進行後續的文字標註或腳本調整。這種分工模式能有效提升整體效率,也降低了單一模型的負擔。阿里巴巴在官方說明中強調,開源這款插件的目的不僅是提供工具,更是希望建立一個開放的多模態生態系。開發者可以針對自己的需求修改程式碼,甚至加入新的視覺處理功能,再回饋給社群。
這種協作模式有助於快速累積技術能量,讓多模態 AI 的應用不再僅限於大型企業,個人開發者與小型團隊也能有平等的參與機會。從市場反應來看,該專案上架後短時間內就獲得 477 顆星,顯示開發者對這類工具的需求相當強烈。許多開發者在社群討論中表示,期盼已久能有成熟的開源多模態插件,如今阿里巴巴率先釋出,有望加速智慧代理從「純文字對話」進化到「視覺互動」的階段。未來隨著更多貢獻者加入,插件的功能與穩定度可望持續提升。整體而言,阿里巴巴此次開源多模態插件,不僅為智慧代理提供更完整的感知能力,也透過與 DeepSeek 等模型的協作,展示了多模型任務分工的可能性。
這項工具的出現,讓開發者可以更輕鬆地整合視覺、影片與 3D 操作,進一步推動 AI 在各行各業的實際落地。對於關注多模態技術發展的團隊來說,這無疑是一個值得下載試用的重要資源。
Related
相關文章

仇太深,奧特曼炮轟A社“反人類”
量子位·2026年08月24日 16:01“Codex名字沒起好,我也沒用明白” 《奧特曼天降正義,小嘴抹毒暗諷A社“反人類”》!!這個標題有沒有港媒內味兒了(doge),您先別笑,這還真是奧特曼在最新採訪裡的大致意思。雖然沒有點名,但話裡話外就差直接報Dario Amodei的身份證號了。

消息稱字節整合 AI 生產力:TRAE、釦子併入豆包,將推統一辦公品牌“豆包工作”
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,據智能湧現消息,字節跳動對旗下的辦公 AI 產品完成了一輪團隊整合:TRAE、釦子(Coze)團隊將整體併入豆包體系,其中 TRAE Work、釦子將與豆包在工作場景的產品能力進行整合;TRAE IDE 及 CLI 將作為豆包品牌下的編程產品線持續發展。

AI 大模型周榜:國產 glm-5.3-max 首秀闖入綜合榜前 15,kimi-k3-max 衝進前十
本週AI大模型Arena排行榜出現新面孔,智譜AI的glm-5.3-max首次入榜即拿下綜合榜第13名。月之暗面的kimi-k3-max排名持續攀升,成功擠進綜合榜前十,位列第10名。兩款國產大模型雙雙寫下佳績,成為本週關注焦點。

DeepSeek Harness來了:AI開始製造AI了?
DeepSeek Harness 正式推出,這項新工具被視為 AI 發展的重要里程碑,可能讓 AI 系統具備自主開發或優化其他 AI 的能力。外界關注此技術是否象徵 AI 開始「製造」AI,並可能加速人工智慧的進化與應用。目前相關細節與實際影響仍待進一步觀察。
神秘“牛來”大模型上線即登頂 背後廠商至今未揭曉
近日,一款代號為Ox Alpha的匿名AI模型在OpenRouter悄然上線,短時間內調用量迅速攀升,成功衝至平臺榜首,並刷新了該平臺的單日模型用量紀錄。不過,儘管表現驚豔,Ox Alpha背後的開發主體至今仍未揭曉。
具身智能資本熱浪再起,小鵬機器人首輪估值突破63億美元
AI資訊AI新閒資訊正文具身智能資本熱浪再起,小鵬機器人首輪估值突破63億美元 發布於AI新閒資訊時間 :Aug 24, 2026閱讀 :1分鐘小鵬機器人業務完成首輪超9億美元融資,投後估值突破63億美元(約合430億元人民幣),創下中國具身智能行業單輪私募股權融資紀錄。本輪融資由IDG資本領投,高榕創投參投,並獲騰訊和阿里巴巴作為戰略投資者共同參與,小鵬集團仍保持控股地位。四家投資方均將該輪視為其在具身智能領域迄今披露的最大規模單筆投資之一。IDG資本指出,小鵬人形機器人代表當前國內產業領先水平,已具備與海外頭部企業全球競爭的技術實力。本輪融資將推動小鵬機器人業務市場化估值體系的建立,並加速其人形機器人量產進程及物理AI模型的研發迭代,助力高階通用人形機器人邁向全球商業化應用新階段。此舉亦折射出具身智能賽道正吸引頂級財務與戰略資本加速佈局,產業從技術驗證向規模化落地轉變的趨勢日益明晰。相關推薦中國開源模型出海:法律 AI 獨角獸 Harvey 基於 Kimi K3 推出 Tenet美國法律AI獨角獸Harvey宣佈基於月之暗面開放權重模型Kimi K3,通過後訓練開發出法律專用模型Harvey Tenet,標誌中國開放權重模型首次進入美國頭部垂直AI公司訓練體系。Harvey此前主要依賴OpenAI、Anthropic等閉源模型,服務超2400家機構、20多萬名律師,估值110億美元,年化收入約3.5億美元。Aug 24, 2026115.2k韓國修法為 AI 開綠燈:經監管審查後可使用限定個人數據韓國國會通過《個人信息保護法》修正案,允許AI開發商經個人信息保護委員會審查後,在限定範圍內使用個人數據,突破原先“轉作AI開發須本人同意”的剛性約束。此舉迴應業界長期抱怨,此前豁免僅限於語音反詐、自動駕駛等少數場景且期限較短,新規為AI研發擴大數據可用空間。Aug 24, 2