阿里開源多模態新插件
阿里巴巴近日宣布正式開源一款全新的多模態插件,該工具已上架至通義插件項目主頁,目前獲得超過 477 顆星標記,引起開發者社群關注。這款插件核心功能是讓 AI 代理不僅能處理文字,還能夠讀取圖片與觀看影片,進一步拓展多模態應用的範疇,為智慧代理的開發提供更完整的感知能力。根據官方介紹,這款插件並不只是傳統的影像辨識工具,它還具備剪輯影片與操作三維 CAD 模型的能力。這意味著開發者與創作者可以直接透過此插件讓 AI 理解視覺內容,並進行實際的編輯或設計操作,突破過去只能分析靜態圖像的限制。
例如,AI 可以自動辨識影片中的場景變化並進行剪接,或根據使用者指令調整 3D 模型的結構,大幅提升工作效率。值得注意的是,這款插件還能與 DeepSeek 等模型協同運作,實現任務分工。在這種架構下,不同 AI 模型各自負責自己擅長的環節,例如由 DeepSeek 處理語言理解與推理,再由多模態插件負責視覺辨識與操作,兩者互補,形成更強大的複合型代理。這種設計不僅讓開發更加彈性,也降低了單一模型必須承擔所有任務的負擔。阿里巴巴選擇以開源方式釋出這款插件,背後意圖相當明確:降低多模態應用的開發門檻,讓更多團隊能快速打造能同時處理文字、影像與影片的智慧代理。
過去要實現類似功能,開發者往往需要自行串接多個不同模型與工具,整合難度高、維護成本也大。如今有了現成且經過阿里巴巴驗證的插件,團隊可以直接下載試用,甚至貢獻程式碼改良功能。該專案目前已完整公開在 GitHub 平台上,任何開發者皆可自行下載原始碼,按照文件指示部署到自己的環境中。官方也提供了使用範例與 API 說明,讓初學者也能快速上手。這項開源行動延續了阿里巴巴近年在 AI 領域的開放策略,繼通義千問系列模型開源後,進一步將周邊工具也釋出給社群,期望透過協作加速技術演進。從技術層面來看,這款插件的多模態能力建立在深厚的電腦視覺與影片理解基礎上。
它能夠解析圖片中的物體、場景、文字,也能處理影片的時間序列資訊,並自動產生對應的剪輯指令。對於 CAD 模型的操作,則需要具備三維空間理解與幾何運算能力,這些技術過去多侷限在專業軟體中,如今透過 AI 插件就能以自然語言或簡單指令驅動。對於開發者社群而言,這款插件帶來了實際的應用想像空間。例如,在電商場景中,AI 代理可以自動分析產品圖片與影片,生成商品描述或推薦;在影音創作領域,剪輯師可以用口語指令讓 AI 完成初步剪接;在工程設計中,工程師可以直接對 3D 模型下達修改要求,由 AI 執行對應的變更。這些過去需要大量人力與專業軟體的工作,現在有機會透過 AI 自動化處理。
此外,與 DeepSeek 等模型的協同能力,也讓這款插件在複雜任務中的表現更值得期待。以一個自動化影片製作流程為例,DeepSeek 可以負責理解使用者的腳本與意圖,然後將剪輯指令交給多模態插件執行;插件完成後再回傳結果給 DeepSeek 進行後續的文字標註或腳本調整。這種分工模式能有效提升整體效率,也降低了單一模型的負擔。阿里巴巴在官方說明中強調,開源這款插件的目的不僅是提供工具,更是希望建立一個開放的多模態生態系。開發者可以針對自己的需求修改程式碼,甚至加入新的視覺處理功能,再回饋給社群。
這種協作模式有助於快速累積技術能量,讓多模態 AI 的應用不再僅限於大型企業,個人開發者與小型團隊也能有平等的參與機會。從市場反應來看,該專案上架後短時間內就獲得 477 顆星,顯示開發者對這類工具的需求相當強烈。許多開發者在社群討論中表示,期盼已久能有成熟的開源多模態插件,如今阿里巴巴率先釋出,有望加速智慧代理從「純文字對話」進化到「視覺互動」的階段。未來隨著更多貢獻者加入,插件的功能與穩定度可望持續提升。整體而言,阿里巴巴此次開源多模態插件,不僅為智慧代理提供更完整的感知能力,也透過與 DeepSeek 等模型的協作,展示了多模型任務分工的可能性。
這項工具的出現,讓開發者可以更輕鬆地整合視覺、影片與 3D 操作,進一步推動 AI 在各行各業的實際落地。對於關注多模態技術發展的團隊來說,這無疑是一個值得下載試用的重要資源。
Related
相關文章
神秘“牛來”大模型上線即登頂 背後廠商至今未揭曉
近日,一款代號為Ox Alpha的匿名AI模型在OpenRouter悄然上線,短時間內調用量迅速攀升,成功衝至平臺榜首,並刷新了該平臺的單日模型用量紀錄。不過,儘管表現驚豔,Ox Alpha背後的開發主體至今仍未揭曉。

AI辦公助手,沒有葵花寶典:五款應用萬字實測報告
AGI-Signal2026.08.24 09:12 · 來自北京全文11936字單項冠軍各有其人。2026年上半年,AI辦公賽道發生了一個根本性變化,工具不再滿足於當“對話框”,而是試圖接管完整任務,寫一段文案、做完一份報告、生成一份PPT,甚至跨應用操作。

Anthropic新模型偷「吃瓜」,最強Fable 5爆冷
Anthropic 近日推出新款 AI 模型,在內部測試中意外展現「吃瓜」能力,引發社群熱議。該模型不僅能快速理解網路迷因與流行語,更在特定任務上表現出人意料,讓原本被外界視為最強對手的 Fable 5 爆冷落後,業界對這項結果感到相當驚訝。目前 Anthropic 官方尚未針對模型實際表現與測試細節做出完整說明,市場則持續關注後續可能的技術更新與應用方向。
Kimi K2.5 月底退役:月之暗面第一代萬億參數多模態模型謝幕
月之暗面官宣第一代萬億參數多模態模型Kimi K2.5將於本月底結束服役。該模型今年1月推出並開源,是Kimi迄今最全能模型,採用原生多模態架構,支持視覺與文本輸入、思考/非思考模式、對話與Agent任務,在Agent、代碼、圖像、視頻及通用智能取得開源SOTA。K3將接力,參數規模再上臺階。
光子躍遷亮相BIRTV 2026:以"AI+影像"重構創作範式,三大板塊解碼下一代影像生態
8月19日,BIRTV 2026(北京國際廣播電影電視展覽會)在北京拉開帷幕。在這場匯聚全球廣電與影像領域頂尖技術與創意的盛會上,光子躍遷以"AI+影像"為核心敘事,攜個人智能影像生態重磅亮相,向行業展示了一個由AI驅動、以人為中心的影像未來。與行業展會常見的深色科技風不同,光子躍遷的展臺以純淨白色為主基調,輔以品牌藍色進行點睛點綴,在千篇一律的深色展臺中脫穎而出,傳遞出品牌年輕、活力、面向未來的基因。

諾亦騰機器人發佈 HiPHI,開源 617.5 小時高精度人體運動數據
作者:潞源 責編:潞源 評論: 8 月 23 日消息,諾亦騰機器人在 2026 世界機器人大會期間發佈 HiPHI,這是一套面向人形機器人學習、數字人,以及計算機圖形學領域研究人員和工程師的高精度光學動作捕捉數據集。據報道,該數據集總長 617.