通用能力不打折,空間具身智能斷層領先!ZDTaichu5.0-9B國產開源,躋身全球多模態第一梯隊

2026年9月16日 21:12
通用能力不打折,空間具身智能斷層領先!ZDTaichu5.0-9B國產開源,躋身全球多模態第一梯隊
站內 AI 整理稿

中國科學院自動化研究所旗下紫東太初團隊近日正式開源新一代通用多模態大模型 ZDTaichu5.0-9B,這款僅有 9B(90 億)參數的模型,在國際空間理解基準測試中展現出極強實力,一舉拿下九項指標中的八項第一名。更令業界矚目的是,它在專注空間理解的同時並未犧牲通用能力,各項常規多模態任務表現依然穩定,實現了「專而不偏」的均衡突破。ZDTaichu5.0-9B 的開源,標誌著國產多模態大模型在物理世界空間具身智能領域邁出關鍵一步。不同於過去多數模型只能在二維平面或對話框內理解語義,這款模型特別強化了對三維空間的深度感知,能夠辨識物體之間的相對位置、距離、朝向,以及場景中的幾何關係。

在國際知名的空間理解評測中,ZDTaichu5.0-9B 在包含物體位置判斷、空間邏輯推理、多視角一致性等九項子任務中,有八項拿下榜首,總分壓過眾多同量級甚至更大規模的模型。這項成績讓 ZDTaichu5.0-9B 在 10B 參數以下的模型中脫穎而出,被業界視為國產開源多模態在空間具身智能領域的重大進展。從基準測試結果來看,該模型已成功躋身全球多模態第一梯隊。值得注意的是,許多模型為了追求特定領域的極致性能,往往會犧牲通用對話、圖文理解、OCR(光學字元辨識)等基礎能力,但 ZDTaichu5.0-9B 在常規多模態評測中依然維持高水準,證明其架構設計能同時兼顧專業深度與廣度。

紫東太初團隊表示,ZDTaichu5.0-9B 的訓練數據特別納入了大量三維場景描述、空間問答與具身互動資料,使模型學會從多視角建構對環境的空間表徵。這種能力對後續機器人、自動駕駛、智慧製造、擴增實境等需要理解三維空間的應用至關重要。舉例來說,機器人若要自主抓取物品,不僅需要辨識物體是什麼,還要知道它在空間中的精確位置與朝向;自動駕駛系統需要即時判斷其他車輛與行人的相對距離與移動軌跡。ZDTaichu5.0-9B 的開源,為這些落地場景提供了一個可靠且輕量的基礎模型。由於採用開源方式發布,全球研究者和開發者均可下載模型權重與相關程式碼,進行二次微調或直接部署。

這對學術界與工業界而言,無疑大幅降低了探索空間具身智能的門檻。過去此類模型多由國外科技巨頭主導,且通常不開放原始碼,國產開源方案不僅填補了這一空白,也讓更多團隊能夠基於同樣的基礎進行創新。從技術角度看,ZDTaichu5.0-9B 在參數量僅 90 億的條件下達成如此成績,背後涉及多項關鍵設計。團隊在模型架構上採用視覺編碼器與語言模型深度融合的方案,並在訓練階段引入空間對比學習與三維資料增強技術,有效提升模型對深度、尺寸、遮擋等挑戰的魯棒性。此外,模型針對低算力環境進行了最佳化,使得在消費級顯示卡上也能順利執行推理,進一步擴大其應用場景。業界分析指出,空間理解能力是通往通用人工智慧的重要拼圖。

人類之所以能自如地在環境中行動,正是因為大腦內建了強大的空間認知系統。ZDTaichu5.0-9B 的突破,顯示國產模型在這一核心能力上已具備世界級水準,不再只是追趕,而是在特定方向實現了領先。尤其在全球多模態大模型競賽中,參數量越大通常代表越強的能力,但 ZDTaichu5.0-9B 以不到 10B 的參數證明,輕量化模型同樣可以達到頂尖性能,這對邊緣裝置與即時系統極具意義。值得一提的是,紫東太初團隊先前已陸續開源多個版本的多模態模型,ZDTaichu5.0-9B 是第五代系列的最新成員。

本次開源延續了一貫的開放精神,不僅發布模型權重,還提供完整的微調腳本與部署指南,讓使用者能根據自身任務需求進行客製化調整。這種做法有助於建立活躍的開發者社群,加速技術迭代與落地驗證。對於機器人領域而言,空間具身智能是實現自主導航、物件操作、人機互動的基礎。傳統方法依賴雷射雷達、深度相機等硬體感測器進行環境重建,再搭配規則或傳統規劃演算法,但缺乏彈性與泛化能力。ZDTaichu5.0-9B 提供了一種純視覺語言模型方案,僅需一般 RGB 相機輸入,就能推導出空間關係,並以自然語言形式輸出描述或指令,大幅簡化系統設計。可以預見,未來機器人控制系統將逐漸整合此類模型,作為高層語義理解與決策的核心。

在自動駕駛領域,雖然現有系統大多採用專用模型處理感知、預測、規劃,但多模態大模型有潛力統一這些環節。ZDTaichu5.0-9B 的空間推理能力,能幫助車輛在不依賴高精度地圖的情況下,理解道路結構與動態物體的空間布局,從而做出更安全的決策。此外,它的通用對話能力也可用於車內語音助手的上下文理解,讓駕駛者以自然語言查詢周邊環境資訊。總體而言,ZDTaichu5.0-9B 的開源不僅是一次技術成果的發布,更為整個國產開源生態注入了強心針。它證明了在有限資源下,透過創新的訓練策略與架構設計,依然能產出世界級的模型。隨著越來越多的開發者與研究機構基於 ZDTaichu5.

0-9B 進行二次開發,預計將帶動一波空間具身智能的應用浪潮,從實驗室走向工業與消費市場。目前,ZDTaichu5.0-9B 的模型與相關資源已於 GitHub 和 Hugging Face 等平台公開,團隊也同步發表了技術報告,詳細說明模型設計與訓練細節。對於關注多模態大模型、機器人、自動駕駛等領域的產業從業者與學術研究者來說,這無疑是一個值得密切追蹤的重要里程碑。未來,紫東太初團隊表示將持續優化模型效能,並探索更多與物理世界互動的能力,朝向真正的通用人工智慧目標邁進。

Related

相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究

作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

6 小時前

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線

。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

10 小時前

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線

我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

12 小時前

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”

Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。

13 小時前