無問芯穹聯合清華、上交正式開源具身端側推理引擎APXInf,Pi 0.5性能SOTA

2026年9月15日 18:47
無問芯穹聯合清華、上交正式開源具身端側推理引擎APXInf,Pi 0.5性能SOTA
站內 AI 整理稿

卡位具身智能規模化落地“最後一公里”!今天的具身模型,已經能夠看懂環境、理解指令,並把看到的、聽到的信息轉化為機器人該怎麼動的決策。但機器人最終還是要在物理世界裡連續幹活——從“眼睛看到”到“大腦決策”再到“手腳動起來”,整套流程都需要在極短的時間內完成閉環,這也是具身智能從 Demo 走向規模化應用,繞不開的核心關卡。而當一個在雲端運行良好的具身模型,放到機器人本體上,首先要面對的問題往往不是“模型夠不夠聰明”,而是推理系統本身: 模型部署到機器人上,能不能開機秒加載?機器人本體的算力資源有限,能不能榨乾端側每一分算力?每一次推理的延遲,能不能低到不拖後腿的程度?

開發環境裡跑得好好的模型,到了機器人本體上,能不能穩定不翻車?對於雲端的聊天機器人而言,幾百毫秒的延遲或許只是體驗上的細微差異;但對於需要持續感知、連續決策和實時控制的機器人而言,幾百毫秒帶來的可能是動作遲滯、軌跡不連貫,甚至多次任務的失敗。而當機器人走向規模化落地,還會疊加另一筆更加現實的“經濟賬”:算力成本、功耗,以及有限硬件資源的利用率。因此,具身智能規模化落地需要的,並不是簡單地把雲端推理框架“搬”到機器人本體,而是一套真正面向端側場景設計的推理系統:在有限的算力、功耗和成本約束下,兼顧小 Batch、低延遲與持續實時交互,並充分挖掘硬件的性能上限。

今天,無問芯穹聯合清華大學、上海交通大學,正式開源具身智能端側推理引擎——APXInf,超前卡位具身智能從模型能力走向規模化落地的核心環節。APXInf 支持 RTX 4090、Jetson Orin、Jetson Thor 等主流計算平臺,覆蓋從模型開發、效果驗證到機器人本體部署的完整鏈路。它關注的不只是讓具身模型在真實機器人上能夠“跑起來”,更希望可以在有限資源下“跑得夠快、夠穩,也足夠容易接入拓展和持續迭代”。目前,APXInf 已實現: PI 0.5 FP8在Jetson Thor上實現端到端推理延遲從 278ms 降低至 26 ms 以內 在 FP8下達到 38.

46Hz 推理頻率,完全滿足機器人多場景下實時控制對推理頻率和響應延遲的要求。通過針對機器人端側場景的系統性推理優化,APXInf 希望能夠進一步縮短具身智能從 POC 走向規模化落地的那“最後一公里”。開源地址: GitHub:https://github.com/RLinf/APXinf-robo Quick Start:https://github.

com/RLinf/APXinf-robo#quick-start 01 讓具身模型在機器人本體上跑得更快、更穩、更敏捷 當下具身智能的規模化落地,實際上同時面臨兩類需求: 一端,是機器人本體對推理系統提出的嚴苛要求:極致性能、低延遲、低功耗與高穩定性; 另一端,是開發者越來越強烈的工程訴求:模型能夠快速接入、能力能夠敏捷驗證、系統能夠持續擴展。但現實是,性能與工程效率往往很難同時兼顧。

現有的一些方案能夠跑得快,卻需要大量複雜的底層適配與工程集成;有的方案運行穩定,卻難以滿足機器人實時控制所需要的低延遲;還有一些方案雖然接口簡單,但面對不同模型、不同硬件和不斷變化的 VLA 架構時,擴展成本依然很高。APXInf 則罕見地同時兼顧了性能與工程效率,讓具身模型在機器人本體跑得“更快、更穩、更敏捷”。1.更“快”:端到端優化推理性能SOTA,讓實時控制成為可能 APXInf 的“快”,並不是單純追求某一個模型算子的峰值性能,而是圍繞機器人真實執行鏈路進行端到端優化。通過Pipeline、Graph、Kernel及量化等多層優化,降低具身模型端到端推理延遲。

同時通過冗餘特性的系統設計,為模型進行定製化的運行時,在更加輕量化的同時實現極致的性能挖掘,搭配上 Agent4Kernel 技術進行極限優化的融合算子,實現性能SOTA: 在 Thor 上,APXInf 將 PI 0.5 FP8 的端到端推理延遲從 278ms 降至 26 ms 以內,頻率可達 38.46 Hz,為機器人實時感知與控制提供更充足的響應空間。10.7 倍的推理延遲下降,對機器人而言,意味著更快的“感知-決策-動作”閉環,也意味著具身模型有機會在真實機器人上進入更加實時的工作狀態。2.更“穩”:可靠原生框架,面向長期持續穩定運行 機器人端側推理並不是“一次跑通”就結束了。

它面對的是長時間運行、連續感知與控制、有限計算資源,以及感知、推理、控制等多個模塊同時運行的複雜環境。對於機器人而言,真正難以接受的並不是偶爾“慢一點”,而是在持續運行過程中出現抖動、異常、中斷,甚至因為內存、併發或資源管理問題導致整個系統失穩。因此,APXInf 的“穩”,強調的是真實部署環境中的可預測性和持續運行能力。

創新架構:使用 Rust 系統語言構建的極簡運行時 + Python 易用接口 利用冗餘特性設計,打造極簡化運行時,降低運行開銷的同時做到可核查、可驗證 利用 Rust 語言提供的內存安全特性,進一步提升引擎穩定性、降低易錯面,從源頭規避內存風險 通過 Python 接口封裝,保留開發者熟悉的調用方式,兼顧底層硬核與上層易用。這也是 APXInf 面向真實機器人部署所做的架構選擇:既追求端側性能,也關注系統長期運行的穩定性,同時儘可能降低開發者的使用門檻。3.

更“敏捷”:降低接入與優化成本,面向 Agentic Native 演進的推理系統新範式 如果說前面的努力解決了“跑得夠不夠快”和“能不能長期穩定地跑”這兩道題,那麼 APXInf 進一步關注的問題是:面對日益豐富的具身模型和越來越複雜的具身系統,模型究竟應該如何更快、更敏捷地接入,並持續迭代優化?傳統的推理引擎多使用編譯技術或降低開發難度來解決新模型接入的問題,但往往很難兼顧極致的性能和模型接入效率。

如今,大模型能力日新月異,我們得以在保持對模型極致優化的同時,利用 Agentic Engineering 快速實現新模型的適配與接入——這一能力不僅可以加速我們自身的研發迭代,還會開放給 APXInf 的開發者,讓用戶自研模型的接入與優化變得簡單和敏捷。為此,APXInf 從設計之初就以適配 Agentic Engineering 研發流程為出發點,重新思考推理引擎的系統設計,通過冗餘特性、功能隔離、工具箱模型等方法,顯著提升 APXInf 與 Agentic Engineering 的適配度,降低研發門檻,使得 Token 可以更便利高效地轉化為生產力。

APXInf 也將面向 Agentic Native 持續探索和迭代。我們希望 APXInf 帶來的並不只是降低某一個模型的部署門檻,而是去探索一種全新的面向 Agentic Engineering 時代的推理系統構建範式:讓推理引擎不再只是一個被動執行模型的 Runtime,而是連接模型、硬件、機器人與開發者,推動 Agentic Infra 持續演進。02 開源清單 APXInf 本次首發支持兩款具身模型: PI 0.5、WALL-OSS 。硬件支持 Jetson Orin、Jetson Thor 及 RTX 4090,並提供統一的模型接入方式。

Roadmap 支持更多的模型,VLA、VLM、世界模型等(已在適配中模型:Qwen、Groot) 持續優化重點開源模型,擴充SOTA模型列表 極致的 nvfp4 性能優化 持續拓展國產化生態支持,支持國產芯片算力後端,支持國產機器人操作系統 適配AMD等行業主流芯片 03 RLinf × APXInf:一條工程鏈路上的前後端 對於具身智能而言,模型訓練與本體推理從來不是彼此割裂的兩個環節,而是同一條工程鏈路上的前後端。2025 年 9 月,無問芯穹聯合清華大學等團隊開源了全球首個面向具身智能的大規模強化學習訓練開源框架,專為通過強化學習對具身大模型進行後訓練而設計。

當訓練完成的具身模型真正進入機器人本體並開啟規模化應用後,下一步需要解決的,正是端側推理與部署:在有限算力和功耗約束下,以小Batch的工作負載實現更低延遲、更高吞吐和更穩定的實時運行。APXInf 銜接的正是這一環。它將 RLinf 的能力從模型訓練與評測進一步延伸至機器人端側推理與部署。此次開源,APXInf 也將作為 RLinf 開源生態中的端側推理項目首發,讓開發者能夠沿著同一套具身智能技術生態,完成從模型訓練、效果驗證,到本體部署與真實機器人運行的完整流程。

從訓練,到推理;從雲端,到本體;從“模型會做什麼”,到“機器人真正做出來”——APXInf 正在補上具身智能規模化落地的關鍵一環。04 開源招募 APXInf第一版只是一個起點。無問芯穹希望的,是與具身模型開發者、機器人團隊和端側系統開發者一起,把模型接入、運行優化和本體部署沉澱為更加標準、可複用,也更適合代碼 Agent 參與的開發流程。如果你: 正在嘗試把 π0.

5 等具身模型部署到機器人本體; 正在基於 RTX 4090、Jetson Thor或Orin等硬件進行項目開發; 正在為新的具身模型尋找端側推理引擎; 希望參與具身模型接入Skill和Agentic部署流程的建設; 歡迎體驗 APXInf、提交 Issue 或貢獻 PR。GitHub:https://github.com/RLinf/APXinf-robo Quick Start:https://github.com/RLinf/APXinf-robo#quick-start

Related

相關文章

達卯科技算電協同2.0平臺入選2026國際數字能源展重大成果發佈

成果中唯一聚焦算電協同全鏈路運營的AI技術產品 9月15日-17日,2026能源綠色發展大會・國際數字能源展在深圳舉辦。展會首次以“一會一展”深度融合模式打造全球數字能源產業盛會,集中發佈近百項前沿創新成果。達卯科技自主研發的「算電協同2.0平臺・AIDC綠電直連能源運營操作系統」成功入選重大成果發佈,也是成果中唯一聚焦算電協同全鏈路運營的AI技術產品。

16 分鐘前
全天候科技產業與商業

小鵬要把賣車和賣技術一起推向全球

王小娟 發表於 2026年09月18日 14:05 摘要:技術合作再尋新客戶。9月17日晚,小鵬集團董事長、CEO何小鵬談起G9L的價格,說自己和總裁王鳳英曾在會議室裡反覆爭論。幾小時前,這款車剛以23.18萬元的 限時起售價上市,較8月公佈的預售起售價低了2.

2 小時前

Claude“主導”Anthropic 26%的AI研發、3萬Agent同時運行:當AI開始“造AI”,頭部公司RSI路線正在分化

根據報導,人工智慧領域近期出現一項值得關注的動向:Anthropic 的 AI 模型 Claude 在其內部研發工作中扮演了主導角色,佔據該公司約 26% 的 AI 研發比例,同時有高達 3 萬個 Agent 在同一時間並行運作。這項數據反映出 AI 開始「製造 AI」的趨勢正在加速,而頭部公司在遞歸自我改進(RSI)路線上的分化也愈發明顯。 Claude 不再只是對外服務的產品,而是成為 Anthropic 內部研發流程的核心引擎。

7 小時前

智譜實現RSI最小閉環,A社:我來監督

智譜AI近日對外宣布,已在遞歸自我改進(Recursive Self-Improvement,簡稱RSI)領域取得關鍵技術突破,成功實現業界首個「最小閉環」系統。與此同時,被業內簡稱為「A社」的AI安全研究機構同步表態,將以第三方監督角色介入該系統的測試與驗證流程,確保技術發展符合倫理與安全規範。 所謂的最小閉環,指的是系統能在不依賴外部人工反饋的情況下,自主完成從自我評估、參數調整到性能驗證的完整循環。

7 小時前

傳聞四起,人形機器人IPO審核收緊?

近期市場傳出多項風聲,指稱人形機器人領域的首次公開募股(IPO)審核可能出現收緊趨勢。雖然官方尚未發布明確指引,但這波傳言已在投資人與業界之間引發討論,不少人開始關注監管層是否會對這類新興科技公司的上市門檻提出更高要求。 與此同時,宇樹科技在資本市場上的戲劇性波動,也被視為影響整體情緒的關鍵變數。

8 小時前