一張3090就能跑!全棧國產模型,把AI辦公搬到企業本地

AI辦公這塊蛋糕,中國電信可能要先切走一塊了。henry 發自 凹非寺 | 公眾號 QbitAI AI辦公這塊蛋糕,中國電信可能要先切走一塊了。這個夏天,大廠們集體加註AI辦公。卷Agent能力,卷工作入口,卷企業工作流,Coding之後,辦公成了Agent的下一個必爭之地。但就在大夥忙著搶入口的時候,還有一批企業,連門都沒進去。原因現實得很扎心。他們數據不能出域,模型最好就地部署,手頭算力又不算富裕。可偏偏,長文檔要讀,複雜業務要辦,該乾的活一樣不少。中國電信AI這次最新開源的Xing4.0-29B-A4B,瞄準的就是這批需求。而且,這次帶來的還是一款全棧國產化的輕量級代碼智能體大模型。
從國產芯片、國產訓練框架,到模型訓練和推理部署,整條技術鏈路都做了系統適配。為了儘可能實現本地部署,Xing4.0-29B-A4B採用MoE架構,290億的總參數,每次推理只激活約40億參數,經過4-bit量化後,一張RTX 3090就能運行。當然,跑起來只是第一步。企業真正關心的,還是這張顯卡上的模型,到底能幹多少活。比如,處理重要文檔時,模型可以直接在本地完成內容理解、指標提取和信息整理,數據全程不用離開企業環境。再比如,一份200頁的投標文件交過來,模型能在本地用約20分鐘,完成技術、商務、價格三個方面的初評,並逐條給出評分依據。更進一步,它對本地部署的考慮,也不只停留在消費級顯卡上。
Xing4.0-29B-A4B完全基於華為昇騰910C算力訓練,並採用國產的MindSpore/MindFormers訓練框架與開發套件,真正實現了國芯訓國模。在推理部署端,它還完成了昇騰的適配驗證。可以說,從訓練到落地,國產算力這條路也已經走通。目前,模型已經在GitHub、Hugging Face、Gitee、魔搭、魔樂等平臺開源上線,並同步支持API調用。值得一提的是,截止發稿,Xing4.0-29B-A4B現在已經衝進HuggingFace模型趨勢榜單,位居第四。感興趣的朋友,可以直接用起來了。
(相關鏈接在文末) 既要跑得動,也要真的能幹活 老實說,把模型裝進一張顯卡,和讓它穩穩接住企業的日常工作,中間還隔著不少事。畢竟,企業交過來的任務,很少只有一句問答那麼簡單。一份文檔讀完了,可能還要提取信息、調用工具、核對結果,最後整理成一份能交出去的材料。更何況,這些活每天都要幹,不但要考慮穩定性,還要考慮性價比。要滿足這些要求,既要繼續壓低部署和運行成本,也得把幹活的能力練紮實。後者,正是Xing4.0-29B-A4B這次重點加強Coding和Agent能力的原因。先說Coding。過去,百億參數模型寫代碼,一個常見的問題就是寫個函數、補幾行代碼還行。
可一旦把整個代碼倉庫交過去,要求它解決一個真正的工程問題,事情就沒那麼順了。因為它需要先看懂項目結構,跨文件追蹤接口調用,再結合文檔、日誌和歷史上下文定位問題。改完之後,還得驗證修改有沒有用,會不會影響其他地方。代碼只是最後寫出來的那一部分,前面還有一長串工作要做。針對這個老大難問題,Xing4.0-29B-A4B這次把Coding能力,從「寫片段」進一步推向了「幹工程」。它原生支持256K上下文,並可擴展至512K,讓一次任務能夠裝下更長的代碼、文檔、日誌和歷史記錄,為理解整個項目提供空間。比如,要把分散在Excel裡的合同臺賬做成管控大屏,需要的就不只是一個畫圖函數。
模型還要理解表格裡的業務數據,將合同概覽、金額分佈、風險識別和履約預警等需求,組織到同一個頁面中。這裡既涉及數據理解,也涉及代碼生成和功能組織,需要結合前後的信息完成開發。Xing4.0-29B-A4B可以在企業本地,將這些合同臺賬轉化為可視化管控大屏,數據全程不用離開企業環境。而到了Agent這邊,要求還要再往前走一步。理解需求之後,模型得自己拆解任務、安排執行順序、調用工具,再根據中間結果決定下一步怎麼做。一路做下去,直到交付一個可以驗收的結果。Xing4.0-29B-A4B針對這類長程任務做了專項強化。
比如,用戶一次說清需求後,模型可以判斷哪些步驟先做、哪些可以並行,再調用天氣、日程、提醒、出行等不同工具或Agent,把任務繼續推進。但模型自己會幹活了,企業就能直接用起來嗎?還差一步,接進現有工作流。企業已經在用的開發工具、Agent框架和部署平臺,都得接得上。否則,光是換一套環境,就可能先多出一堆工作。為此,Xing4.
0-29B-A4B已經針對OpenCode、Claude Code、OpenClaw、Hermes等主流Agent、Harness框架完成定向適配,同時兼容LLaMA-Factory、MindFormers、SGLang、vLLM、KTransformers等常用工具鏈,降低接入現有開發環境的門檻。當然,對於我們開頭提到的那批企業來說,還有一個繞不開的現實約束: 數據不能出域,算力也確實有限。所以除了能力升級,Xing4.0-29B-A4B也在繼續把部署門檻往下壓。傳統FP16精度下,29B參數模型單卡顯存佔用約60GB,往往需要多卡或者價格高昂的A卡。
經過4-bit量化後,這部分佔用可以壓縮至約15GB,降低約75%,讓RTX 3090、4090等消費級顯卡也能運行。而這套輕量化私有部署方案,已經進入了真實生產場景。在智能客服業務中,Xing4.0-29B-A4B已經完成私有化部署,用戶通話、身份信息和業務記錄全程不出域。面對複雜訴求,模型需要一路完成意圖理解、任務拆解、工具調用、結果整合和合規校驗。據悉,目前這套方案的複雜業務辦理成功率已經達到90%以上。到這裡,開頭那批企業的需求,才算是終於有了著落: 消費級顯卡能跑,複雜任務能接,工具和業務系統也能連起來。那麼問題來了,這究竟是怎麼做到的?
架構、數據、訓練、部署的全方位優化 前面提到的MoE,是其中一部分答案。模型有290億總參數,但每次推理只激活約40億。這樣一來,每次處理任務時,就不必把全部參數都調動一遍,計算開銷也隨之降低。但要讓它讀長文檔、寫工程代碼,再把一個多步驟任務持續做下去,光靠MoE還不夠。背後還有架構、數據、訓練和工程優化幾方面的配合。先看架構。上下文越長,模型能讀進去的內容就越多。可問題是,讀進去的內容,也要佔地方。模型處理長文檔時,會把前文的一部分計算結果存下來,方便後續生成時複用,這就是大家熟悉的KV Cache。隨著上下文變長,緩存也會越積越多,吃掉更多顯存,還可能拖慢推理速度。
所以,長上下文要真正用起來,就得先想辦法給這份緩存瘦身。Xing4.0-29B-A4B採用的MLA多頭潛變量注意力,做的就是這件事:把需要緩存的信息壓縮成更緊湊的形式,降低長上下文推理的顯存開銷。進一步,讀進去的開銷降下來了,生成速度也得跟上。在這裡,Xing4.0-29B-A4B還採用了MTP,也就是多Token預測。相比常規訓練主要讓模型預測下一個Token,MTP則讓模型同時學習預測後續多個Token,從中學習更長的前後關聯。這些預測還可以在推理時派上用場:先提前生成候選內容,再交給主模型校驗,為生成加速提供支持。
此外,模型還引入了DeepSeek同款的mHC流形約束超連接,約束信息在不同層之間的傳遞,減少信號反覆放大帶來的訓練不穩定。架構搭好了,接下來就看模型學什麼。中國電信這次自建了一套包含數十萬億詞元的數據體系。預訓練數據經過PB級多源清洗,除了通用內容,還加入了複雜表格、結構化知識圖譜和智能體行為軌跡。其中,行為軌跡和Agent能力的關係尤其直接。因為它記錄的,恰好就是一個任務從頭到尾怎麼做—— 目標是什麼,中間調用了哪些工具,工具返回了什麼,拿到結果之後,下一步又該如何處理。這些過程連在一起,模型才能學習如何把前一步的結果,接到下一步的操作上。
到了後訓練階段,團隊又搭建了支持代碼運行、在線搜索和工具調用的高併發沙箱,在其中構造長程Agent任務。代碼能不能跑,工具有沒有調對,最後的結果是否符合要求,都通過測試用例和自動化機制校驗。這樣一來,訓練材料該不該留下,就有了實際執行結果作為依據。在訓練階段,Xing4.0-29B-A4B則隨著任務難度逐步展開。預訓練從4K序列長度起步,先學習通用知識和基礎推理,再逐步提高代碼與複雜推理數據的佔比。進入中訓練階段,序列長度依次擴展到32K、128K和256K,同時增加倉庫級代碼、複雜推理和Agent數據。
到了後訓練階段,團隊圍繞Coding、Agent和Reasoning三個方向,分別開展多專家強化學習,再通過MOPD,把各個方向的專項能力融合起來。值得一提的是,訓練過程中,還用上了Muon和QK-Clip。前者用於優化參數更新,後者控制注意力計算中的數值規模,降低數值異常增長的風險。最後,在工程優化階段,電信進一步讓模型能夠在國產算力上高效完成訓練。這也是全棧國產化真正落到技術細節的地方。Xing4.0-29B-A4B基於昇騰910C集群,結合MindSpore/MindFormers,完成了mHC等新特性的適配、跨框架精度對齊及融合算子開發,讓模型架構、國產訓練框架與國產芯片協同起來。
針對計算調度和顯存壓力,團隊通過DVM圖算融合、細粒度重計算和Ascend C定製融合算子,減少調度與數據搬運開銷,節省顯存,並提高執行效率。據官方介紹,經過模型架構、編譯、算子與硬件的多層次協同優化,整網訓練吞吐較開箱性能提升約96%,接近翻倍。後訓練使用的Slime強化學習框架,也完成了昇騰生態適配。從訓練框架到底層算子,再到強化學習,團隊都做了針對性優化。也就是說,國芯訓國模背後,是芯片、框架、模型和訓練流程的整套配合。而從架構、數據、訓練到部署,這一整套功夫,最終都落到了企業桌上那些已經堆起來的任務上。
讓企業真正用上AI 最後,為了讓企業真正地、絲滑地用上AI辦公,電信這次也同步了一個保姆級套餐。希望儘快用起來的企業,可以選擇將Xing4.0-29B-A4B預集成到算網一體機,減少環境搭建和安裝配置工作,縮短部署週期。本地算力緊張時,還可以在滿足自身數據管理要求的前提下,通過智算專線調用雲端算力,完成彈性擴容。而對於採用國產算力的企業,模型還基於智源FlagOS統一開源AI軟件棧,打通了多家國產芯片的適配路徑,降低跨硬件平臺遷移和部署的成本。可以說,從一張消費級顯卡,到算網一體機,再到雲端彈性算力,不同規模、不同技術儲備的企業,都有相應的部署路徑。說到這,還有最後一個問題。
中國電信為什麼要專門做這樣一款更輕的模型?把29B放回整個星辰系列裡看,答案會更清楚。此前,中國電信已經佈局十億、百億、千億參數模型,並開展萬億參數模型,以及語音、語義、多模態等方向的研發。而Xing4.0-29B-A4B補上的,是其中一類很具體的需求: 本地算力有限,但複雜任務照樣要做。對於這類需求,中國電信並不陌生,甚至不誇張地說,這類需求可能也只有電信能看到、滿足。從政務、客服到網絡運維,它長期接觸大量私有化部署場景。數據能放在哪裡,現有設備能承擔多少計算,業務流程又有多複雜,都是企業用上模型之前必須解決的問題。而這,就為這次輕量模型的設計提供了一個具體的出發點。
從企業現場的算力成本、數據邊界和業務需求出發,確定模型需要多大、哪些能力必須加強,再配上相應的交付方案。這條從模型走到企業現場的路徑,也對應著中國電信正在推進的雲改數轉智惠戰略,以及算力、平臺、數據、模型、應用五位一體智能雲體系。模型負責理解和執行任務,平臺負責接入與編排,算力和網絡支撐運行,再由行業應用把這些能力接進具體業務。Xing4.0-29B-A4B,就是這套佈局中面向輕量化私有部署的一步。從國產芯片上訓練出來,再適配企業手頭的設備和實際工作流,國芯訓國模的價值,也就進一步落到了企業能不能用、好不好用上。
也正因如此,後續星辰系列的更新,也有了更具體的看點:更大的模型能處理多複雜的任務,不同模態能覆蓋哪些工作,更輕的模型又能進入多少原本受限於設備和部署條件的企業。回到開頭,AI辦公的競爭還在繼續。而那些數據不能出域、手頭算力有限的企業,也一直有文檔要讀、有材料要交、有業務要辦。如今,企業又多了一個把AI用起來的選擇。下一步,可能就從手頭這張顯卡開始。開源地址: GitHub:https://github.com/XingChen-AGI/Xing4.0-29B-A4B HuggingFace:https://huggingface.co/XingChen-AGI/Xing4.
0-29B-A4B 魔搭:https://modelscope.cn/models/XingChen-AGI/Xing4.0-29B-A4B Gitee:https://gitee.com/xingchen-agi/xing4.0-29b-a4b 魔樂:https://modelers.cn/models/XingChen-AGI/Xing4.0-29B-A4B 版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

阿里千問開源 Qwen-Image-2.1 圖像模型:可生成、編輯透明圖像,支持最多 10 張參考圖
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 咩咩洋 的線索投遞!9 月 20 日消息,阿里千問今日宣佈,開源千問圖像系列當前兼顧生成效果、推理效率與使用成本的開源圖像模型 Qwen-Image-2.1。Qwen-Image-2.1 將文生圖與圖像編輯整合在同一模型中,視覺生成部分僅有 7B 參數,並原生支持透明圖像的生成與編輯。

FBI 局長稱該局 AI 使用暴增 605%,靠 AI 攔下多起槍擊事件
作者:遠洋 責編:遠洋 評論: 9 月 20 日消息,美國聯邦調查局(FBI)局長卡什 · 帕特爾(Kash Patel)近日在一場採訪中稱,經他推動,聯邦調查局對人工智能技術的使用量實現了 605% 的增長。雖然人工智能模型強大的模式識別能力,使其十分適合執法機構採用;人們也確實有理由預期 FBI 這類部門會運用這項技術,但外界很難釐清 605% 這個數字究竟統計的是什麼。

斷網仍可作戰:AI 模型加持的無人機可實現戰場自主識別、打擊目標
作者:遠洋 責編:遠洋 評論: 9 月 20 日消息,據 Arstechnica 報道,隨著歐洲各國軍隊開始適應現代戰爭當中人工智能與無人機的應用,一家獲得北約支持的初創企業正在協助部署由 AI 驅動的目標探測與篩選系統。這套系統可以直接在小型無人機上運行,用於偵察以及打擊任務。

Opus 5.2 與 Gemini 4 Pro 未經官宣已上線,前沿模型的發佈流程正在被壓縮
AGI-Signal2026.09.20 18:25 · 來自海外全文2787字00:00 / 07:27沒人開發佈會。可硅谷這一週,比任何發佈會都熱鬧。過去兩週,Anthropic 將兩個尚未命名的模型接入生產接口,谷歌為下一代旗艦沿用舊版本號、投放到第三方盲測平臺,OpenAI 在 Astra 之後未再公開發聲。

東風人形機器人"小東"下月進廠:汽車大模型給具身智能當"師傅",年底要和真人掰手腕
T1 人形機器人9月20日,上緯新材旗下品牌上緯啟元發佈啟元Q1、T1兩款消費級人形機器人。董事長彭志輝介紹,啟元Q1主打自定義特性,支持自定義互動動作與3D打印改造外觀,用戶可自由調整外觀造型、性格特質、動作姿態和語音音色;T1細節暫未披露。

一顆 260 克的"雞蛋關節":稚暉君發佈啟元 Q1、T1 人形機器人
T1 人形機器人發佈於AI新聞資訊發佈時間 :2026年9月20號 17:09閱讀 :1分鐘9月20日,在2026啟元機器人全球產品發佈會上,上緯新材旗下消費級人形機器人品牌上緯啟元正式發佈啟元 Q1、啟元 T1兩款人形機器人。上緯新材料科技股份有限公司董事長、智元機器人聯合創始人兼首席技術官彭志輝(稚暉君)介紹,啟元 Q1主打自定義特性,支持自定義設計互動動作與3D 打印改造外觀,用戶可自由調整機器人的外觀造型、性格特質、動作姿態與語音音色。