上海AI Lab與上交大拋出NCP預訓練新範式,8.9B隱空間模型用一半Token追平對手
AI資訊AI新閒資訊正文上海AI Lab與上交大拋出NCP預訓練新範式,8.9B隱空間模型用一半Token追平對手發布於AI新閒資訊時間 :Sep 22, 2026閱讀 :1分鐘逐詞預測這個大模型時代的老套路,被上海人工智能實驗室與上海交通大學人工智能學院LUMIA Lab團隊撕開了一道口子。他們提出全新預訓練任務下一個概念預測(NCP),並順勢推出全球首個8.9B規模的離散隱空間基座模型NCP-ArchPreview,把訓練效率的賬本重新算了一遍。這組數字相當刺眼。模型基於5.73T的Dolma- 3 語料預訓練,卻只用掉51.
3%的Token預算就追平了OLMo-3-7B的最終預訓練Loss,等效收斂速度提升1.95 倍,計算帕累託效率系統性提升1.74 倍;到了下游任務上,綜合表現領先2.45 分,其中GSM8K數學推理一口氣漲了近 6 分。也就是說,別人燒完一整箱算力才夠到的位置,它半箱油就到了。NCP-ArchPreview的骨架是一條三段式隱空間概念處理流水線。它先用乘積量化搭起一個超大的離散概念表徵空間,再通過可微的下一個概念預測、因果防洩漏反饋機制和分層殘差路由,實現對未來概念的顯式建模——不再是盯著下一個詞硬猜,而是先想清楚下一個概念長什麼樣。這種轉向隱空間概念預測的打法,從根本上打破了逐詞預測範式。
驚喜還不止於預訓練。團隊發現,只微調17M的隱空間參數就能超越LoRA,而且沒有遺忘的老毛病;訓練吞吐量上去了,顯存佔用也降下來。把這個概念表徵注入草稿模型後,推測解碼的平均接受長度提升4.17%,在代碼任務上更是漲到7.59%,為推理加速開了條新路。技術報告裡團隊還大方分享了踩坑經驗與解決方案,構建了千億級代理指標篩選機制,並把包含全程階段性Checkpoint、評測框架在內的全部資產一併開源。對於想要在模型微調和推理加速上找新突破口的研究者來說,這套隱空間思路無疑是一份剛出爐的路線圖。相關推薦雙節前後 10 多款大模型蓄勢待發:GPT-6 全系、Opus 5.2、V4.
1 Pro 領銜中秋國慶雙節前後,國內外至少十餘款大模型將密集發佈。國外方面,OpenAI月底開發者大會前,重磅產品延期至下週,將補齊GPT-6全系:Sol、Terra、Luna,與已發佈的Astra形成完整矩陣;Anthropic則被指跳過5.1版本。美國廠商雖無節前發佈習慣,但此次節點巧合,或掀新一輪AI競賽。Sep 20, 2026232.2k智譜發佈 GLM-5.3-FlashX:速度飆至200tokens/s,國產算力再提速智譜AI推出GLM-5.3-FlashX,API同步上線,最高輸出200tokens/s,主打智能、價格、速度,面向企業開發者提供高吞吐低延遲推理。
前身GLM-5.3-Flash曾以Ox Alpha匿名在海外亮相,憑同尺寸最強智能與高性價比積累口碑,調用量持續攀升,智譜正支撐增長需求。Sep 18, 2026316.6k每小時燒掉三萬美元!前DeepSeek大牛羅福莉加盟小米後首度直播大模型訓練小米MiMo大模型負責人、前DeepSeek研究員羅福莉沉寂半年後,於9月17日在X平臺公開直播大模型訓練過程,標誌其重回技術競爭,也讓外界首次窺見小米新一代模型內部訓練狀態。此外,MiMo-V2.6正進行RL實驗,並規劃三大擴展方向。Sep 17, 2026235.
2k豆包聯合火山引擎打造AI原生助手,上汽多款車型年內落地9月17日,豆包與火山引擎聯合發佈AI原生車載助手“豆包座艙助手”,標誌大模型技術在智能座艙進一步落地。產品已與上汽集團深度合作,首搭車型榮威家越07即日預售,上汽奧迪相關車型年內亮相,雙方年內還將推出更多落地車型。Sep 17, 2026238.0k蓋茨談AI全球競速:中美各四家模型領跑,中國人形機器人運動會“非常震撼”蓋茨基金會未來兩年將投入10億美元推動人工智能發展,讓前沿技術惠及最貧困地區。蓋茨還就全球大模型格局、算力碳排放及中國人形機器人等話題發表看法,指出按不同衡量方式,中美目前各有四家領先大模型企業。
Sep 15, 2026278.1k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026
Related
相關文章

阿里研究員透露Qwen4.5後模型將擴展至5-10T參數
阿里巴巴在雲棲大會上宣布新一代架構的Qwen4模型已開始訓練,未來Qwen4.5、Qwen5等版本參數規模將擴展至5至10兆。大會同時展示大模型遞歸自我改進技術已應用於訓練與推理,並推出多款影像、音樂、語音及全模態模型新版本。阿里也宣布下代視頻生成模型預計11月發布,並將語音模型落地於手機、AI眼鏡等終端裝置。

阿里公佈全模態模型新進展,Qwen4和下代視頻模型均在訓練中
阿里巴巴在2026雲棲大會上公布多項大模型進展,包括基於新架構的Qwen4已開始訓練,未來參數規模將擴展至5到10萬億。多模態方面,影片生成模型Wan3.0在評測中取得雙榜第一,下一代影片模型預計11月發布;語音、影像、音樂及世界模型等也同步升級。此外,Qwen3.8-Max透過自我進化技術,在零人工參與下持續迭代,整體下載量已超過30億次。

華為雲碼道全面升級:全球首個鴻蒙專屬AI編碼智能體登場,從想法到上架一條龍
官方給它的定位很硬:這是全球首個、也是目前唯一一個專為鴻蒙生態打造的AI編碼智能體,等於給鴻蒙開發者配了一位從頭跟到尾的數字搭檔。扛大樑的是鴻蒙編碼大模型。它依託鴻蒙增強訓練體系,在訓練數據、代碼生成、編譯通過率和Token消耗這幾個開發者最在意的維度上都佔著優勢,目前已經上線可調用。

蘋果零售先驅質疑AI代理購物:消費者不會完全交給機器
現年66歲的約翰遜曾於2000年加入蘋果,負責搭建零售業務,並參與建立後來成為蘋果產品銷售與用戶服務核心的實體門店網絡。谷歌正通過Universal Commerce Protocol推動AI代理覆蓋商品發現、比較和結賬流程,OpenAI也在將ChatGPT打造為購物平臺。

阿里 Qwen4 和下代視頻模型訓練中,Qwen4.5 後模型將擴展至 5-10T 參數
作者:汪淼 責編:汪淼 評論: 9 月 22 日消息,今日從 2026 年雲棲大會現場獲悉,阿里巴巴公佈了大模型一系列進展,大模型遞歸自我改進(RSI)已初步進入模型訓練、推理及芯模協同等環節中,基於新一代架構的 Qwen4 已在訓練中,未來 Qwen4.

阿里平頭哥發佈AI芯片真武V900,算力達M890三倍
基於真武V900構建的單一集群可擴展至50萬卡,可為前沿AI模型訓練與推理提供大規模算力支持。阿里表示,隨著平頭哥芯片產品線逐步成熟並獲得廣泛客戶應用,預計芯片年出貨量將大幅提升。阿里集團CEO吳泳銘透露,阿里自研M890AI超節點目前已具備支撐2萬億參數大模型推理的能力,並已於本季度規模化上架阿里雲數據中心。