上海AI Lab與上交大拋出NCP預訓練新範式,8.9B隱空間模型用一半Token追平對手

2026年9月22日 03:017000 次瀏覽
站內 AI 整理稿

AI資訊AI新閒資訊正文上海AI Lab與上交大拋出NCP預訓練新範式,8.9B隱空間模型用一半Token追平對手發布於AI新閒資訊時間 :Sep 22, 2026閱讀 :1分鐘逐詞預測這個大模型時代的老套路,被上海人工智能實驗室與上海交通大學人工智能學院LUMIA Lab團隊撕開了一道口子。他們提出全新預訓練任務下一個概念預測(NCP),並順勢推出全球首個8.9B規模的離散隱空間基座模型NCP-ArchPreview,把訓練效率的賬本重新算了一遍。這組數字相當刺眼。模型基於5.73T的Dolma- 3 語料預訓練,卻只用掉51.

3%的Token預算就追平了OLMo-3-7B的最終預訓練Loss,等效收斂速度提升1.95 倍,計算帕累託效率系統性提升1.74 倍;到了下游任務上,綜合表現領先2.45 分,其中GSM8K數學推理一口氣漲了近 6 分。也就是說,別人燒完一整箱算力才夠到的位置,它半箱油就到了。NCP-ArchPreview的骨架是一條三段式隱空間概念處理流水線。它先用乘積量化搭起一個超大的離散概念表徵空間,再通過可微的下一個概念預測、因果防洩漏反饋機制和分層殘差路由,實現對未來概念的顯式建模——不再是盯著下一個詞硬猜,而是先想清楚下一個概念長什麼樣。這種轉向隱空間概念預測的打法,從根本上打破了逐詞預測範式。

驚喜還不止於預訓練。團隊發現,只微調17M的隱空間參數就能超越LoRA,而且沒有遺忘的老毛病;訓練吞吐量上去了,顯存佔用也降下來。把這個概念表徵注入草稿模型後,推測解碼的平均接受長度提升4.17%,在代碼任務上更是漲到7.59%,為推理加速開了條新路。技術報告裡團隊還大方分享了踩坑經驗與解決方案,構建了千億級代理指標篩選機制,並把包含全程階段性Checkpoint、評測框架在內的全部資產一併開源。對於想要在模型微調和推理加速上找新突破口的研究者來說,這套隱空間思路無疑是一份剛出爐的路線圖。相關推薦雙節前後 10 多款大模型蓄勢待發:GPT-6 全系、Opus 5.2、V4.

1 Pro 領銜中秋國慶雙節前後,國內外至少十餘款大模型將密集發佈。國外方面,OpenAI月底開發者大會前,重磅產品延期至下週,將補齊GPT-6全系:Sol、Terra、Luna,與已發佈的Astra形成完整矩陣;Anthropic則被指跳過5.1版本。美國廠商雖無節前發佈習慣,但此次節點巧合,或掀新一輪AI競賽。Sep 20, 2026232.2k智譜發佈 GLM-5.3-FlashX:速度飆至200tokens/s,國產算力再提速智譜AI推出GLM-5.3-FlashX,API同步上線,最高輸出200tokens/s,主打智能、價格、速度,面向企業開發者提供高吞吐低延遲推理。

前身GLM-5.3-Flash曾以Ox Alpha匿名在海外亮相,憑同尺寸最強智能與高性價比積累口碑,調用量持續攀升,智譜正支撐增長需求。Sep 18, 2026316.6k每小時燒掉三萬美元!前DeepSeek大牛羅福莉加盟小米後首度直播大模型訓練小米MiMo大模型負責人、前DeepSeek研究員羅福莉沉寂半年後,於9月17日在X平臺公開直播大模型訓練過程,標誌其重回技術競爭,也讓外界首次窺見小米新一代模型內部訓練狀態。此外,MiMo-V2.6正進行RL實驗,並規劃三大擴展方向。Sep 17, 2026235.

2k豆包聯合火山引擎打造AI原生助手,上汽多款車型年內落地9月17日,豆包與火山引擎聯合發佈AI原生車載助手“豆包座艙助手”,標誌大模型技術在智能座艙進一步落地。產品已與上汽集團深度合作,首搭車型榮威家越07即日預售,上汽奧迪相關車型年內亮相,雙方年內還將推出更多落地車型。Sep 17, 2026238.0k蓋茨談AI全球競速:中美各四家模型領跑,中國人形機器人運動會“非常震撼”蓋茨基金會未來兩年將投入10億美元推動人工智能發展,讓前沿技術惠及最貧困地區。蓋茨還就全球大模型格局、算力碳排放及中國人形機器人等話題發表看法,指出按不同衡量方式,中美目前各有四家領先大模型企業。

Sep 15, 2026278.1k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

量子位生成式AI

阿里研究員透露Qwen4.5後模型將擴展至5-10T參數

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 阿里研究員透露Qwen4.5後模型將擴展至5-10T參數 量子位的朋友們 2026-09-22 11:48:05 來源:量子位 未來Qwen4.5、Qwen5等版本將擴展至5-10T參數。 9月22日,阿里巴巴在雲棲大會上公佈了大模型一系列進展,大模型遞歸自我改進(RSI)已初步進入模型訓練、推理及芯模協同等環節中,基於新一代架構的Qwen4已在訓練中,未來Qwen4.5、Qwen5等版本將擴展至5-10T參數。同時,視頻生成模型、語音模型、圖像模型、世界模型、音樂模型以及全模態模型等均在當天或近期推出新版本。 追求更高智能,Qwen加速自我進化 大模型正走向自我迭代,本屆雲棲大會,阿里系統展示了千問大模型自我進化的最新探索成果。 在模型自我訓練上,Qwen3.8-Max通過自主搭建訓練流程、構造訓練數據,並自主設計實驗、定位缺陷,在人類完全“零參與”的情況下持續迭代超1個月,完成33輪有效迭代。基於RSI、後訓練等系列技術聯合優化,Qwen3.8-Max新版本在Artificial Analysis上的得分從40漲至45分,與Claude、GPT最強模型同處第一陣營,領先於GLM5.3、Kimi-K3等所有國產模型。 在推理優化上,Qwen3.8-Max在從未見過的平頭哥新款GPU上,自主適配優化了下代架構的Qwen3.8-Flash新模型的推理框架,實現單實例推理吞吐量提升 96%。 在芯片模型協同設計上,Qwen3.8-Max僅基於一份真實的總線模塊規範,自主展開前端、驗證、後端的全鏈路自迭代,在自主運行超60小時、調用EDA工具超萬次後,完

剛剛
量子位生成式AI

阿里公佈全模態模型新進展,Qwen4和下代視頻模型均在訓練中

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 阿里公佈全模態模型新進展,Qwen4和下代視頻模型均在訓練中 量子位的朋友們 2026-09-22 11:42:43 來源:量子位 9月22日, 2026雲棲大會開幕,阿里巴巴公佈大模型最新進展。 9月22日, 2026雲棲大會開幕,阿里巴巴公佈大模型最新進展。在大語言模型LLM領域,Qwen3.8-Max在編程(Coding)和辦公(Cowork)領域表現強勁,發佈後斬獲Artificial Analysis Agentic智能體第一、CodeArena前端編程第一;基於下一代架構的Qwen4已投入訓練,未來Qwen4.5、Qwen5等後續版本模型參數將擴展至5到10萬億。在多模態領域,Qwen-Image-3.1性能有望逼近最強GPT-Image 系列,躋身全球前列;Qwen-Audio-3.1在ASR、TTS以及Realtime三個核心語音賽道均位列國際第一梯隊、國內第一,超越Gemini 3.1 TTS等國際頂尖模型;世界模型HappyOyster-2.0-Preview全新亮相,推動世界模型從實驗室走向真實可用;視頻生成模型Wan3.0斬獲Artificial Analysis 文生視頻與視頻編輯雙榜第一,同時,下一代視頻模型也在訓練中,擁有更強的生成力、控制力和理解力,推動AI從工具走向創作智能。 在最新的Artificial Analysis全球大模型排行榜上,Qwen3.8-Max從40提升到45分 阿里巴巴是最早佈局AI大模型的中國科技公司。從2019年起,阿里就開始著手AI大模型研究,陸續推出千問Qwen大語言模型系列,和萬相W

剛剛

華為雲碼道全面升級:全球首個鴻蒙專屬AI編碼智能體登場,從想法到上架一條龍

AI資訊AI新聞資訊正文華為雲碼道全面升級:全球首個鴻蒙專屬AI編碼智能體登場,從想法到上架一條龍發佈於AI新聞資訊發佈時間 :2026年9月22號 11:32閱讀 :1分鐘華為雲碼道CodeArts代碼智能體朝著鴻蒙開發者邁出了關鍵一步,一次性上線鴻蒙編碼大模型、碼道鴻蒙智能體和鴻蒙開發者實踐中心三大核心能力。官方給它的定位很硬:這是全球首個、也是目前唯一一個專為鴻蒙生態打造的AI編碼智能體,等於給鴻蒙開發者配了一位從頭跟到尾的數字搭檔。扛大樑的是鴻蒙編碼大模型。它依託鴻蒙增強訓練體系,在訓練數據、代碼生成、編譯通過率和Token消耗這幾個開發者最在意的維度上都佔著優勢,目前已經上線可調用。配套的鴻蒙編碼智能體則把能力鋪到了應用開發的全流程,內置DevEco CLI等首創能力和多項實用技能,讓編碼、調試、構建不再是一段段割裂的手動操作。為了讓新手也能快速上手,鴻蒙開發者實踐中心端出了多場景的實戰案例和雲端實踐環境,把開發門檻實實在在地降下來。這一整套升級的最終指向很清晰:打通鴻蒙開發者從想法到上架的全流程,幫他們頂住開發過程中的各種挑戰,把效率真正提起來。相關推薦蘋果零售先驅質疑AI代理購物:消費者不會完全交給機器蘋果零售業務早期負責人羅恩·約翰遜認為,儘管谷歌、OpenAI等投入巨資發展AI代理購物,覆蓋商品發現、比價和結賬,但AI代理難以取代實體店親身體驗。他曾為蘋果搭建零售網絡,堅持線下體驗價值。2026年9月22號 11:3790.9k阿里平頭哥發佈AI芯片真武V900,算力達M890三倍2026雲棲大會上,阿里平頭哥發佈國產AI芯片真武V900,算力較上代M890提升3倍,單一集群可擴展至50萬卡,支撐前沿AI模型訓練與推理。阿里稱芯片產品線成熟,年出貨量將大幅提升。吳泳銘透露,自研M890超節點已具備支撐2萬億參數大模型推理能力。2026年9月22號 11:1

剛剛

蘋果零售先驅質疑AI代理購物:消費者不會完全交給機器

AI資訊AI新聞資訊正文蘋果零售先驅質疑AI代理購物:消費者不會完全交給機器發佈於AI新聞資訊發佈時間 :2026年9月22號 11:37閱讀 :1分鐘近日,蘋果零售業務早期負責人羅恩·約翰遜認為,儘管科技公司正投入數十億美元推動“代理式商務”,但AI代理很難取代消費者在實體店中的親身體驗。現年66歲的約翰遜曾於2000年加入蘋果,負責搭建零售業務,並參與建立後來成為蘋果產品銷售與用戶服務核心的實體門店網絡。谷歌正通過Universal Commerce Protocol推動AI代理覆蓋商品發現、比較和結賬流程,OpenAI也在將ChatGPT打造為購物平臺。對此,約翰遜表示,很難想象消費者會讓AI代理在完全沒有親自體驗的情況下,直接購買價值1000美元至2000美元的筆記本電腦。他認為,消費者仍希望感受產品重量、查看屏幕並判斷尺寸,AI更適合在購買前幫助用戶縮小選擇範圍、提供信息,讓消費者進入門店時成為更瞭解產品的購物者。約翰遜表示,蘋果零售店最初的設計並非單純用於銷售,而是提供產品體驗、學習和售後支持。他認為,蘋果零售業務成功的關鍵在於員工及其服務方式,例如員工不拿銷售提成,以減少銷售壓力、專注理解用戶需求。離開蘋果後,約翰遜曾執掌JC Penney並創辦Enjoy Technology,後者於2022年申請破產。儘管對AI改變購物方式持謹慎態度,約翰遜仍表示看好AI,並認為喬布斯也會接受這項技術,但不會讓其取代人的判斷。“人類的直覺是無可替代的”,他認為AI更適合作為輔助工具,而非完全替代消費者決策。相關推薦微軟花 12 萬美元讓 AI 重寫 Copilot 運行時:43 萬行 TS 變 80 萬行 Rust,快 15.9 倍微軟用AI代理將GitHub Copilot運行時從TypeScript全量移植到Rust,僅花約12萬美元token成本和一名工程師三週。該運

剛剛
IT之家生成式AI

阿里 Qwen4 和下代視頻模型訓練中,Qwen4.5 後模型將擴展至 5-10T 參數

首頁 > 智能時代>人工智能 阿里 Qwen4 和下代視頻模型訓練中,Qwen4.5 後模型將擴展至 5-10T 參數 2026/9/22 11:41:58 來源:IT之家 作者:汪淼 責編:汪淼 評論: IT之家 9 月 22 日消息,IT之家今日從 2026 年雲棲大會現場獲悉,阿里巴巴公佈了大模型一系列進展,大模型遞歸自我改進(RSI)已初步進入模型訓練、推理及芯模協同等環節中,基於新一代架構的 Qwen4 已在訓練中,未來 Qwen4.5、Qwen5 等版本將擴展至 5-10T 參數。同時,阿里的視頻生成模型、語音模型、圖像模型、世界模型、音樂模型以及全模態模型等均在當天或近期推出新版本。阿里全新的下一代視頻生成模型將於 11 月發佈,朝著更長、更可控、更完整、更智能的方向演進:在更長的時間裡,新模型仍然能保持一致性,創作者可精準掌控人物、場景與鏡頭;同時,模型能具備導演級的創作思維,從生成單個鏡頭邁向理解完整敘事。本屆雲棲大會,阿里系統展示了千問大模型自我進化的最新探索成果:在模型自我訓練上,Qwen3.8-Max 通過自主搭建訓練流程、構造訓練數據,並自主設計實驗、定位缺陷,在人類完全“零參與”的情況下持續迭代超 1 個月,完成 33 輪有效迭代。基於 RSI、後訓練等系列技術聯合優化,Qwen3.8-Max 新版本在 Artificial Analysis 上的得分從 40 漲至 45 分,與 Claude、GPT 最強模型同處第一陣營,領先於 GLM5.3、Kimi-K3 等所有國產模型。在推理優化上,Qwen3.8-Max 在從未見過的平頭哥新款 GPU 上,自主適配優化了下代架構的 Qwen3.8-Flash 新模型的推理框架,實現單實例推理吞吐量提升 96%。在芯片模型協同設計上,Qwen3.8-Max 僅基於一份真實的總線模塊規範,自主展開前端、驗證

剛剛

阿里平頭哥發佈AI芯片真武V900,算力達M890三倍

基於真武V900構建的單一集群可擴展至50萬卡,可為前沿AI模型訓練與推理提供大規模算力支持。阿里表示,隨著平頭哥芯片產品線逐步成熟並獲得廣泛客戶應用,預計芯片年出貨量將大幅提升。阿里集團CEO吳泳銘透露,阿里自研M890AI超節點目前已具備支撐2萬億參數大模型推理的能力,並已於本季度規模化上架阿里雲數據中心。

剛剛