IT之家模型更新

芯展速 AI90 固態硬盤顯存化方案亮相:首 Token 延遲縮短至 1/50

2026年7月20日 11:57
芯展速 AI90 固態硬盤顯存化方案亮相:首 Token 延遲縮短至 1/50

重點摘要

首頁 > 智能時代>人工智能 芯展速 AI90 固態硬盤顯存化方案亮相:首 Token 延遲縮短至 1/50 2026/7/20 11:57:36 來源:IT之家 作者:溯波(實習) 責編:溯波 評論: IT之家 7 月 20 日消息,芯展速 (GenStorAIGE) 在 WAIC 2026 展出了其 AI90 軟硬件一體化 AI 推理加速方案。

站內 AI 整理稿

2026 年世界人工智能大會(WAIC)上,芯展速(GenStorAIGE)正式發表其 AI 推理加速軟硬體整合方案「AI90」。該方案打破傳統 GPU 顯示記憶體架構的限制,將高效能固態硬碟(SSD)納入顯存體系,形成全新的 HBM、DRAM 與 SSD 三級儲存層級,試圖解決大型語言模型推理時常見的記憶體瓶頸。 在大型語言模型執行推理時,需要暫存大量鍵值快取(KV Cache)。這些資料會迅速填滿高頻寬記憶體(HBM)與動態隨機存取記憶體(DRAM),導致系統必須頻繁交換資料,進而產生可觀延遲。芯展速提出的三級儲存體系讓 KV Cache 得以卸載至容量更大的固態硬碟,從根本上緩解記憶體容量不足的問題,同時保持資料存取效率。 根據芯展速在現場公布的數據,AI90 能將首個 Token 的生成延遲從原本的秒級大幅降低至亞秒級,達到 50 倍提速;整體吞吐量提升 5.1 倍;同時還能節省 39% 的顯示記憶體使用量。這些數據意味著,即使面對長上下文或高併發的推理請求,系統仍能保持即時反應,減少使用者等待時間。 除了儲存層面的創新,AI90 還整合智慧型點對點(P2P)多卡互聯技術,讓多張 GPU 之間能更有效率地協同運算。以 8 張 NVIDIA GeForce RTX 5090 顯示卡組成的叢集為例,啟用 AI90 後推理加速幅度可達 5.8 倍,並且能流暢支援超過 128K Token 的上下文長度,突破以往消費級硬體在處理超長文本時的限制。 要實現 KV Cache 高效卸載,固態硬碟必須具備極高寫入耐用度與低延遲特性。為此芯展速同步推出 PT200Z AI SSD。這款產品採用 pSLC(模擬單層儲存單元)快閃記憶體介質,並搭載 PCIe Gen5 介面,順序讀取速度達到 14.8 GB/s,隨機讀取高達 3100K IOPS,讀取延遲僅 54 微秒,寫入延遲更低至 10 微秒。最引人注意的是其 DWPD(每日全碟寫入次數)高達 100,代表每天能承受 100 次全碟寫入,充分滿足 KV Cache 頻繁寫入的嚴苛需求。 AI90 方案也包含軟體層面的最佳化。透過驅動層與推理框架的協同設計,系統能自動判斷何時將 KV Cache 搬移至 SSD、何時保留在 HBM 或 DRAM,達成效能與容量之間的最佳平衡。這種動態排程機制使得記憶體資源運用更具彈性。 這套方案的重要意義在於,它讓消費級 GPU 如 GeForce RTX 5090 也能在大型語言模型推理中展現接近專業級加速卡的表現。以往受限於顯示記憶體容量,許多企業或研究者必須添購昂貴的高階運算卡才能部署長上下文模型;AI90 的出現有機會大幅降低這類應用的硬體門檻,使更多團隊能以較低成本投入 AI 服務。 PT200Z 的設計特別針對 AI 推理場景中大量的隨機小區塊寫入。pSLC 模式透過將多層單元模擬為單層單元,換取更高的寫入速度與使用壽命,100 DWPD 的耐力值在同級產品中相當突出。這款 SSD 的規格讓它足以承擔長時間、高強度的 KV Cache 卸載工作,成為 AI90 整體效能的重要支柱。 芯展速在 WAIC 2026 現場展示了這套方案的實際運作情況,並說明後續將持續最佳化以支援更廣泛的 AI 模型架構。隨著大型語言模型應用的快速成長,如何讓推理更即時、成本更低已是業界共同課題,AI90 所提出的「顯存化 SSD」概念無疑為這個方向提供了一個值得關注的解方。

Related

相關文章

IT之家模型更新

月之暗面喊話馬斯克:歡迎加入“2 萬億 +”俱樂部

首頁 > 智能時代>人工智能 月之暗面喊話馬斯克:歡迎加入“2 萬億 +”俱樂部 2026/7/20 22:20:14 來源:IT之家 作者:浩渺 責編:浩渺 評論: IT之家 7 月 20 日消息,近日,月之暗面發佈的新一代開源大模型 Kimi K3 登頂全球榜單,引發廣泛關注。7 月 18 日上午,埃隆 · 馬斯克(Elon Musk)在社交平臺發文稱,旗下 2 萬億參數模型在各方面都優於當前的 1.

1 小時前

WAIC之夜:Token堆不出“AI原生”組織

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作WAIC之夜:Token堆不出“AI原生”組織36氪的朋友們·2026年07月20日 21:09Tokenmaxing的終局與新序章 2026年上半年,AI行業最熱的兩個詞是Agent和Tokenmaxing。前者意味著模型開始從“回答問題”走向“完成任務”,後者希望通過更長上下文、更多推理步驟和更高的Token消耗,換取更復雜的任務能力。 但Tokenmaxing很快暴露出另一面。為了讓公司成為更“AI原生”的組織,一些企業把Token消耗量當作轉型指標,甚至納入團隊KPI。調用量不斷增長,實際產出、任務完成率和商業回報卻未必同步提升。行業由此開始重新討論:Token真正的價值,究竟來自消耗規模,還是來自它所進入的產品、工作流和組織系統? 7月17日晚,在2026世界人工智能大會(WAIC)舉辦期間,由騰訊新聞、騰訊科技主辦,騰訊華東總部、騰訊雲智能特別支持的“騰訊WAIC之夜”在上海舉行。騰訊科技高級編輯、AI未來指北主理人郭曉靜主持首場圓桌,崑崙萬維董事長兼CEO方漢、出門問問創始人兼CEO李志飛、沐曦股份聯合創始人、CTO楊建,圍繞模型、產品與組織三個層面,討論了Tokenmaxing退潮後浮現出的新問題。

2 小時前

AI巨頭正在爭奪人類的錯題本

AI 巨頭之間的競賽正從算力、數據量,延伸到一個更細膩的戰場——人類的「錯題本」。過去,大規模、高品質的標註數據是模型訓練的關鍵,但隨著參數量與訓練資料逐漸飽和,業界開始意識到,單純的「正確答案」不再能拉開差距;真正能帶來複利效應的,是那些經過反饋修正的錯誤。每一次人類犯錯後被指正、被記錄的過程,都相當於為模型提供了一面鏡子,讓它更精準地理解邊界與上下文。

2 小時前
IT之家模型更新

OpenAI 高管批 Kimi K3 開源,硅谷多方駁斥其觀點

OpenAI 戰略負責人 Dean Ball 批評中國公司月之暗面的開源模型 Kimi K3,認為其可能帶來風險,並建議透過監管手段製造不確定性。此舉引發硅谷多位人士反駁,包括風險投資人 David Sacks,批評 OpenAI 試圖利用監管消滅開源競爭對手,並強調開放競爭的重要性。

3 小時前

WAICA正式啟航:打破全球AI學術版圖,上海迎來關鍵拼圖

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

4 小時前