IT之家模型更新

芯展速 AI90 固態硬盤顯存化方案亮相:首 Token 延遲縮短至 1/50

2026年7月20日 11:57
芯展速 AI90 固態硬盤顯存化方案亮相:首 Token 延遲縮短至 1/50

重點摘要

首頁 > 智能時代>人工智能 芯展速 AI90 固態硬盤顯存化方案亮相:首 Token 延遲縮短至 1/50 2026/7/20 11:57:36 來源:IT之家 作者:溯波(實習) 責編:溯波 評論: IT之家 7 月 20 日消息,芯展速 (GenStorAIGE) 在 WAIC 2026 展出了其 AI90 軟硬件一體化 AI 推理加速方案。

站內 AI 整理稿

2026 年世界人工智能大會(WAIC)上,芯展速(GenStorAIGE)正式發表其 AI 推理加速軟硬體整合方案「AI90」。該方案打破傳統 GPU 顯示記憶體架構的限制,將高效能固態硬碟(SSD)納入顯存體系,形成全新的 HBM、DRAM 與 SSD 三級儲存層級,試圖解決大型語言模型推理時常見的記憶體瓶頸。在大型語言模型執行推理時,需要暫存大量鍵值快取(KV Cache)。這些資料會迅速填滿高頻寬記憶體(HBM)與動態隨機存取記憶體(DRAM),導致系統必須頻繁交換資料,進而產生可觀延遲。

芯展速提出的三級儲存體系讓 KV Cache 得以卸載至容量更大的固態硬碟,從根本上緩解記憶體容量不足的問題,同時保持資料存取效率。根據芯展速在現場公布的數據,AI90 能將首個 Token 的生成延遲從原本的秒級大幅降低至亞秒級,達到 50 倍提速;整體吞吐量提升 5.1 倍;同時還能節省 39% 的顯示記憶體使用量。這些數據意味著,即使面對長上下文或高併發的推理請求,系統仍能保持即時反應,減少使用者等待時間。除了儲存層面的創新,AI90 還整合智慧型點對點(P2P)多卡互聯技術,讓多張 GPU 之間能更有效率地協同運算。

以 8 張 NVIDIA GeForce RTX 5090 顯示卡組成的叢集為例,啟用 AI90 後推理加速幅度可達 5.8 倍,並且能流暢支援超過 128K Token 的上下文長度,突破以往消費級硬體在處理超長文本時的限制。要實現 KV Cache 高效卸載,固態硬碟必須具備極高寫入耐用度與低延遲特性。為此芯展速同步推出 PT200Z AI SSD。這款產品採用 pSLC(模擬單層儲存單元)快閃記憶體介質,並搭載 PCIe Gen5 介面,順序讀取速度達到 14.8 GB/s,隨機讀取高達 3100K IOPS,讀取延遲僅 54 微秒,寫入延遲更低至 10 微秒。

最引人注意的是其 DWPD(每日全碟寫入次數)高達 100,代表每天能承受 100 次全碟寫入,充分滿足 KV Cache 頻繁寫入的嚴苛需求。AI90 方案也包含軟體層面的最佳化。透過驅動層與推理框架的協同設計,系統能自動判斷何時將 KV Cache 搬移至 SSD、何時保留在 HBM 或 DRAM,達成效能與容量之間的最佳平衡。這種動態排程機制使得記憶體資源運用更具彈性。這套方案的重要意義在於,它讓消費級 GPU 如 GeForce RTX 5090 也能在大型語言模型推理中展現接近專業級加速卡的表現。

以往受限於顯示記憶體容量,許多企業或研究者必須添購昂貴的高階運算卡才能部署長上下文模型;AI90 的出現有機會大幅降低這類應用的硬體門檻,使更多團隊能以較低成本投入 AI 服務。PT200Z 的設計特別針對 AI 推理場景中大量的隨機小區塊寫入。pSLC 模式透過將多層單元模擬為單層單元,換取更高的寫入速度與使用壽命,100 DWPD 的耐力值在同級產品中相當突出。這款 SSD 的規格讓它足以承擔長時間、高強度的 KV Cache 卸載工作,成為 AI90 整體效能的重要支柱。芯展速在 WAIC 2026 現場展示了這套方案的實際運作情況,並說明後續將持續最佳化以支援更廣泛的 AI 模型架構。

隨著大型語言模型應用的快速成長,如何讓推理更即時、成本更低已是業界共同課題,AI90 所提出的「顯存化 SSD」概念無疑為這個方向提供了一個值得關注的解方。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

51 分鐘前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

52 分鐘前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

1 小時前