每秒 520 萬億次浮點運算,我國自研 AI 芯片取得架構突破

重點摘要
我國首顆採用軟件定義與三維近存計算技術的AI芯片在上海亮相,在14奈米製程上實現每秒520萬億次浮點運算。該晶片透過底層架構創新,突破對先進製程的依賴,並搭配完整軟硬體產品體系,為大模型訓練與推理提供支撐。
我國在AI晶片領域再迎新突破。7月13日,一顆採用軟體定義與三維近存計算技術的自研人工智慧晶片於上海正式亮相。這款晶片在14奈米製程工藝的基礎上,實現了每秒520萬億次浮點運算的算力,其最大亮點在於透過底層架構的創新,走出了一條不依賴先進製程的高端算力發展路徑。根據央視新聞的報導,這顆晶片所採用的技術路線結合了軟體定義晶片與三維近存計算兩大方向。在軟體定義方面,硬體資源能夠根據不同的任務需求進行動態調配,從而大幅提升算力的實際利用率;而在三維近存計算方面,透過垂直堆疊技術,將運算單元與儲存單元緊密整合在一起,使得訪存帶寬達到每秒6.
4TB,從架構層面有效緩解了長期困擾晶片設計的「儲存牆」瓶頸問題。報導進一步指出,由於不再單純依賴製程微縮來提升性能,這條技術路線在供應鏈方面更具穩定性和可控性。這意味著即使面對先進製程取得不易的現實,仍能透過架構創新實現高端算力的突破,為我國在晶片領域的自主發展提供了新的可能性。與此同時,與這顆晶片配套的全棧軟體工具鏈也同步發布。該工具鏈能夠相容於主流的深度學習框架,並已形成從單張加速卡、AI伺服器,到液冷超節點、大規模智算集群的完整產品體系。這套體系能夠為大型模型的訓練與推理提供規模化且可落地的算力支撐,有助於加速AI應用的實際部署。
業界普遍認為,這款晶片的問世標誌著我國在高端算力晶片領域,已探索出一條以架構創新取代製程追隨的自主發展新路徑。這對於夯實人工智慧的算力基礎,具有相當重要的意義。在技術層面,軟體定義晶片是一種新型的晶片設計範式。其核心精神在於透過軟體編程來動態定義和配置晶片的硬體功能,使同一塊晶片能夠靈活適應不同的計算任務。這項技術不僅能顯著提升晶片的通用性,也能兼顧更高的能效比,讓硬體資源不再被單一用途所綁定。而三維近存計算則是將計算單元與儲存器(如DRAM)在垂直方向進行三維堆疊整合。
這樣的設計能夠大幅縮短數據在計算與儲存單元之間的傳輸距離,有效突破傳統馮·諾伊曼架構中因「儲存牆」問題導致的數據傳輸瓶頸,進而提升整體的能效與計算性能。在AI晶片領域,除了追求算力峰值外,訪存帶寬同樣是衡量性能的關鍵指標。以英偉達的H100晶片為例,其採用HBM2e或HBM3高帶寬記憶體,帶寬約為2TB/s,而這款國產晶片的帶寬達到了6.4TB/s,展現出架構創新帶來的顯著優勢。所謂「儲存牆」問題,是指處理器計算速度的成長遠快於記憶體存取速度的成長,導致計算單元經常需要等待數據從記憶體中讀取或寫入,從而限制了整體系統性能。這是當前高性能計算和人工智慧領域面臨的核心挑戰之一。
此次透過三維近存計算技術,從架構層面直接應對這一問題,為提升整體運算效率提供了可行的解決方案。此外,全棧軟體工具鏈對於AI晶片的生態建構至關重要。它通常包含編譯器、驅動程式、執行時期庫、性能分析工具,以及對接主流深度學習框架(如TensorFlow、PyTorch)的介面。一套完善的工具鏈能夠大幅降低開發者的使用門檻,是晶片能否成功商業化、普及應用的關鍵因素。這次同步發布的配套工具鏈,顯示晶片從設計之初就著眼於生態的完整性與易用性。從整體布局來看,這款晶片不僅是一顆單獨的處理器,更圍繞其構建了從加速卡、伺服器到液冷超節點、大規模智算集群的完整產品線。
這意味著它能為從邊緣推論到雲端訓練的各種AI工作負載提供規模化算力支撐,對於推動國內自主AI基礎設施的建設具有實際意義。長期以來,全球高端AI晶片市場高度依賴先進製程,而先進製程的取得往往受限於地緣政治與供應鏈因素。此次以14奈米製程實現520萬億次浮點運算的算力,並透過架構創新突破「儲存牆」瓶頸,證實了不依賴極限微縮也能打造高效能AI晶片的可能性。這條自主技術路線的成熟,將使我國在高端算力領域具備更強的韌性與自主權。未來,隨著軟體生態的持續完善以及產品體系的大規模部署,這項技術有望在智慧城市、自動駕駛、科學計算、大語言模型等場景中發揮關鍵作用,進一步鞏固我國在人工智慧領域的競爭優勢。
業內專家也指出,這種以架構創新驅動的發展模式,值得在更多晶片設計領域推廣,為我國半導體產業提供一條差異化的突圍路徑。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。