一臺GPU用了三年,為什麼租金反而更貴了?

2026年8月26日 08:00
站內 AI 整理稿

在AI芯片快速迭代的今天,上一代GPU並沒有像傳統硬件一樣迅速貶值。“我們2023年部署的那批H100芯片,如今出租價格甚至高於最初上線時。”近日,雲服務商Lambda聯合創始人兼CTO Stephen Balaban在播客節目The MAD Podcast中表示。這並不是某代芯片的“傳奇故事”。過去,人們曾期待GPU算力最終會像傳統雲計算資源一樣,隨著供應增加和硬件迭代逐漸標準化、商品化:性能越來越高,價格越來越低,不同供應商之間的差異也越來越小。但AI算力並沒有完全沿著這條路徑發展。

一張GPU能夠提供多少價值,越來越取決於它被放進怎樣的系統、如何與其他GPU協同,以及這些昂貴設備能否持續被利用。芯片性能仍然重要,但它已經很難單獨解釋一套AI基礎設施能夠交付多少算力。那麼,為什麼GPU供應越來越多、產品迭代越來越快,算力卻還沒有像電力或帶寬一樣成為真正標準化的商品?01算力不是加法題,超節點難在協同前沿大模型正在改變的,並不是算力如何計價,而是算力在什麼層級上被商品化。在最上層,AI服務正在把模型輸出逐漸標準化為Token,並按Token計費。從這個意義上看,客戶最終購買的計算結果,已經具備越來越明顯的商品屬性。

但在這些Token背後,生產它們的算力系統卻遠沒有實現同樣程度的標準化。原因之一是,前沿AI任務已經很難由一張GPU獨立完成。模型參數、計算任務和數據需要被拆分到多張GPU甚至多臺服務器上,一次訓練或推理能否順利向前,不再只取決於單張芯片算得有多快,還取決於這些GPU之間能否快速交換數據。這讓AI算力出現了一個和傳統標準化計算資源不同的問題:同樣數量、同樣型號的GPU,並不一定能夠交付同樣的計算能力。如果GPU之間通信效率不足,芯片就可能花更多時間等待數據;網絡拓撲、內存、存儲以及軟件組織方式的差異,也都會影響最終能夠發揮出的算力。

新增一張GPU,因此並不意味著系統就能獲得一張GPU標稱性能對應的新增產出。也正是在這種背景下,超節點開始成為AI Infra的重要形態。所謂超節點,並不是簡單增加GPU數量,而是通過高速互聯,把多顆GPU組織成一個緊密協同的計算單元,儘量降低GPU之間交換數據的成本,讓它們像一臺更大的機器一樣工作。Balaban以英偉達GB300 NVL72為例,一個機架內的72顆GPU通過NVLink高速互聯;多個機架進一步擴展時,則通過InfiniBand或高速以太網連接。Lambda建設的大型GPU集群還會採用儘量減少網絡阻塞的架構,讓不同GPU之間獲得足夠的通信帶寬。

這種系統能力首先服務於大規模訓練,但前沿推理也越來越依賴多GPU協同。Balaban提到,小型、經過壓縮的模型可以放進單張GPU;更大的模型則可能需要跨多顆GPU、服務器甚至機架運行。因此,GPU型號和數量仍然決定了一套系統擁有多少計算資源,卻越來越難單獨代表這些資源最終能夠交付多少算力。這也是AI算力系統難以迅速變成標準商品的關鍵:芯片本身可以標準化,但芯片如何被組織起來,以及最終能夠發揮多少性能,仍然高度依賴整套系統。02GPU的三套時鐘:換代、折舊與經濟壽命如果AI算力系統不是一種標準商品,那麼“一張GPU值多少錢”,也很難只由芯片型號決定。

Balaban稱,在一個GPU小時的成本中,佔比最大的是設備折舊。GPU、服務器和網絡設備採購後會使用多年,最初的投入需要被分攤到後續每一個實際使用小時中。這背後是一門典型的重資產生意。按照Balaban的估算,一座千兆瓦級AI工廠中,發電設施需要約20億至30億美元,數據中心本體約100億至150億美元,而服務器和計算設備的投入可達350億至450億美元,其中GPU又佔據最大的一部分。因此,判斷一張GPU的價值,不能只看它是不是最新一代,更要看它在整個使用週期裡還能持續承擔多少計算任務、產生多少收入。

這也是Balaban判斷舊一代GPU仍有較長經濟壽命的原因:只要設備仍然能夠承擔計算任務,並且有持續需求,它就不會因為新一代芯片上市而立刻失去經濟價值。Balaban還提到,不少公司採用約六年的會計折舊週期,但賬面折舊年限不等於設備實際能使用多久,更不等於它還能產生收入多久。只要H100仍能承擔計算任務,又有人願意租用,它的經濟壽命就可能比市場早期預想得更長。換句話說,GPU存在至少三套不同的“時間尺度”計量系統:產品迭代決定它是不是最新一代,會計折舊決定賬面成本如何分攤,而經濟壽命決定它究竟還能產生多久的收入。這也是AI算力系統沒有迅速商品化的另一個原因。

客戶真正需要的,不只是GPU,還包括高速網絡、存儲、CPU服務器,以及把這些設備組織成集群的軟件。訓練和推理任務能否運行,取決於整套系統是否能夠共同交付計算能力。這種系統複雜性,也解釋了為什麼Neocloud(AI算力雲)不能被簡單理解為GPU出租商。Balaban認為,GPU算力並不是一種簡單的標準商品,它背後是一項縱向整合的服務,範圍從土地、電力許可、數據中心建設,一直延伸到高性能計算設計、虛擬化和雲軟件。當算力變成這樣一門重資產、強運營的生意,決定成本的下一個問題也隨之出現:這些昂貴設備,到底有多少時間真正處於工作狀態?

03GPU利用率正在拉開Token成本差距一張GPU能工作多久,決定了它還能創造多少價值;而一整套GPU系統能以多高效率工作,則決定了算力最終有多貴。對客戶而言,Token可以按統一單位計價;但在數據中心內部,每一個Token背後的生產成本卻千差萬別。Balaban給出了一條從能源到Token的鏈條:最開頭是陽光、天然氣等能源,它們經過發電設施轉化為電力;電力進入數據中心後,一部分用於驅動服務器運行,一部分消耗在製冷、配電等基礎設施中;GPU、網絡和存儲再共同完成計算,最終由模型生成Token並交付給用戶。沿著這條鏈路,同樣一座數據中心、同樣數量的GPU,並不意味著同樣的Token產出。

電力利用效率、GPU之間的通信效率、模型和軟件優化,都會影響能源和設備最終能夠轉化成多少計算結果。而在Balaban看來,其中一個極其現實的變量就是利用率。GPU、服務器和網絡設備不會因為沒有任務就停止折舊。如果一張GPU只有一半時間真正用於計算,那麼它的設備成本就只能由更少的實際使用小時來承擔。Balaban舉例稱,在50%的利用率下,每個實際GPU小時需要承擔的折舊成本相當於翻倍。因此,AI基礎設施面臨的問題並不只是“有沒有GPU”,而是昂貴的GPU能不能儘可能少地閒置。但到了大型集群,這已經不是找到一張空閒GPU那麼簡單。

Balaban介紹,一個萬卡級GPU集群除了GPU本身,還包括負責組織任務的CPU服務器、存儲系統,以及承擔不同功能的多套網絡。當客戶申請其中一部分算力時,供應商實際上需要同時為這項任務劃分計算、存儲和網絡資源,並保證這些資源能夠共同工作。這也是調度和集群軟件的價值。它們決定一批昂貴的物理設備能否被拆分、組合,再持續交付給不同客戶。如果沒有這層軟件能力,一座擁有大量GPU的數據中心,也很難真正把這些設備變成可以按需使用的算力。當AI Infra進入超節點和大型集群時代,買下GPU只是投入的開始。

真正決定算力成本的,是這些昂貴設備能否長期保持運轉,並在網絡、存儲和軟件的配合下持續完成訓練和推理任務。GPU仍然是最昂貴的設備,但決定算力價值的,已經不再只是GPU本身。▼推薦閱讀▼一個請求錯配了GPU,AI推理可能慢100倍2026-08-14GPU堆到萬卡之後,最貴的問題變成了「空轉」2026-08-10

Related

相關文章

鈦媒體生成式AI

買場景、建團隊、借渠道,OpenAI如何做企業服務

買場景、建團隊、借渠道,OpenAI如何做企業服務窄播2026.08.26 18:36 · 來自江蘇全文3610字00:00 / 10:57大模型能力的普及降低了企業使用AI的門檻,而商業上限越來越取決於對場景、流程和組織的理解。文 | 窄播,作者|李威兩個幾乎同時發佈的消息,在釋放出同一個信號。IBM宣佈與OpenAI建立戰略合作,把GPT-5.6、Codex和ChatGPT Work接入IBM Consulting Advantage,併成立由數千名顧問和工程師組成的OpenAI專項團隊。同一周,獲得OpenAI投資的Thrive Holdings以120億美元估值融資20億美元,它在通過收購會計、IT服務公司,將AI融入工作流中。這兩件事共同表明,OpenAI的to B商業化在從「向企業出售工具」,延伸向直接進入並參與重構服務交付;從模型供應商,變成企業AI服務的直接參與者。過去,OpenAI是提供API,軟件公司包裝產品,諮詢公司負責實施。現在,這條分工線開始鬆動。模型公司、資本和諮詢機構共同湧入交付層,爭奪客戶、工作流、行業經驗和業務結果的定義權。這種變化不只出現在OpenAI身上。在中國市場,字節進一步組合豆包、飛書和火山引擎;騰訊WorkBuddy要擴展為連接辦公生態與行業系統的企業平臺;阿里新推出的千問辦公為釘釘留出了接口;WPS也推出了組織級AI辦公產品WPS Comate。他們都試圖將互聯網時代的企業服務經驗與AI辦公產品緊密結合起來,讓其變成進入AI企業服務最後一公里的優勢。企業買到模型,不等於獲得生產力。真正的障礙還包括哪些流程值得改造,如何連接數據、權限和舊系統,怎樣讓Agent符合行業規則,又用什麼指標證明項目產生了收入或成本收益。這些經驗過去大多沉澱在企業服務公司、諮詢公司和系統集成商手中。OpenAI的種種佈局,都是為了拿到這些。金山辦公CE

剛剛
IT之家生成式AI

智譜確認 Ox Alpha AI 模型為 GLM 系列新版本,將發佈權重

首頁 > 智能時代>人工智能 智譜確認 Ox Alpha AI 模型為 GLM 系列新版本,將發佈權重 2026/8/26 18:23:42 來源:IT之家 作者:沁滄(實習) 責編:沁滄 評論: 感謝IT之家網友 咩咩洋、Big_Cake 的線索投遞! IT之家 8 月 26 日消息,據彭博社報道,智譜證實了外界猜測,確認 Ox Alpha 模型正是其 GLM 系列的新版本,並表示將於今晚正式發佈該模型的權重。據IT之家此前報道,全球最大 AI 聚合平臺 OpenRouter 於 8 月 20 日上線匿名 AI 模型 Ox Alpha,在預覽期間免費使用。該模型上線後調用量迅速攀升,短時間內衝至該平臺榜首,並刷新單日模型用量紀錄。終端編程智能體 OpenCode 也通過其免費套餐提供該模型,並聲稱每日可處理 100 萬億個 token。研究人員此前通過對 25 個提示詞進行分詞器指紋分析,發現 Ox Alpha 的 token 數量與 GLM-5.3 幾乎完全吻合,僅存在恆定 75 個 token 的包裝層偏差。此外,視頻編碼器的行為模式和 API 響應特徵也與智譜的架構高度吻合。 投訴水文 我要糾錯 下載IT之家APP,簽到賺金幣兌豪禮 相關文章關鍵詞:智譜,Ox Alpha,GLM中國 AI 為什麼追得這麼快?美媒找到一批關鍵人物AI 大模型周榜:國產 glm-5.3-max 首秀闖入綜合榜前 15,kimi-k3-max 衝進前十智譜 GLM-5.3 模型 API 上線,權重下週五開源“蝦蝦大腦”升級:榮耀 YOYO Claw 官宣接入智譜最新發布的 GLM-5.3 大模型智譜正式發佈 GLM-5.3:編程能力最強開源模型,較 GLM-5.2 提升 50%智譜宣佈 ZCode 全面升級,GLM Coding Plan 全員額度回滿

剛剛
量子位生成式AI

硅谷今日最熱具身模型!不用後訓練,看一遍就學會

北美機器人新創Skild AI發布基礎模型S1,主打上下文學習,機器人只需觀看人類示範影片,無需後訓練即可完成煎餅、泡咖啡、植物換盆等長達10分鐘以上的複雜任務,在未見過任務上成功率達66%,遠高於傳統語言提示VLA的9%。相較之下,傳統後訓練需約380次示範才能達到同等水準,顯示機器人學習新技能的成本可望大幅降低。

剛剛
鈦媒體生成式AI

全棧AI,其實是個陷阱?

字母榜2026.08.26 13:32 · 來自北京全文8282字00:00 / 23:43All in AI並不是終點。文 | 字母榜全棧AI,現在差不多已經成為大廠的標配。幾乎所有科技巨頭都在同一個方向使力:把AI產業鏈上越來越多的環節收入自己手裡。於是模型公司操心芯片、數據中心和電力;雲廠商開始訓練自己的模型;手機廠商在補AI能力;社交平臺也在押注Agent和下一代終端。OpenAI可能是今天“全棧AI”野心最明顯的公司之一。

剛剛
鈦媒體生成式AI

養老社區裡的AI試驗

鵬程說2026.08.26 13:07 · 來自廣東全文3566字00:00 / 11:17人工智能進入產業實際場景,需要與業務流程、專業人員和組織體系深度融合。長壽時代,養老行業正在進入一個更復雜的供給階段。民政部、全國老齡辦近日發佈的《2025年度國家老齡事業發展公報》顯示,截至2025年末,我國60歲及以上人口達到3.2338億,佔總人口的23%;65歲及以上人口達到2.2365億,佔總人口的15.9%。

剛剛