同一集群,利用率提升33個百分點:改變的只有順序

2026年8月17日 19:46
站內 AI 整理稿

在企業人工智慧應用的快速發展過程中,運算資源的有效調度已逐漸取代模型本身的智慧水準,成為推動基礎設施效能的關鍵瓶頸。過去,市場上始終缺乏一套成熟且經得起驗證的 GPU 管理實務指引,導致多數雲端或企業內部的運算集群仍仰賴傳統的先進先出(FIFO)排程機制。這種排程方式雖然邏輯簡單、易於實作,卻往往無法因應多樣化的工作負載特性,使得大量 GPU 在等待佇列中處於閒置狀態,整體利用率始終難以突破。隨著大型語言模型與生成式 AI 的訓練與推論需求急速成長,閒置資源所浪費的運算成本與時間,已成為企業 IT 部門必須正視的嚴峻挑戰。

為了解決這個結構性問題,一群研究人員開發出一套具備約束感知能力的新型 GPU 分配器。這套分配器的核心思路極為直接:不更動任何硬體設備,也不調整工作負載本身的內容,僅改變任務在集群中的排程順序,就能顯著提升資源的使用效率。換句話說,他們試圖證明,在相同的一組 GPU 與相同的一批任務條件下,過去因為不當的排程順序而產生的閒置時間,並非不可避免;只要用更聰明的方式決定「誰先跑、誰後跑」,就能把原本被浪費的運算循環重新轉化為有效產出。這項研究的驗證方式相當嚴謹。研究團隊在七組基準測試場景中,將這套新的約束感知分配器與傳統 FIFO 調度器放在完全相同的硬體集群上,執行完全相同的工作負載。

兩組實驗的唯一變數,就是任務被排進 GPU 佇列的先後順序。結果顯示,僅因為順序安排的差異,GPU 利用率便提升了整整 33 個百分點。這個數字並非來自於硬體升級或負載削減,而是完全來自於排程邏輯的優化,凸顯了調度演算法在現代 AI 基礎設施中的巨大潛力。FIFO 排程之所以效率低落,主因在於它無法感知任務之間的資源需求差異與相依關係。例如,某個大型訓練任務可能需要佔用全部 GPU 很長時間,但如果將它往後排,讓一批小型推論任務先利用短暫的空檔完成,整體吞吐量就能顯著上升。

然而,真實的集群中任務類型極其多樣,有長有短、有密集運算也有大量資料傳輸,FIFO 完全忽略這些特性,導致大型任務卡住佇列前方時,後方的小任務只能等待,造成 GPU 週期性的空轉浪費。約束感知分配的設計思路,正是要為每個任務建立一套資源需求的「約束條件」,包括所需的 GPU 數量、預估執行時間、對記憶體與頻寬的需求,以及是否可中斷或可搶佔等屬性。調度器根據這些條件,在每次決策時尋找能最大化整體利用率且不違反任何約束的排程順序。這聽起來像是在作整數規畫,但研究團隊實作的演算法能在毫秒級別完成決策,實際佈署時對作業系統的額外負擔極小。

值得注意的是,這項成果並不要求企業更換現有的 GPU 型號或添購新的伺服器。在當前 GPU 供貨緊張、價格高昂的市場環境下,能從既有資產中擠出超過三成的有效運算力,對許多正在建置 AI 基礎設施的公司來說,無疑是一條極具吸引力的捷徑。33 個百分點意味著原本只能跑 100 個任務的集群,在完全不增加硬體投資的前提下,現在可以跑出相當於 133 個任務的產出,或者讓原本需要跑一週的訓練作業縮短將近四分之一的工作天數。此外,這項研究也為產業提供了一套具體可參考的實務路徑。

過去許多 IT 團隊在管理 GPU 集群時,往往只能憑經驗手動調整任務佇列,或者仰賴雲端服務商內建的預設排程器,缺乏客觀的數據支撐來證明某種排程策略確實優於另一種。研究團隊透過七組基準測試,以公開可複現的方式證明:單純改變順序就能帶來量化且穩定的改善。這不僅有助於說服管理層投資於排程系統的改造,也讓開發者能有一套明確的對照標準來評估自身集群的優化空間。當然,這項技術並非萬靈丹。它的適用前提是工作負載具有多樣性——如果所有任務的資源需求幾乎一模一樣,那麼任何排程順序的影響都會趨近於零。

此外,約束感知調度需要對任務的特徵有一定程度的了解,例如預估執行時間或資源使用曲線,這在某些高度動態或快速迭代的環境中可能難以取得。不過,對於大多數企業 AI 場景,尤其是混合了訓練與推論、長任務與短任務、不同模型大小的情況,這套方法仍然具有極高的實用價值。從更大的視角來看,GPU 利用率提升 33 個百分點代表的並不僅僅是單一技術指標的進步。它反映出 AI 基礎設施正從「堆疊硬體」的粗放模式,轉向「優化調度」的精細化營運。當模型智慧遇到天花板,運算效率就成了決定企業 AI 落地速度的關鍵變數。

而這項研究以最低的成本——只改軟體排程順序——換來顯著的效益,為整個產業指出了一條務實且可立即採取行動的改善方向。未來,我們很可能會看到更多企業將 GPU 排程器的設計提升到與模型架構同等重要的戰略位置,因為在同樣的硬體預算下,誰能榨出更多有效計算力,誰就能在 AI 競賽中取得領先。

Related

相關文章

WRC 2026|原生全模態世界模型:從模擬世界到交互世界

世界機器人大會期間,智象未來創辦人梅濤於「物理AI引領者論壇」發表演講,提出原生全模態世界模型從「模擬世界」走向「交互世界」的觀點。他強調即使AI模型智商接近140,高IQ不代表全能,需具備在真實物理世界中穩定完成任務的能力,此為Physical AI發展的關鍵。論壇聚焦通用物理智慧的技術演進與產業路徑,匯聚眾多專家參與。

剛剛

阿里巴巴達摩院推出肝癌 AI 模型:可精準識別 1 釐米微小腫瘤

作者:遠洋 責編:遠洋 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,阿里巴巴達摩院聯合中國醫科大學附屬盛京醫院等機構研發出肝癌診斷 AI 模型 DAMO LiON,可通過 CT 影像識別微小的肝臟癌變病灶。在兩個月的真實世界前瞻臨床試驗中,該 AI 模型發現了 15 例原本被遺漏的惡性腫瘤,絕大部分為 1 釐米左右的病灶,幫助患者得到及時的手術或藥物治療。

剛剛
何夕2077研究與前沿

棋類模型可解釋

在人工智慧研究領域,模型的可解釋性一直是備受關注的課題。近期有觀點指出,棋類模型具備可解釋的特性,這意味著此類模型的決策過程與內部運作機制,能夠被研究者或使用者以相對直觀的方式理解與分析。相較於許多深度學習模型常被視為「黑箱」,棋類模型在處理圍棋、象棋等棋類遊戲時,其每一步的選擇與策略推演,往往能透過棋譜或演算法邏輯加以回溯,從而為AI的透明化提供了一個具體的觀察窗口。

8 小時前

美國專家示警:學生依賴“AI 代寫”會削弱思考能力

作者:清源 責編:清源 評論: 8 月 23 日消息,美國學生使用 AI 完成作業、甚至代寫整篇論文的現象已經十分普遍,也有不少學校允許學生在一定範圍內藉助 AI 工具。據《紐約時報》當地時間 17 日報道,越來越多專家擔心,問題可能不只是學生會不會寫文章,而是長期依賴 AI 可能削弱他們本身的思考能力。

12 小時前