騰訊雲發佈智能數據湖計算 AI DLC,打通數據處理到 Agent 應用全流程
重點摘要
從數據處理到 Agent 的鏈路正在被大幅壓縮。7月30日,記者獲悉,騰訊雲正式發佈智能數據湖計算平臺AI DLC,面向自動駕駛、具身智能、Agent等AI場景,提供覆蓋數據處理、訓練、推理到 Agent 應用的一體化能力。以騰訊自研的 WorkBuddy 為例,接入 AI DLC 後,其處理同一批數據的端到端時間縮短80%,完成相同任務所需算力約為此前的五分之一。(騰訊雲智能湖計算AI DLC架構)長期以來,企業開發 AI 應用通常需要先用 Spark 完成數據清洗和加工,再將結果寫入存儲,由 AI 團隊通過 Ray 等框架完成訓練和推理。不同環節運行在不同平臺,數據需要反覆搬運,權限、元數據和算力資源也要分別管理。針對這一痛點,AI DLC 實現了 Spark 與 Ray 在同一平臺運行。Spark 負責大規模數據處理和特徵準備,Ray 承接多模態數據處理、模型訓練、在線推理和 Agent 任務。兩套框架共享數據、算力和權限體系,數據處理完成後即可直接進入訓練和推理,無需跨平臺搬運。AI DLC 採用 Serverless 架構,算力可按任務秒級彈性伸縮、按使用時長計費,企業無需預留和運維固定集群。據介紹,它也是業內首個在同一平臺提供生產級 Spark 與 Ray 全託管服務的計算平臺。在算力層面,AI DLC 將 CPU、GPU、TPU 等異構資源納入統一資源池,根據數據處理、訓練和推理任務動態調度。任務結束後,資源可自動釋放並分配給其他作業,減少固定集群長期閒置。平臺整體資源利用率可提升數倍,並已適配國產主流 GPU 芯片,幫助企業在自主可控的算力底座上運行 AI 負載。為進一步提升計算效率,AI DLC 搭載騰訊雲自研向量化計算引擎 Meson 和多模態計算引擎 Xpark。Meson 兼容 Spark API、SQL 語法及生態組件,在標準測試中查詢性能提升3.
從數據處理到 Agent 的鏈路正在被大幅壓縮。7月30日,記者獲悉,騰訊雲正式發佈智能數據湖計算平臺AI DLC,面向自動駕駛、具身智能、Agent等AI場景,提供覆蓋數據處理、訓練、推理到 Agent 應用的一體化能力。以騰訊自研的 WorkBuddy 為例,接入 AI DLC 後,其處理同一批數據的端到端時間縮短80%,完成相同任務所需算力約為此前的五分之一。(騰訊雲智能湖計算AI DLC架構)長期以來,企業開發 AI 應用通常需要先用 Spark 完成數據清洗和加工,再將結果寫入存儲,由 AI 團隊通過 Ray 等框架完成訓練和推理。
不同環節運行在不同平臺,數據需要反覆搬運,權限、元數據和算力資源也要分別管理。針對這一痛點,AI DLC 實現了 Spark 與 Ray 在同一平臺運行。Spark 負責大規模數據處理和特徵準備,Ray 承接多模態數據處理、模型訓練、在線推理和 Agent 任務。兩套框架共享數據、算力和權限體系,數據處理完成後即可直接進入訓練和推理,無需跨平臺搬運。AI DLC 採用 Serverless 架構,算力可按任務秒級彈性伸縮、按使用時長計費,企業無需預留和運維固定集群。據介紹,它也是業內首個在同一平臺提供生產級 Spark 與 Ray 全託管服務的計算平臺。
在算力層面,AI DLC 將 CPU、GPU、TPU 等異構資源納入統一資源池,根據數據處理、訓練和推理任務動態調度。任務結束後,資源可自動釋放並分配給其他作業,減少固定集群長期閒置。平臺整體資源利用率可提升數倍,並已適配國產主流 GPU 芯片,幫助企業在自主可控的算力底座上運行 AI 負載。為進一步提升計算效率,AI DLC 搭載騰訊雲自研向量化計算引擎 Meson 和多模態計算引擎 Xpark。Meson 兼容 Spark API、SQL 語法及生態組件,在標準測試中查詢性能提升3.
6倍,部分複雜查詢最高加速5倍,CPU使用率下降近一半;Xpark 面向文檔、圖片和音視頻等多模態數據,提供50多種多模態和大模型算子,相比開源方案推理吞吐提升3倍,GPU利用率可長期接近100%。除支撐數據處理和模型訓練外,AI DLC 還面向 Agent 進行了升級。Agent 運行產生的軌跡、記憶和反饋可沉澱至數據湖,經過處理和後訓練後持續反哺 Agent;平臺同時通過 MCP、Skills 和 Open API 開放能力,讓 WorkBuddy、CodeBuddy 等 Agent 直接調用數據處理、訓練和分析能力。這一模式已在騰訊內部得到驗證。
WorkBuddy 運行過程中持續產生對話、文檔和用戶反饋等數據,部分單字段達到 GB 級,數據量月增速超過100%。接入 AI DLC 後,這些數據可直接完成清洗、特徵提取、模型後訓練和評估迴流,形成可複用的數據與訓練流水線。在自動駕駛場景中,博世測試車輛每天產生大量視頻和傳感器數據,抽幀和清洗主要消耗 CPU,數據脫敏,模型訓練與推理則依賴 GPU。通過博世ARENA統一管控平臺,博世將數據處理、推理和部分訓練任務納入統一調度。目前,其平臺已沉澱200多個推理模板,每天處理上萬個推理任務,持續提升自動駕駛數據閉環效率。
隨著企業 AI 應用從模型走向 Agent,數據平臺也正從支撐數據分析,升級為支撐 Agent 持續運行和迭代。在AI DLC之外,騰訊雲已圍繞 Agent-Ready 構建了覆蓋基礎引擎、統一控制面和上層 Data Agent 的完整數據平臺能力,助力企業加快數據資產向智能應用轉化。雷峰網 雷峰網
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。