雷峰網生成式AI

騰訊雲發佈智能數據湖計算 AI DLC,打通數據處理到 Agent 應用全流程

2026年7月30日 06:56

重點摘要

從數據處理到 Agent 的鏈路正在被大幅壓縮。7月30日,記者獲悉,騰訊雲正式發佈智能數據湖計算平臺AI DLC,面向自動駕駛、具身智能、Agent等AI場景,提供覆蓋數據處理、訓練、推理到 Agent 應用的一體化能力。以騰訊自研的 WorkBuddy 為例,接入 AI DLC 後,其處理同一批數據的端到端時間縮短80%,完成相同任務所需算力約為此前的五分之一。(騰訊雲智能湖計算AI DLC架構)長期以來,企業開發 AI 應用通常需要先用 Spark 完成數據清洗和加工,再將結果寫入存儲,由 AI 團隊通過 Ray 等框架完成訓練和推理。不同環節運行在不同平臺,數據需要反覆搬運,權限、元數據和算力資源也要分別管理。針對這一痛點,AI DLC 實現了 Spark 與 Ray 在同一平臺運行。Spark 負責大規模數據處理和特徵準備,Ray 承接多模態數據處理、模型訓練、在線推理和 Agent 任務。兩套框架共享數據、算力和權限體系,數據處理完成後即可直接進入訓練和推理,無需跨平臺搬運。AI DLC 採用 Serverless 架構,算力可按任務秒級彈性伸縮、按使用時長計費,企業無需預留和運維固定集群。據介紹,它也是業內首個在同一平臺提供生產級 Spark 與 Ray 全託管服務的計算平臺。在算力層面,AI DLC 將 CPU、GPU、TPU 等異構資源納入統一資源池,根據數據處理、訓練和推理任務動態調度。任務結束後,資源可自動釋放並分配給其他作業,減少固定集群長期閒置。平臺整體資源利用率可提升數倍,並已適配國產主流 GPU 芯片,幫助企業在自主可控的算力底座上運行 AI 負載。為進一步提升計算效率,AI DLC 搭載騰訊雲自研向量化計算引擎 Meson 和多模態計算引擎 Xpark。Meson 兼容 Spark API、SQL 語法及生態組件,在標準測試中查詢性能提升3.

站內 AI 整理稿

從數據處理到 Agent 的鏈路正在被大幅壓縮。7月30日,記者獲悉,騰訊雲正式發佈智能數據湖計算平臺AI DLC,面向自動駕駛、具身智能、Agent等AI場景,提供覆蓋數據處理、訓練、推理到 Agent 應用的一體化能力。以騰訊自研的 WorkBuddy 為例,接入 AI DLC 後,其處理同一批數據的端到端時間縮短80%,完成相同任務所需算力約為此前的五分之一。(騰訊雲智能湖計算AI DLC架構)長期以來,企業開發 AI 應用通常需要先用 Spark 完成數據清洗和加工,再將結果寫入存儲,由 AI 團隊通過 Ray 等框架完成訓練和推理。

不同環節運行在不同平臺,數據需要反覆搬運,權限、元數據和算力資源也要分別管理。針對這一痛點,AI DLC 實現了 Spark 與 Ray 在同一平臺運行。Spark 負責大規模數據處理和特徵準備,Ray 承接多模態數據處理、模型訓練、在線推理和 Agent 任務。兩套框架共享數據、算力和權限體系,數據處理完成後即可直接進入訓練和推理,無需跨平臺搬運。AI DLC 採用 Serverless 架構,算力可按任務秒級彈性伸縮、按使用時長計費,企業無需預留和運維固定集群。據介紹,它也是業內首個在同一平臺提供生產級 Spark 與 Ray 全託管服務的計算平臺。

在算力層面,AI DLC 將 CPU、GPU、TPU 等異構資源納入統一資源池,根據數據處理、訓練和推理任務動態調度。任務結束後,資源可自動釋放並分配給其他作業,減少固定集群長期閒置。平臺整體資源利用率可提升數倍,並已適配國產主流 GPU 芯片,幫助企業在自主可控的算力底座上運行 AI 負載。為進一步提升計算效率,AI DLC 搭載騰訊雲自研向量化計算引擎 Meson 和多模態計算引擎 Xpark。Meson 兼容 Spark API、SQL 語法及生態組件,在標準測試中查詢性能提升3.

6倍,部分複雜查詢最高加速5倍,CPU使用率下降近一半;Xpark 面向文檔、圖片和音視頻等多模態數據,提供50多種多模態和大模型算子,相比開源方案推理吞吐提升3倍,GPU利用率可長期接近100%。除支撐數據處理和模型訓練外,AI DLC 還面向 Agent 進行了升級。Agent 運行產生的軌跡、記憶和反饋可沉澱至數據湖,經過處理和後訓練後持續反哺 Agent;平臺同時通過 MCP、Skills 和 Open API 開放能力,讓 WorkBuddy、CodeBuddy 等 Agent 直接調用數據處理、訓練和分析能力。這一模式已在騰訊內部得到驗證。

WorkBuddy 運行過程中持續產生對話、文檔和用戶反饋等數據,部分單字段達到 GB 級,數據量月增速超過100%。接入 AI DLC 後,這些數據可直接完成清洗、特徵提取、模型後訓練和評估迴流,形成可複用的數據與訓練流水線。在自動駕駛場景中,博世測試車輛每天產生大量視頻和傳感器數據,抽幀和清洗主要消耗 CPU,數據脫敏,模型訓練與推理則依賴 GPU。通過博世ARENA統一管控平臺,博世將數據處理、推理和部分訓練任務納入統一調度。目前,其平臺已沉澱200多個推理模板,每天處理上萬個推理任務,持續提升自動駕駛數據閉環效率。

隨著企業 AI 應用從模型走向 Agent,數據平臺也正從支撐數據分析,升級為支撐 Agent 持續運行和迭代。在AI DLC之外,騰訊雲已圍繞 Agent-Ready 構建了覆蓋基礎引擎、統一控制面和上層 Data Agent 的完整數據平臺能力,助力企業加快數據資產向智能應用轉化。雷峰網 雷峰網

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

45 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前