AI應用的“最後一公里”,模型再強也繞不開數據困境丨ToB產業觀察

重點摘要
AI應用進入落地深水區,數據品質與基礎設施成為瓶頸,企業普遍面臨數據孤島、語義不一致與即時性不足等問題。數據虛擬化技術透過邏輯層整合分散數據源,無需物理搬遷,能有效提升數據準備效率、統一業務語義,並解決合規與權限控制難題,是AI實現價值的關鍵基礎。
AI應用落地卡在數據關卡,模型再強也繞不開這道檻。經歷了前兩年拼參數、拼算力的軍備競賽後,大模型產業已經進入深水區,企業更關心的不再是AI能做什麼,而是AI憑什麼能給出準確答案、做出可信決策。答案只有一個——數據。然而,多數企業的數據庫根本還跟不上AI應用的需求,數據孤島、口徑混亂、時效不足等老問題,正成為阻礙AI真正創造價值的頭號障礙。Gartner曾在報告中預測,到2025年,80%的數據與分析計畫將無法大規模創造業務價值,關鍵瓶頸就在數據孤島與數據品質。這項預測雖然略顯悲觀,但企業在實際落地AI項目時的感受卻完全吻合:模型訓練完成、推理框架也搭好了,一接上真實的企業數據,問題就立刻浮現。
Denodo全球銷售副總裁兼大中華區總裁何巍分享了一個極具代表性的案例:一家車企在推動AI問數項目時,所有數據雖然都存放在同一家頭部雲廠商的數據倉庫中,也就是來源單一,但查詢結果卻完全不可控。同一個問題問兩次,答案竟然截然不同。問題出在數據源本身就像一個堆滿雜物的巨大倉庫,不同部門、不同時期產生的數據雖然有統一的物理存放位置,但定義方式千差萬別。這並非單一事件。企業內部的訂單可能在三套系統中有三種完全不同的定義:銷售簽了合同叫訂單,財務收了錢才叫訂單,售後開始服務了才叫訂單。
當AI被要求計算訂單轉化率時,如果沒有人事先告訴它該用哪個系統的訂單當分子,它只能隨機抓取,結果自然是不可信的,而且每次計算結果也都不一樣。更麻煩的是,企業每天產生的數據量正在以指數級攀升。IDC預測,到2026年全球數據量將超過220ZB,企業級數據占比持續增加。傳統透過ETL(抽取、轉換、載入)將數據物理複製到集中式數據倉庫或數據湖的做法,變得越來越昂貴且低效。一家大型製造企業的IT負責人就算過一筆帳:每複製一份數據到數據中臺,就疊加一次儲存成本、計算成本與維運成本,而數據中臺的規模還在不斷擴張。傳統的數據集成方式就像線下會議,所有人必須坐在同一個會議室裡。
但當企業遍佈全球、數據分散在幾十甚至上百個系統時,這種物理集中的成本與難度已經高到不切實際。而AI對數據即時性的要求,更讓這個問題變得尖銳。過去數據中臺定期搬運數據,可能是T+1甚至更慢;但AI問數要求的是即問即答,用戶輸入一個問題,系統必須立刻從最新數據中給出答案。用昨天的數據回答今天的業務問題,在AI時代已經無法接受。面對這種困境,企業需要一套科學的數據架構,來回應AI對即時性、準確性、安全性與可解釋性的全新要求。數據虛擬化技術順勢成為關鍵中間件。與傳統ETL不同,數據虛擬化並不物理複製數據,而是透過軟體在各個分散的數據源之上建立一個邏輯層。
打個比方:傳統做法是把所有食材搬進中央廚房再開始做菜;數據虛擬化則是保留食材在各自的倉庫,只給廚師一張地圖,告訴他每種食材在哪裡、如何取得。這張地圖就是像Denodo這類企業所建構的AI數據層。它不儲存數據本身,只儲存數據的映射關係——一份關於數據在哪、什麼意思、誰能用的目錄。這麼做的好處首先是不需要遷移數據,靠連接所有數據源,避免了複製帶來的成本與延遲。根據Denodo的公開案例,使用其數據虛擬化平臺的企業,數據準備時間平均減少67%,相比傳統ETL方式節省65%的時間。例如,某企業原先處理一天數據需要八小時,採用數據虛擬化後,處理一個月的數據不到30分鐘。
這種效率提升在AI時代尤其關鍵,因為AI應用需要頻繁調用、組合不同系統的數據,如果每次都要等ETL跑完,用戶體驗和業務響應速度都會大打折扣。其次,在數據虛擬化架構中可以透過語義層解決各部門對訂單一詞認知不統一的問題。企業可在邏輯層預先定義一套統一的業務語義,明確告訴系統財務訂單與銷售訂單的區別,以及在不同場景下該用哪個。這樣當AI接收到用戶的自然語言提問時,語義層先將問題翻譯成數據能理解的語言,再由虛擬化層到各個數據源找到對應的數據。最後,這套架構解決了AI時代最關鍵的權限與合規問題。在物理集中式的數據架構中,權限控制往往一刀切,要麼能看全部數據,要麼什麼都看不到。
數據虛擬化層可以做到行級、列級的精細權限控制。對於跨國經營的企業,數據跨境傳輸是巨大的合規風險,數據虛擬化的邏輯連接方式讓原始數據可以留在原地不出境,只透過查詢介面被調用。這對正在大規模出海的中國企業來說,是極具吸引力的架構選擇。數據虛擬化並非全新建概念,之所以近年才獲得廣泛關注,根本原因在於企業數據環境的複雜度已到傳統方法無法承受的地步。一家企業的數據可能分佈在本地機房、多個公有雲、SaaS系統、IoT設備等數十個來源中,全部物理集中不僅成本高昂,而且永遠跟不上業務變化的速度。Denodo基於數據虛擬化技術建構的AI數據層,正好承接了企業當前的核心需求。
企業無需大規模遷移原始數據,就能打通全域數據鏈路,讓AI真正用上全域、即時、口徑一致的企業數據。2026年初,Gartner在雪梨舉行的數據與分析峰會上發出警告:59%的IT領導者表示在尚未做好準備的情況下便被推動採用生成式AI工具;61%的受訪者感受到來自高層的壓力。在這種被迫上馬的背景下,夯實數據基礎變得比以往任何時候都更加緊迫。何巍指出,如果三個月前問他模型是否足夠聰明到自己去理解數據,他的答案可能還不同;但在最近服務數百家企業之後,他得出的結論是:模型再強,也解決不了語義不統一的問題,因為語義問題本質是業務問題,不是技術問題,不是靠餵更多數據給模型就能解決的。
Denodo搭建的AI數據層作為承載統一業務語義、統籌合規數據資產的核心樞紐,能夠補齊企業數據治理的關鍵短板。今年7月上線的新版本Denodo Platform 9.5,大幅強化了平臺內部的語義與上下文智能能力,同時簡化企業內各團隊搭建、管理、共享可信數據產品的流程,讓智能體、BI分析工具、自助數據應用都能取得統一、即時、具備完整業務釋義的數據底座。在這套全新的數據管理體系下,企業不需要推翻原先的數據中臺。何巍表示,AI數據層可以作為數據中臺的補充而非替代,將中臺也作為一個數據源連接起來,避免重複搬運。今天的世界複雜到不會用一個技術解決所有問題。
數據中臺適合處理需要大量清洗、加工、貼標籤的確定性場景;數據虛擬化適合應對靈活、多變、即時的查詢需求。兩者是互補關係,而非替代關係。AI競爭的下半場,勝負手在於數據。企業若想突破AI落地的瓶頸,關鍵在於構建堅實的數據基礎設施。透過數據虛擬化等技術打造統一的AI數據層,打通數據孤島、統一業務語義,才能真正修好通往AI的最後一公里,讓模型發揮出應有的價值。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。