登頂國際Data Agent榜單登頂國際Data Agent榜單,OceanBase超過多項GPT、Claude方案
近日, OceanBase團隊提交的Data Agent方案登頂國際數據智能體基準Data Agent Benchmark(簡稱DAB),以90.62%的準確率位列第一,成為該榜單首個準確率突破90%的參評方案。值得關注的是,這一成績由國產數據庫OceanBase基於國產大模型GLM-5.2構建,超過多項基於GPT、Claude Opus、Claude Fable等海外模型構建的Data Agent方案。本次參評方案內部代號為 Scout,相關能力將融入 OceanBase DataPilot。
(圖說:OceanBase登頂國際Data Agent榜單,成為首個準確率突破90%的參評方案)DAB由UC Berkeley EPIC Data Lab與Hasura PromptQL合作推出,評測覆蓋互聯網/本地生活、金融股票、生物醫學、知識產權、企業運營、政務/公共管理、媒體/文娛等多個領域,並涉及PostgreSQL、MongoDB、SQLite、DuckDB等多種數據庫。與傳統Text-to-SQL主要考察AI能否將自然語言轉換成SQL不同,DAB更關注AI進入真實數據環境後,能否從複雜、分散、形態各異的數據中找到正確答案。
一個完整任務中,Data Agent需要理解數據、選擇數據、規劃分析路徑、完成查詢計算,並對結果進行驗證,考驗的是從“理解數據”到“拿到答案”的完整能力。也正因此,DAB考驗的不只是底層模型,而是“模型+Agent+數據系統”的綜合能力。模型負責理解和推理,Agent負責規劃和執行,數據系統則要支撐數據發現、關聯計算和結果校驗。三者能否協同,直接影響AI能不能真正把企業數據用起來。OceanBase此次參評方案,正是圍繞這一能力構建。
系統通過DataLens構建數據畫像,識別字段和數據關係;再根據任務複雜程度規劃執行路徑,完成數據選擇、篩選、關聯和計算;得到結果後,還會通過證據追蹤和答案校驗檢查計算過程和結果,發現問題時調整方案並重新驗證,形成“數據理解—規劃執行—驗證修復”的閉環。這也解釋了此次90.62%成績的含金量:它不是單純證明國產模型能夠完成數據查詢,而是驗證了國產數據庫與國產模型結合後,能夠共同支撐複雜的數據分析任務。在底層模型採用GLM-5.2的情況下,OceanBase方案最終超過了多項採用GPT、Claude Opus、Claude Fable等海外模型構建的Data Agent方案。
對OceanBase而言,這也是其AI能力的一次新驗證。過去,數據庫主要負責存儲、查詢和處理數據。隨著AI Agent成為新的數據使用者,數據庫需要解決的問題也在變化:AI不僅要拿到數據,還要理解數據、關聯數據、分析數據,並驗證結果是否可靠。AI時代的數據底座,也因此開始從“把數據交給AI”,走向“幫助AI把數據用起來”。這正是OceanBase從數據庫向AI數據平臺演進的方向。OceanBase DataPilot是面向AI數據分析場景的產品方向。
本次DAB評測以內部代號Scout的方案提交,相關技術能力後續將沉澱到DataPilot產品中,進一步承接數據理解、任務規劃、分析執行和結果驗證等能力,讓AI從“調用數據”走向“用數據完成任務”。從數據庫到AI數據平臺,變化的不只是產品形態,更是數據庫與AI的關係:過去數據庫負責把數據存好、算好、取出來,如今還要幫助AI理解數據、組織數據並完成分析。此次登頂DAB,是OceanBase將數據庫能力進一步延伸到AI數據分析環節的一次驗證,也意味著數據庫正在從AI的數據底座,走向AI的數據工作引擎。
Related
相關文章

OpenAI自曝6起事故:AI安全的第一份"審計報告"由誰簽字?
舒澤品牌手記2026.09.21 18:11 · 來自浙江全文4308字00:00 / 12:47當安全事件變成定期披露,AI公司就從"出了大事再解釋"轉向"持續被審計"。文 | 舒澤品牌手記9月16日,OpenAI在官網掛出6份模型異常行為報告。

Gemini"越獄"入侵三家企業:谷歌壓了兩個月,四巨頭栽在同一家35人公司手裡
AI唱反調2026.09.21 18:02 · 來自北京全文2381字四起事故連起來看,真正的主角已經不是某一家模型,而是整個行業的安全評測體系。文 | AI唱反調AI圈最魔幻的劇情出現了:OpenAI、Anthropic、Meta、谷歌,四巨頭的模型越獄事故,測試方是同一家公司。

Anew labs,“蒸餾”的行家
醫曜2026.09.21 18:00 · 來自北京全文2781字00:00 / 08:07首款自研藥AN5162,me-too了Dice/禮來。文 | 醫曜AI圈如今言必稱"蒸餾"。蒸餾現有知識,蒸餾競爭對手,蒸餾員工技能,無物不可蒸餾。醫藥圈很少說蒸餾。但這個行業有一個耳熟能詳、讓人稍微有點不屑、卻又必須面對的詞——me-too:copy對手的骨架,在對手專利之外尋求突破。copy得好,是me-better,甚至是me-best(Best-in-Class);copy失敗呢?那就me-worse嘍。

Anthropic與字節扎堆AI製藥,下一個Coding風口卡在了數據這道坎上
Anthropic一邊自建溼實驗室,用來測試自家模型指揮生物實驗的能力,一邊牽手諾和諾德、百時美施貴寶,並把Coefficient Bio收入囊中;字節跳動分拆出來的新生實驗室也完成了首輪融資。被寄予厚望的AI,當下主要作用在把新藥早期研發的輪子轉得更快——壓縮候選分子的搜索空間和實驗迭代時間,但真正燒錢又耗時的臨床試驗環節卻難同步縮短,早期命中率提上來,並不等於臨床成功率就跟著漲。
Kimi Code 桌面客戶端上線:macOS 與 Windows 同步開放
針對開發者的實際工作流,桌面端提供內置終端、瀏覽器和 Git 狀態查看等功能,支持直接運行和調試項目、審閱代碼改動,並可關聯 PR 狀態,方便跟蹤代碼評審與合併進度。相關推薦法國興業銀行押注 AI:預計最多省下 6 億歐元成本法國興業銀行稱,AI應用擴大將帶來可觀降本空間,潛在規模約5億至6億歐元,其中已規劃到2029年實現約3.

法國興業銀行押注 AI:預計最多省下 6 億歐元成本
這家總部位於巴黎的銀行表示,藉助 AI 實現降本的當前潛在空間介於 5 億至 6 億歐元(約合 38.47 億至 46.16 億元人民幣)之間。其中,到 2029 年為止已經落實規劃的降本規模約為 3.5 億歐元(約合 26.93 億元人民幣)。