登頂國際Data Agent榜單,OceanBase超過多項GPT、Claude方案

2026年9月21日 14:17
站內 AI 整理稿

AI資訊AI新聞資訊正文登頂國際Data Agent榜單,OceanBase超過多項GPT、Claude方案發佈於AI新聞資訊發佈時間 :2026年9月21號 14:08閱讀 :1分鐘近日, OceanBase團隊提交的Data Agent方案登頂國際數據智能體基準Data Agent Benchmark(簡稱DAB),以90.62%的準確率位列第一,成為該榜單首個準確率突破90%的參評方案。值得關注的是,這一成績由國產數據庫OceanBase基於國產大模型GLM-5.2構建,超過多項基於GPT、Claude Opus、Claude Fable等海外模型構建的Data Agent方案。

本次參評方案內部代號為 Scout,相關能力將融入 OceanBase DataPilot。(圖說:OceanBase登頂國際Data Agent榜單,成為首個準確率突破90%的參評方案)DAB由UC Berkeley EPIC Data Lab與Hasura PromptQL合作推出,評測覆蓋互聯網/本地生活、金融股票、生物醫學、知識產權、企業運營、政務/公共管理、媒體/文娛等多個領域,並涉及PostgreSQL、MongoDB、SQLite、DuckDB等多種數據庫。

與傳統Text-to-SQL主要考察AI能否將自然語言轉換成SQL不同,DAB更關注AI進入真實數據環境後,能否從複雜、分散、形態各異的數據中找到正確答案。一個完整任務中,Data Agent需要理解數據、選擇數據、規劃分析路徑、完成查詢計算,並對結果進行驗證,考驗的是從“理解數據”到“拿到答案”的完整能力。也正因此,DAB考驗的不只是底層模型,而是“模型+Agent+數據系統”的綜合能力。模型負責理解和推理,Agent負責規劃和執行,數據系統則要支撐數據發現、關聯計算和結果校驗。三者能否協同,直接影響AI能不能真正把企業數據用起來。OceanBase此次參評方案,正是圍繞這一能力構建。

系統通過DataLens構建數據畫像,識別字段和數據關係;再根據任務複雜程度規劃執行路徑,完成數據選擇、篩選、關聯和計算;得到結果後,還會通過證據追蹤和答案校驗檢查計算過程和結果,發現問題時調整方案並重新驗證,形成“數據理解—規劃執行—驗證修復”的閉環。這也解釋了此次90.62%成績的含金量:它不是單純證明國產模型能夠完成數據查詢,而是驗證了國產數據庫與國產模型結合後,能夠共同支撐複雜的數據分析任務。在底層模型採用GLM-5.2的情況下,OceanBase方案最終超過了多項採用GPT、Claude Opus、Claude Fable等海外模型構建的Data Agent方案。

對OceanBase而言,這也是其AI能力的一次新驗證。過去,數據庫主要負責存儲、查詢和處理數據。隨著AI Agent成為新的數據使用者,數據庫需要解決的問題也在變化:AI不僅要拿到數據,還要理解數據、關聯數據、分析數據,並驗證結果是否可靠。AI時代的數據底座,也因此開始從“把數據交給AI”,走向“幫助AI把數據用起來”。這正是OceanBase從數據庫向AI數據平臺演進的方向。OceanBase DataPilot是面向AI數據分析場景的產品方向。

本次DAB評測以內部代號Scout的方案提交,相關技術能力後續將沉澱到DataPilot產品中,進一步承接數據理解、任務規劃、分析執行和結果驗證等能力,讓AI從“調用數據”走向“用數據完成任務”。從數據庫到AI數據平臺,變化的不只是產品形態,更是數據庫與AI的關係:過去數據庫負責把數據存好、算好、取出來,如今還要幫助AI理解數據、組織數據並完成分析。此次登頂DAB,是OceanBase將數據庫能力進一步延伸到AI數據分析環節的一次驗證,也意味著數據庫正在從AI的數據底座,走向AI的數據工作引擎。

相關推薦告別天價Token:AI企業Writer推出Palmyra X6與架構升級,力求將使用成本砍半企業AI部署成本壓力加劇,開源模型雖能降低單token費用,但精準選型困難。面向營銷人員的AI公司Writer推出旗艦模型Palmyra X6,基於開源GLM-5.2深度後訓練調整,旨在提供更契合業務需求的低成本方案。2026年8月14號 9:52158.3kOceanBase公開靈光AI應用數據架構,支撐3000萬閃應用運行OceanBase首次公開支撐螞蟻靈光AI應用的數據架構:以邏輯表、共享物理存儲和受控SQL計算實現應用模型獨立、資源共享,為AI生成應用提供數據底座。

已累計生成約3000萬個閃應用,應對AI時代海量Agent應用的挑戰。2026年8月6號 11:25260.4k從分佈式數據庫到 AI 數據平臺:OceanBase 尋求獨立融資並加速全球化佈局據彭博社報道,分佈式數據庫廠商 OceanBase 正在與多家頭部機構洽談20億至30億元人民幣的 A 輪融資,旨在增強獨立運營能力並加速向 AI 數據平臺拓展。知情人士透露,OceanBase2026年年化收入已超14億元,同比增長約70%,擁有包括交通銀行、中國移動在內的數千家客戶,並已佈局東南亞、日本、印度和拉美等海外市場。螞蟻集團、OceanBase 及螞蟻數科均未回應置評請求。

技術與產品方面,OceanBase 誕生於2010年,歷經多年“雙十一”流量考驗,據 IDC 報告其2025年在中國分佈式數據庫本地部署市場份額位居第一。目前公司對標 Databricks,從核心交易系統向企業全量數據管理及 Agent 數據供給延伸,加強非結構化數據處理,並已於今年6月推出新一代湖庫一體 AI 數據庫推進商業化。公司自2024年設立獨立董事會並建立獨立股權激勵機制以來,市場化進程顯著加快。此次融資標誌著 OceanBase 在獨立運營上邁出關鍵一步,也體現出螞蟻集團創新業務正逐步建立獨立的治理與融資機制,加速走向外部市場檢驗。2026年7月29號 16:13267.

9k智譜完成約314億港元配售 資金將用於大模型技術研發與算力建設智譜完成約314.1億港元配售,資金用於基座模型研發、算力建設、商業化及全球生態佈局。公司強調長期競爭力取決於底層技術突破,其核心基座模型GLM-5.2已進入全球前沿競爭區間。2026年7月9號 10:33274.6kOceanBase發佈湖庫一體AI數據庫:讓Agent真正“讀懂”企業大模型與算力快速突破,但企業AI落地價值未達預期,業界焦點正從模型轉向數據。OceanBase發佈湖庫一體AI數據庫,融合數據湖海量存儲、數據庫事務分析及多模態處理,構建強一致數據底座,為AI Agent提供高效支撐。

2026年6月29號 16:06232.3k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

Claude Opus 5. 5 疑遭內測洩露:跳級直衝GPT-6,百萬Token價格腰斬至 4 美元

AI資訊AI新聞資訊正文Claude Opus 5. 5 疑遭內測洩露:跳級直衝GPT-6,百萬Token價格腰斬至 4 美元發佈於AI新聞資訊發佈時間 :2026年9月21號 15:09閱讀 :1分鐘所有人都在守著Opus5.2的檔期,可Anthropic這回偏不按常理出牌。最新線報顯示,下一代版本號直接飆到了5.5——代號為claude-wafer-eap的Claude Opus5.5已經在悄悄內測,最早由開發者Lyra扒出猛料,動作快的話本週二就會突然砸向市場。更扎眼的是流出的定價單:每百萬Token輸入只要4美元,輸出20美元,擺明瞭是衝著GPT-6去的,據傳性能直接把Astra踩在腳下。與此同時,Claude Fable5.2也在暗中鋪路,Anthropic一套雙管齊下的組合拳,節奏卡得異常精準。這場突襲的時機格外耐人尋味。兩天前外媒剛爆出,Anthropic在IPO之前必須甩出一個重磅模型來穩住市場信心,如今兩張底牌一掀,好戲才剛開場。回看時間線更覺反常:7月24日Claude Opus5正式發佈,其間短暫冒出過一個5.2的測試checkpoint,現在乾脆跳去5.5。這家公司從一開始就沒打算做常規迭代,而是奔著放大招去的。真正上手測過的開發者Harshith說了句大實話,Opus5.5這波直接贏麻了,比之前的Fable5.1和Astra都要頂。他反手就讓5.5搓了個Waymo無人車的3D模型,還原度高得嚇人,連捷豹的車標、車頂的激光雷達傳感器這些小細節都生成得明明白白。更關鍵的是成本只要Opus5的一半,從Token消耗能感受那恐怖的產出量:輸入才1.4k,輸出整整532k,緩存跑了41.2M讀取加1.7M寫入。開發者Veee也下場湊熱鬧,讓Opus5.5基於Three.js寫了個網頁端3D汽車展示器,渲染質量和交互都相當紮實;再換個更硬核的測試,它甚至能一把

剛剛

Claude Opus 5.5 已在內測:連跳兩級直逼 GPT-6,價格還打骨折

AI資訊AI新聞資訊正文Claude Opus 5.5 已在內測:連跳兩級直逼 GPT-6,價格還打骨折發佈於AI新聞資訊發佈時間 :2026年9月21號 15:11閱讀 :1分鐘所有人都在等 Opus 5.2,結果最新線報顯示下一代版本號直接飆到 5.5。今天一早,開發者 Lyra 扒出猛料:代號“claude-wafer-eap”的 Claude Opus 5.5 已在偷偷內測,據說動作快的話本週二就會突然發佈。定價傳言:輸入 4 美元、輸出 20 美元擺明瞭,Opus 5.5 就是衝著 GPT-6 去的。更狠的是隨之曝光的定價單:每百萬 Token 輸入只要 4 美元、輸出 20 美元,對比現役 Opus 5 的 5 美元 / 25 美元,降幅約 20%。關鍵在於緩存機制的大幅優化——緩存讀取降至每百萬 Token 0.2 美元、緩存寫入為 5 美元。0.2 美元的緩存讀取單價,意味著企業構建長時、長上下文自主 Agent 系統的開銷將暴跌一個數量級。按這一價格策略,Anthropic 正在把頂級模型從“奢侈品”變成“日用品”。版本節奏也頗為反常:7 月 24 日 Claude Opus 5 正式發佈,此後短暫出現過 5.2 的測試 checkpoint,如今又跳到 5.5。參與內測的開發者 Harshith 表示,“Opus 5.5 這波直接贏麻了,比之前的 Fable 5.1 和 Astra 都要頂”,並讓 5.5 生成了一個 Waymo 無人車 3D 模型,連捷豹車標、頂部激光雷達傳感器等細節都清晰還原,成本僅為 Opus 5 的一半。另有開發者用 Three.js 做網頁端 3D 汽車展示器、“瓦力機器人”控制台,UI 佈局與機械綁定都相當紮實。Fable 這條線也有新動靜:開發者 Pankaj Kumar 放出了 Fable 5.2 的嚐鮮體驗,稱官方似乎正

剛剛

阿里換帥Qwen團隊:劉大一恆接掌通義千問大模型,雲棲大會前亮相

AI資訊AI新聞資訊正文阿里換帥Qwen團隊:劉大一恆接掌通義千問大模型,雲棲大會前亮相發佈於AI新聞資訊發佈時間 :2026年9月21號 15:13閱讀 :1分鐘阿里巴巴集團已任命資深AI研究人員劉大一恆擔任Qwen(通義千問)大語言模型團隊負責人,這一人事變動由兩位知情員工向外透露。今年以來,Qwen團隊歷經多輪組織重組,劉大一恆的到任進一步釐清了團隊的管理層架構,也意味著這條核心AI產品線有了明確的一把手。這一任命的時點頗為微妙。阿里巴巴一年一度的雲棲大會將於本週二開幕,在大會官網的演講嘉賓名單頁面上,劉大一恆的個人肖像被放在了十分靠前的位置,緊隨集團主席蔡崇信、首席執行官吳泳銘之後,官網對其職務的標註正是Qwen大語言模型項目負責人。在年度技術盛會的聚光燈下高調露面,無疑是為這位新掌門人鋪好了登場舞臺。相關推薦通義千問開源 Qwen-Image-2.1:7B 參數實現文生圖與圖像編輯一體化9月21日,通義千問團隊開源新一代圖像模型Qwen-Image-2.1。該模型以僅7B參數的輕量視覺生成模塊,統一文生圖、透明圖像生成與多種圖像編輯能力,實現生成效果、推理效率與使用成本的新平衡。其視覺生成採用32層Single-Stream DiT結構,藉助混合粒度注意力與KV Cache複用機制,優化多圖輸入場景下的效率與表現。2026年9月21號 9:10163.9k通義千問官方點贊!Unsloth Dynamic V3 讓 Qwen3.8-27B 更小更聰明,1-bit 版 8GB 內存就能跑通義千問官方公開致謝 Unsloth 團隊,高度認可其發佈的 Qwen3.8-27B GGUF 量化版本,稱其“更小更聰明”。此舉在開源社區引發熱議,凸顯本地大模型部署門檻持續降低,官方鼓勵用戶嘗試該版本。2026年8月20號 15:57302.6k顛覆認知!擺脫獨立顯卡束縛,阿里5n

剛剛
量子位生成式AI

GPT-6 Astra開進機器人身體!清華聯手無問芯穹等開源RPent

清華大學、無問芯穹與正行創新聯合開源具身智能體基礎設施RPent,讓通用大模型作為機器人決策大腦,結合VLA等專家模型完成精細操作並形成感知-決策-執行-糾錯閉環。RPent在LIBERO-PRO基準測試中達到92.6%任務成功率,並將端到端任務完成速度優化7倍以上。

剛剛
鈦媒體生成式AI

AI能救電視臺嗎?

虛眸2026.09.21 13:39 · 來自北京全文3888字00:00 / 11:54不是彎道超車,是救命稻草。文 | 虛眸在AI的潮流面前,電視臺也不想被落下。 9月17日,《後西遊記》原班人馬製作的AIGC紀錄片《臺灣島紀》在湖南衛視、芒果TV播出,加上即將在國慶期間上線的《後西遊記》“戰天宮篇”,不到一個月時間裡,湖南廣電緊鑼密鼓發佈了三部AI長篇敘事的作品。嚐鮮AI內容的不止湖南衛視,包括江蘇、浙江、安徽、廣東等還保持著一定號召力的地方衛視,都將AI內容納入了電視臺供給庫中。

剛剛

阿里 70 億參數圖像模型Qwen-Image-2. 1 開源發佈,號稱以瘦身之軀叫板閉源巨頭

最讓人意外的是它的身板——視覺生成組件僅用70億參數,卻在自家的評測基準上壓過了市面上絕大多數閉源模型。團隊放話底氣十足,不過第三方獨立評測尚在趕來的路上,這份成績單還需時間檢驗。更接地氣的是,它不挑設備,一塊像RTX3090這樣的主流消費級顯卡就能托起它跑起來。

剛剛