MarkTechPost AI生成式AI

Supabase Releases Evals: an Open Source Benchmark That Scores Claude Code, Codex and OpenCode on Real Supabase Tasks

2026年8月1日 09:52

重點摘要

Supabase has open sourced Supabase Evals, its benchmark and framework for testing how well AI agents build using Supabase.

站內 AI 整理稿

Supabase 宣布將內部用於評估 AI 代理開發能力的基準測試框架 Supabase Evals 開源。這套框架能讓 Claude Code、Codex、OpenCode 等程式碼代理在真實的 Supabase 任務上接受測試,例如從零建立資料表結構、除錯失敗的 Edge Function,或是修復中斷的 RLS 政策,接著自動為執行結果評分。目前 Supabase 已將這套機制公開在 supabase.com/evals 排行榜上,同時也作為公司內部每天監控的迴歸測試套件使用。 Supabase Evals 今日起正式對外開放,程式碼以 Apache-2.0 授權發布於 GitHub 的 supabase/evals 儲存庫,開發者可直接透過 pnpm 在本地端執行。不過,要在本機完整跑起來需要先滿足幾個條件,包括安裝並啟動 Docker daemon、具備雲端服務供應商的 API 金鑰,以及保留 54321 到 54329 的連接埠給測試環境使用。 根據 Supabase 的說法,Evals 的設計不只是簡單的提示測試,而是從三個維度定義任務:產品維度涵蓋資料庫、身分驗證、儲存、邊緣函式、即時功能、cron、佇列、向量與 Data API;主題維度包括 RLS、安全性、遷移、SQL、SDK、可觀測性、自托管、測試與聲明式 schema;階段維度則分為建構、部署、調查與解決。這套分類系統讓團隊能清楚掌握測試範圍,也能針對特定產品或技能進行聚焦評估。 為了讓場景盡可能貼近實際使用情境,Supabase 團隊從官方支援工單、錯誤回報以及 GitHub issues 中挑選出最小的場景組合,確保每個維度至少被觸及一次。這些場景被分為兩個套件:基準測試場景著重涵蓋廣度,且所有結果都會公開;回歸測試場景則專門追蹤已知的失敗模式,每天自動更新,但不會改動已經發布的排行榜分數。 每個評測場景都會在真實環境中執行,而不是使用模擬物件。框架會同時啟動一組類似於托管服務的 Supabase 堆疊,以及一個放在容器中的本地 CLI 專案,因此代理必須呼叫實際的 Supabase MCP 伺服器與 CLI 工具。此外,一個名為 platform-lite 的輕量執行環境會暴露與 Management API 相容的介面,背後的運作則由 @supabase/lite 支撐。這樣的設計確保代理所面對的環境,與開發者日常使用的服務盡可能一致。 評分方式分為兩層。第一層使用確定性檢查,例如確認使用者是否能夠存取特定資料,或 Edge Function 是否回傳預期結果;第二層則借助 LLM-as-a-judge 的機制,對需要語意判斷的結果進行評估。為了避免誤判,代理在正式評分前有一次重試的機會,這既減少偶發失敗造成的假性負面結果,也讓整個流程維持在合理成本內。 每個評測項目都以完整的資料夾形式存放,其中 PROMPT.md 定義代理看到的任務描述與 frontmatter 標記,EVAL.ts 負責輸出評分邏輯,另外還可選擇提供 remote/ 與 local/ 兩種起始狀態。若提供 local/ 工作區,或明確宣告 interface: cli,框架就會啟動一個預先安裝好真實 CLI 的 Docker 沙盒環境,讓代理在與實務相同的情境下開始工作。 Supabase 指出,這套框架的應用場景相當廣泛,包括對文件更新或技能調整進行迴歸測試、在 SDK 發布前作為品質關卡,或是並排比較不同代理框架的實際表現。由於代理一旦寫出錯誤的 RLS 政策,很可能直接變成資安事件,因此對於金融科技、醫療等監管嚴格的產業來說,Evals 特別具有參考價值,而整體而言也適用於開發者工具、雲端基礎設施與數據平台等領域。 Supabase 在發布文章中也分享了一些初步觀察。數據顯示,Codex / GPT-5.6 在每個場景平均會閱讀約 8 頁文件,而 Claude Code 平均只閱讀約 2 頁,且即使在載入技能的情況下,Claude Code 仍會在不到 40% 的場景中查閱文件。另外,團隊改寫了 Postgres 最佳實踐技能的功能描述後,該技能被代理啟動的頻率從約每 10 次對話 1 次,提升到大約 60%,可見提示與技能描述本身的品質也會直接影響代理行為。 這些數據是擷取自 Supabase 於 2026 年 7 月 31 日發布的介紹文章,隨著模型持續改版,排行榜分數也會跟著變動,讀者可隨時前往 supabase.com/evals 查看最新結果。整體而言,Supabase Evals 將真實任務轉化為可重複執行的評測流程,為 AI 代理在後端開發領域的可靠性建立更透明、可驗證的評估基礎,也讓開發者能更清楚地掌握目前主流程式碼代理在 Supabase 生態系中的實際能力。

Related

相關文章

何夕2077生成式AI

深度求索發佈閃電模型更新

Ad Skip to content All Topics AI and society AI in practice AI research Frontier Radar Short News Read full article about: Google Deepmind unveils Gemini Robotics 2 to power robots of all shapes from tabletop arms to humanoids Google Deepmind has introduced Gemini Robotics 2, which it calls its most advanced vision-language-action (VLA) model yet. VLA models combine image recognition, language processing, and action control to help robots operate in physical environments. Deepmind says the model can control systems ranging from tabletop arms to full-body humanoid robots. The company describes Gemini Robotics 2 as an "intelligence layer" for a new generation of adaptive robots. It can manage full-body movement, perform fine motor tasks, and coordinate multiple robots, according to Deepmind.

12 小時前
何夕2077生成式AI

潛推理推薦模型實現大幅提速

研究團隊提出潛在推理推薦框架WhisperRec,將教師生成的鏈式思考壓縮為可學習的潛在推理token,避免顯式推理的延遲瓶頸。實驗顯示,WhisperRec在工業級快手資料集與公開基準上,其SID@64指標較顯式CoT方法提升17.44%,且線上推論吞吐量提升超過10倍。

12 小時前
何夕2077生成式AI

新型控制器優化大模型搜索成本

大型語言模型的應用場景持續擴張,除了聊天與程式生成之外,愈來愈多科學與演算法研究開始借助模型在推論階段進行自動化搜索,從大量候選結果中尋找最佳解答。然而,這類搜索過程往往需要消耗大量運算資源,尤其在不同提示長度、重試次數與引導呼叫的組合下,每次行動所付出的 token 成本並不相同,讓成本控管成為實際部署時的重要挑戰。一篇近期發表於 arXiv 的研究論文,針對此問題提出了一套全新的控制器機制,試圖在有限預算下,讓模型搜索既能維持品質,又不讓成本失控。

12 小時前
何夕2077生成式AI

前特斯拉大牛探討編程範式轉變

前特斯拉大牛探討編程範式轉變。 專家聲稱傳統編程正被大模型徹底顛覆。用戶在紅迪討論貼中可細讀現場觀點。他認為上下文窗口已成了新的控制槓桿。很多開發者仍用老標準衡量自身價值。這一趨勢讓不少資深程序員 ��� 感到焦慮。

12 小時前
雷峰網生成式AI

誰在訓練 Kimi K3 ? 深挖貢獻者名單,這有一份最全檔案

起底 K3 背後核心極客天團,人均扛起 7 億估值! 作者丨高允毅 樊天驕 編輯丨馬曉寧 7 月 27 日,月之暗面拿出全部誠意,直接把滿血版 2.8T 模型 Kimi K3 全部開源了。在技術報告的最後,他們首次公佈了Kimi K3背後的實際貢獻者名單,我們細數了一下,有401位成員,可以說,這是月之暗麵人才團隊的一次全面亮相。

1 天前
雷峰網生成式AI

AI 正在變成一門製造業 | WAIC 2026 Agent 產品觀察

國內 Agent 產品當前主要是供給側繁榮,不是需求側繁榮。 作者丨李 娜 編輯丨馬曉寧 2026 年的 WAIC 真是太熱鬧了,人潮擁擠,在地鐵站排著隊進入 WAIC 場館的時候, 我看見地鐵站廣告牌上的百度智能體“百度搭子”的廣告,這場關於智能體沒有硝煙的戰爭,從入口處就拉開了帷幕。

1 天前