Supabase Releases Evals: an Open Source Benchmark That Scores Claude Code, Codex and OpenCode on Real Supabase Tasks
重點摘要
Supabase has open sourced Supabase Evals, its benchmark and framework for testing how well AI agents build using Supabase.
Supabase 宣布將內部用於評估 AI 代理開發能力的基準測試框架 Supabase Evals 開源。這套框架能讓 Claude Code、Codex、OpenCode 等程式碼代理在真實的 Supabase 任務上接受測試,例如從零建立資料表結構、除錯失敗的 Edge Function,或是修復中斷的 RLS 政策,接著自動為執行結果評分。目前 Supabase 已將這套機制公開在 supabase.com/evals 排行榜上,同時也作為公司內部每天監控的迴歸測試套件使用。Supabase Evals 今日起正式對外開放,程式碼以 Apache-2.
0 授權發布於 GitHub 的 supabase/evals 儲存庫,開發者可直接透過 pnpm 在本地端執行。不過,要在本機完整跑起來需要先滿足幾個條件,包括安裝並啟動 Docker daemon、具備雲端服務供應商的 API 金鑰,以及保留 54321 到 54329 的連接埠給測試環境使用。
根據 Supabase 的說法,Evals 的設計不只是簡單的提示測試,而是從三個維度定義任務:產品維度涵蓋資料庫、身分驗證、儲存、邊緣函式、即時功能、cron、佇列、向量與 Data API;主題維度包括 RLS、安全性、遷移、SQL、SDK、可觀測性、自托管、測試與聲明式 schema;階段維度則分為建構、部署、調查與解決。這套分類系統讓團隊能清楚掌握測試範圍,也能針對特定產品或技能進行聚焦評估。為了讓場景盡可能貼近實際使用情境,Supabase 團隊從官方支援工單、錯誤回報以及 GitHub issues 中挑選出最小的場景組合,確保每個維度至少被觸及一次。
這些場景被分為兩個套件:基準測試場景著重涵蓋廣度,且所有結果都會公開;回歸測試場景則專門追蹤已知的失敗模式,每天自動更新,但不會改動已經發布的排行榜分數。每個評測場景都會在真實環境中執行,而不是使用模擬物件。框架會同時啟動一組類似於托管服務的 Supabase 堆疊,以及一個放在容器中的本地 CLI 專案,因此代理必須呼叫實際的 Supabase MCP 伺服器與 CLI 工具。此外,一個名為 platform-lite 的輕量執行環境會暴露與 Management API 相容的介面,背後的運作則由 @supabase/lite 支撐。
這樣的設計確保代理所面對的環境,與開發者日常使用的服務盡可能一致。評分方式分為兩層。第一層使用確定性檢查,例如確認使用者是否能夠存取特定資料,或 Edge Function 是否回傳預期結果;第二層則借助 LLM-as-a-judge 的機制,對需要語意判斷的結果進行評估。為了避免誤判,代理在正式評分前有一次重試的機會,這既減少偶發失敗造成的假性負面結果,也讓整個流程維持在合理成本內。每個評測項目都以完整的資料夾形式存放,其中 PROMPT.md 定義代理看到的任務描述與 frontmatter 標記,EVAL.
ts 負責輸出評分邏輯,另外還可選擇提供 remote/ 與 local/ 兩種起始狀態。若提供 local/ 工作區,或明確宣告 interface: cli,框架就會啟動一個預先安裝好真實 CLI 的 Docker 沙盒環境,讓代理在與實務相同的情境下開始工作。Supabase 指出,這套框架的應用場景相當廣泛,包括對文件更新或技能調整進行迴歸測試、在 SDK 發布前作為品質關卡,或是並排比較不同代理框架的實際表現。
由於代理一旦寫出錯誤的 RLS 政策,很可能直接變成資安事件,因此對於金融科技、醫療等監管嚴格的產業來說,Evals 特別具有參考價值,而整體而言也適用於開發者工具、雲端基礎設施與數據平台等領域。Supabase 在發布文章中也分享了一些初步觀察。數據顯示,Codex / GPT-5.6 在每個場景平均會閱讀約 8 頁文件,而 Claude Code 平均只閱讀約 2 頁,且即使在載入技能的情況下,Claude Code 仍會在不到 40% 的場景中查閱文件。
另外,團隊改寫了 Postgres 最佳實踐技能的功能描述後,該技能被代理啟動的頻率從約每 10 次對話 1 次,提升到大約 60%,可見提示與技能描述本身的品質也會直接影響代理行為。這些數據是擷取自 Supabase 於 2026 年 7 月 31 日發布的介紹文章,隨著模型持續改版,排行榜分數也會跟著變動,讀者可隨時前往 supabase.com/evals 查看最新結果。
整體而言,Supabase Evals 將真實任務轉化為可重複執行的評測流程,為 AI 代理在後端開發領域的可靠性建立更透明、可驗證的評估基礎,也讓開發者能更清楚地掌握目前主流程式碼代理在 Supabase 生態系中的實際能力。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。