随着生成式 AI 深度融入软件工程,各类 AI 编码助手层出不穷。然而,如何客观评估这些工具在真实开发场景中的表现,一直是行业痛点。近日,开源数据库平台 Supabase 正式发布了名为 supabase/evals 的开源基准测试框架,旨在为 AI 编码代理提供一套标准化的评估体系。
该项目采用 Apache-2.0 协议开源,赋予了社区极大的自由度。与许多仅关注语法正确性的抽象基准测试不同,evals 框架将测试场景直接锚定在真实的 Supabase 开发任务上。具体而言,它模拟了开发者日常工作中最核心的几个环节:构建数据库架构、调试边缘函数以及修复行级安全策略(RLS)。这些任务往往涉及复杂的逻辑判断和系统配置,远比简单的代码填空更具挑战性。
为了确保评估的严谨性,Evals 采用了容器化栈来运行这些测试任务,从而构建一个隔离且真实的执行环境。在评分环节,框架结合了“确定性检查”和“LLM-as-a-judge”两种机制。确定性检查用于验证代码在特定环境下能否成功运行,而 LLM-as-a-judge 则利用大模型自身的逻辑推理能力,对代码的完成度、正确性以及是否符合开发规范进行深度评判。
这一开源基准的发布,对 AI 编码行业具有多重积极影响。首先,它为开发者提供了一个“试金石”。在面对 Claude Code、Codex 或 OpenCode 等不同 AI 工具时,开发者可以通过 Evals 框架直观地看到它们在不同复杂任务上的真实胜率,从而做出更精准的工具选型。
其次,它推动了行业标准的建立。通过公开基于真实任务的评估数据,Supabase 迫使 AI 模型厂商更加关注实际落地的工程能力,而非仅仅停留在生成看似合理代码的表面。这不仅有助于提升 AI 编码助手的可靠性,也加速了 AI 辅助编程从“辅助玩具”向“生产力工具”转型的进程。随着 Evals 的开源,开发者社区有望在此基础上衍生出更多针对性的测试集,共同推动 AI 软件工程的进步。
信息来源:MarkTechPost
原文链接:https://www.marktechpost.com/2026/08/01/supabase-releases-evals-an-open-source-benchmark-that-scores-claude-code-codex-and-opencode-on-real-supabase-tasks/
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/01/supabase-releases-evals-an-open-source-benchmark-that-scores-claude-code-codex-and-opencode-on-real-supabase-tasks/