知名开源Backend as a Service平台Supabase于近日正式发布开源测评基准Supabase Evals,该项目采用Apache-2.0开源协议,可针对Claude Code、Codex、OpenCode等主流AI编码工具,基于真实Supabase开发场景任务的完成质量进行量化打分,为开发者选型AI编码助手、厂商优化模型能力提供统一的参考标尺。

随着AI编码工具成为开发者日常工作的标配,通用代码测评榜单的参考价值正在遭遇挑战:不少在通用编程测试中拿到高分的模型,在面向特定开发框架、云服务平台的垂直场景中频繁出错,而针对这类场景的标准化测评工具长期处于空白状态。
国内国外有大量开发者选择Supabase作为后端开发的BaaS方案,其集成的PostgreSQL数据库、身份认证、边缘函数、存储等功能,能帮助团队快速搭建完整的后端服务。但过去很长时间里,开发者选用AI编码工具生成Supabase相关代码时,经常会遇到生成的API调用格式错误、行级安全策略不符合官方规范、性能不达标等问题,只能靠手动反复调试,大大抵消了AI编码带来的效率提升。
此前市面上的AI编码能力测评大多集中在通用算法题、通用业务代码生成场景,极少针对特定BaaS平台的开发需求设计专项测试,导致开发者很难找到适配自身技术栈的选型参考,模型厂商也缺乏明确的垂直场景优化目标。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录