Self-bench:在真实软件上评测编程智能体的开源工具
事件
Self-bench 团队发布了 selfbench.dev,一个开源工具,能够从代码仓库的 PR 自动生成并运行评测,用于衡量编程智能体在真实软件项目中的表现。团队指出,任何获得足够信任的公开基准最终都会被“刷分”(古德哈特定律),实验室有动力最大化分数,但这些分数并不能预测模型在具体项目中的实际效果。此前这种定制化评测只有大公司才负担得起,Self-bench 希望改变这一点。
该工具利用智能体自动编写和审查由 PR 生成的 Harbor 环境,用户需要逐一批准智能体创建的评测,随后可在沙箱中并发运行模型和评测框架。为降低成本,用户还可以连接自己的 OpenAI 和 Claude 订阅,避免直接支付原始 token 费用。团队已在 PostHog、Next.js、Sentry、Pi 等多个大型开源代码库上运行了评测。
评测结果显示,Kimi K3 和 GLM 5.3 几乎总是更贵且性能不如 GPT-6.1 Sol 和 Claude Opus 5.5,主要原因是 token 效率较低;而 GPT-6 Luna 是测试过的最具成本效益的模型,并非开源模型。团队邀请开发者在自己的代码库上试用并反馈。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:Hacker News*