✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

Self-bench:在真实软件上评测编程智能体的开源工具

事件

Self-bench 团队发布了 selfbench.dev,一个开源工具,能够从代码仓库的 PR 自动生成并运行评测,用于衡量编程智能体在真实软件项目中的表现。团队指出,任何获得足够信任的公开基准最终都会被“刷分”(古德哈特定律),实验室有动力最大化分数,但这些分数并不能预测模型在具体项目中的实际效果。此前这种定制化评测只有大公司才负担得起,Self-bench 希望改变这一点。

该工具利用智能体自动编写和审查由 PR 生成的 Harbor 环境,用户需要逐一批准智能体创建的评测,随后可在沙箱中并发运行模型和评测框架。为降低成本,用户还可以连接自己的 OpenAI 和 Claude 订阅,避免直接支付原始 token 费用。团队已在 PostHog、Next.js、Sentry、Pi 等多个大型开源代码库上运行了评测。

评测结果显示,Kimi K3 和 GLM 5.3 几乎总是更贵且性能不如 GPT-6.1 Sol 和 Claude Opus 5.5,主要原因是 token 效率较低;而 GPT-6 Luna 是测试过的最具成本效益的模型,并非开源模型。团队邀请开发者在自己的代码库上试用并反馈。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:Hacker News*

📎 原始来源:Hacker News
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容