Software engineering benchmark
DeepSWE 软件工程评测
让 AI 编程模型面对真实开源仓库中的软件工程任务,再用统一、可复验的方式比较完成质量、耗时与成本。
先看结论:榜单不是模型厂商自报分数。志愿者在自己的机器上运行任务,提交结果后由服务端在干净环境中独立判分;首页公开实时样本量和聚合结果。
它测什么
DeepSWE 频道关注模型处理真实代码库问题的能力,包括理解仓库、定位问题、修改代码和通过测试。首页会按运行工具、模型与推理档位分格展示,具体任务数量和当前支持组合以实时矩阵为准。
怎样读榜单
IQ / 通过率每格使用最近 3 次有效运行,并让任务等权;页面 IQ 与通过率采用同一尺度换算。
样本量显示进入当前统计口径的有效实测数量。样本不足的结果会明确标记,不冒充稳定结论。
耗时使用最近有效运行的实际耗时聚合,适合比较完成同类任务所需时间。
API 等价成本只统计用量证据完整的请求账本,并按页面说明的官方 API 价段重算;不等于订阅平台实际扣费。
为什么需要服务端复验
客户端只负责运行和上传候选结果,最终成绩由服务端在隔离环境里重新执行测试得出。凭据留在参与者本机,含敏感信息的补丁会被拒绝;自报“通过”不会直接进入榜单。
使用结果时要注意
- 模型、推理档位、运行工具和时间窗口都会影响结果,应在相同口径下比较。
- 近期少量样本可能波动,先看样本量和趋势,再看单个整数分数。
- 榜单是持续更新的实测快照,不代表所有代码任务上的绝对能力。