众测雷达

真实任务持续实测,模型表现实时更新

AI 编程模型真实任务众测排行榜

全站看板

正在读取全站运行数据……

支持的运行工具与模型

众测雷达在真实开源软件工程任务和视觉推理题上持续实测主流 AI 编程模型,公开通过率、IQ、耗时、成本、样本量与服务端复验口径。

CodexGPT-5.6 · GPT-5.5 · DeepSeek V4
Claude Code 内测中Claude Sonnet 5 · Claude Opus 5
DSHDeepSeek V4 Pro · Flash · Vision
ZCodeGLM-5.3 · GLM-5.3 Flash
GrokGrok 4.6
Kimi CodeK3
AntigravityGemini 3.7 Flash
CodeBuddyHY4 Preview

选择 Benchmark

更多能力测试开发中

运行工具 + 模型能力看板

每 60 秒自动刷新
加载中……
正在读取价格、耗时与 IQ……
Benchmark
运行工具
选择格子
我的 Codex 订阅类型

选题跑题区

需要参与跑题时,从这里认领格子并开始运行

未设置筛选,显示全部格子
加载大表中……

雷达天梯 每一次蹬踏,都让雷达测试得更准。致敬每一位贡献算力的蹬友 🫡

Kimi Code、ZCode、Grok 与 Google Antigravity 已正式上线并参与推荐、排序和趋势分析;四者继续按服务端根据完整 token 用量和官网 API 单价折算的 API 等价成本计分。CodeBuddy HY4 Preview 目前开放 max / high / low 三档并发灰度,须在本机完成 OAuth。

root@dradar:~$ cat contributors.log
🚩 第二届 · 15 万刀夺旗赛 全站已蹬 刀 · 谁的有效提交把累计金额蹬过 15 万刀,立即获得 1500 积分 + 永久旗帜装饰
加载中……
COMMUNITY CHANNEL

连接众测雷达

众测雷达交流群 1

众测雷达交流群 1 微信二维码

交流跑题经验,参与雷达开发建设与领奖

众测雷达交流群 2

众测雷达交流群 2 微信二维码

交流跑题经验,参与雷达开发建设与领奖

官方公众号

众测雷达唯一官方公众号二维码

官方唯一公众号 · 获取每日 AI 黄历

RADAR COMMUNITY ON X

Join the Crowd Radar group chat

Discuss live benchmark results, model performance shifts, and what the community should test next.

Join the group chat on X

参与贡献

1 · 用 GitHub 登录

右上角登录,只用来确认身份、发一个访问令牌。不会碰你的 OpenAI 账号——订阅凭据全程留在你自己机器上,从不经过我们服务器。

2 · 选好你的订阅档位

在表格上方的“我的 Codex 订阅类型”选择你的订阅档(Plus / 5x Pro / 20x Pro)——格子里的百分比是这道题大约占你选中档位 7 天额度的比例,同一道题对 Plus 可能是 6%,对 20x Pro 只有 0.3%。选对档位,看到的才是你的真实成本。

3 · 首次使用先准备环境

第一次来,建议先让 Codex 安装并检查环境,这一步不会占用任务格子,也不会启动正式跑题。全部检查通过后再选题,认领后的 20 分钟都能真正留给启动任务。

4 · 选格子认领

点表里可认领的格子勾选,单次最多 2 / 5 / 10 / 20 / 40 个(按月榜排名解锁),底部按“认领”;懒得挑就点“🚴 一键领题跑分”。20 分钟没开跑自动放回。

5 · 粘给 codex 跑起来

粘贴进你的 codex,它会自动配好环境、装好 dradar,把认领的题全部跑完——不用你敲一条命令高级玩法:直接问 Codex“dradar CLI 能做什么”,或让它“自动认领一批并跑完”“按本机配置并发跑已认领任务”“查看进度并补跑失败项”。不用背命令,描述目标就行。

6 · 回来看表

你跑过的格子会点亮,名字也登上雷达天梯。发现问题或想改进?欢迎到 DRadar 开源仓库 ↗ 提交 Issue 或 PR,一起把雷达做得更好。

FAQ

测试的是什么题库?

目前有两个独立频道:DeepSWE 测软件工程能力;庞贝壁画邻接恢复测试视觉推理能力,从 RePAIR 数据的 87 个独立 RP group 中留 1 个作公开示例,其余 86 个 group 各出 1 道正式题。两类成绩分开统计,不互相混分。

庞贝壁画邻接恢复怎么判分?

模型只需提交它判断存在的无向直接邻接边。隐藏评分器把预测边与该题标准邻接图逐条比较,计算 TP、FP、FN,再得出 Precision、Recall 和 F1;总榜主分是 86 题 Macro-F1,即每道题 F1 等权平均。绝对坐标、画布尺度、旋转、相对方向和最终拼图图像均不参与第一版判分。

百分比得分和 Codex 雷达的 IQ 分数怎么换算?

×1.5。DeepSWE 使用平均通过率,壁画频道使用平均邻接 F1;各自的百分比乘以 1.5,就是 Codex 雷达同尺度的恢复 IQ——满分对齐:100% = 150 分0% = 0 分。例如平均 F1 为 86%,恢复 IQ 就是 129。

会支持其他 coding agent 和模型吗?

会。

Codex 对话里选择的模型会影响实际跑题模型吗?

不会。每个任务实际使用的模型和推理档位由 DRadar 在认领时明确指定,并在隔离的 Docker 环境中运行;外层 Codex 对话选择什么模型都不会替换任务配置。

“一键领取”只负责认领任务,不会自动开始跑题。领取后仍需复制运行提示词并启动 DRadar;如果任务没有完成,请检查 Docker、任务运行和环境检查状态,而不是更换外层对话模型。

会烧我多少额度?

额度是你自己的,dradar 不替你管、也不读取普通志愿者账号的余量。Codex 已取消 5 小时滚动限制,现在只有7 天额度一道约束,表里的价签全部按周额度换算——大多数题只占你周额度的百分之几,比 5h 时代宽裕约 6 倍。价签按你的订阅档估算(用上方档位切换),认领时量力而行即可。万一跑到一半撞上额度墙,任务会直接失败、格子自动放回给别人——不会白占着,也不会偷偷替你等额度刷新。价签由历史实测 + 志愿者数据每 15 分钟自动校准;档位总容量由站方超级账号在真实任务前后通过 Codex app-server 测量,累计实耗至少 $50 才会生成候选值,并且必须经过人工确认才会更新。

DeepSeek 格子不使用订阅额度,而是你自己的 API 余额。北京时间工作日 09:00–12:0014:00–18:00 为高峰价,其余时间及周六、周日全天为低谷价;页面刷新时自动选择当前价段,也可用按钮手动切换本页价签预览,实际 API 等价费用仍按每次请求发生时的价段分别核算。

GLM-5.3 与 GLM-5.3 Flash 统一使用当前官方标准 API 单价折算 API 等价成本,成本本身不套用 Coding Plan 的峰谷优惠或其他订阅折扣。模型卡片只统计请求账本完整的运行,并按当前标准 API 单价重算其历史 token 用量;历史已结算积分保持不变。

积分怎么算?

统一公式:贡献积分 = 基础分或可核验的 API 等价成本 × 基础倍率 × 荒地倍率。所有运行工具、所有题库都使用同一套格子语义;服务端在认领时锁定最终倍率,提交时不会变低。

基础倍率:Codex 原生 GPT 为 1×–2×;Codex DeepSeek API 与 DSH 均为 75×–150×;Kimi K3 为 10×–20×;ZCode GLM-5.3 为 5×–10×;ZCode GLM-5.3 Flash 为 10×–20×;Grok 4.6 与 Antigravity Gemini 3.7 Flash 均为 3×–6×;CodeBuddy HY4 Preview 为 5×–10×。区间内倍率随格子空闲时间逐档提高。

荒地倍率:精确到“题目 × 运行工具/模型 × 推理档位”的格子。只要从未产生过有效且干净的判分记录,就是荒地,最终倍率额外乘固定 1.5×,格子上会直接显示“荒地 1.5×”。第一次有效判分完成后,无论通过还是未通过,都永久退出荒地;异常、无效、待复核记录不算。

荒地满倍率示例:Codex 原生 GPT 为 ;Codex DeepSeek API 与 DSH 为 225×;Kimi K3 与 ZCode GLM-5.3 Flash 为 30×;ZCode GLM-5.3 与 CodeBuddy HY4 Preview 为 15×;Grok 4.6 与 Antigravity Gemini 3.7 Flash 为

成本口径:DeepSeek 按每条请求发生时的官网峰价或谷价复算实际成本;Kimi、ZCode、Grok、Antigravity 与 CodeBuddy 按完整请求账本和官网标准 API 单价折算 API 等价成本。输入缓存与 thinking token 均按各服务商账本语义去重,绝不重复计算;CodeBuddy 请求账本不完整时只显示“–”且不结算,其他证据不足的旧口径会明确显示“兜底估价”或不结算,绝不把估价冒充实耗。

历史已结算积分不追溯重算;目前不设其他临时倍率奖励。

连续贡献奖励:每天按北京时间完成至少一道有效判分任务得 5 分;连续 3 / 7 / 14 / 30 天再得 5 / 15 / 30 / 60 分。同一天多跑不重复领取,断签后开始新一轮。

天梯排名怎样影响并发和领题数?

每天认领数量不限。并发上限和单次领题数按当前月榜排名逐步解锁:第 1–5 名为 40 并发 / 一次 40 题,第 6–10 名为 20 并发 / 一次 20 题,第 11–20 名为 10 并发 / 一次 10 题,第 21–50 名为 5 并发 / 一次 5 题,第 51 名以后及尚未上榜的新手为 2 并发 / 一次 2 题。跑完腾出位子就能继续领;排名变化后自动按新档位生效。

自行车和蹬踏时间怎么算?

开始真实跑题就会显示自行车;同时有几路题目正在运行且状态正常,就依次显示几辆自行车和对应路数,约 15 秒刷新。最后一次有效跑题或提交后的 20 分钟内继续显示:前 10 分钟为“正在擦车”,后 10 分钟为“已停车”;期间接着跑会续在同一轮,超过 20 分钟才下掉并在下次重新计轮。蹬踏时间只算实际跑题时间,排队、换题、断线和留榜宽限不计时,并发重叠只算一次。

可以并行跑题吗?

可以——并发上限与当前月榜档位一致:第 1–5 名为 40,第 6–10 名为 20,第 11–20 名为 10,第 21–50 名为 5,第 51 名以后及尚未上榜的新手为 2。新手默认 1 车;Mac mini M4(16GB 内存)最多可同时运行 10 车。如果你有高性能服务器,并且排名已经解锁,可以挑战 40 车。车数是同一账号在所有设备上的总并发上限。

数据安全吗?

每道题都在独立、一次性的 Docker 容器里跑和判分,测完即销毁,跟别的题、别人的环境互不串扰。上传前后两道敏感信息扫描,带密钥的补丁直接拒收;凭据文件从不上传。公开的只有昵称、积分和判分干净的轨迹。

分数怎么保证真实?

客户端自报的结果一概不算数:每个补丁都在服务端的干净容器里重跑验证器打分。另有任务持有时间差、轨迹审计等多层检测,可疑提交先冻结——积分暂扣、不上榜、不计晋升,人工复核后:误伤的原数奉还(分一分不少),坐实的清零封号。