Methodology
评分、成本与服务端复验方法
这页说明众测雷达首页各项指标的来源和边界。目标不是制造一个看起来精确的总分,而是让每个数字都能追溯到明确的任务、样本和证据。
从运行到入榜
- 参与者从首页认领明确的任务、运行工具、模型和推理档位。
- 任务在参与者本机运行,账号凭据不上传到众测服务器。
- 客户端上传候选补丁和运行证据,并在上传前检查敏感信息。
- 服务端在干净、隔离的环境里重新执行测试或隐藏评分器。
- 只有完成判分且符合统计条件的有效样本进入聚合结果。
首页四类核心指标
IQDeepSWE 用任务通过率,庞贝频道用平均 F1;百分比乘以 1.5 映射到 0–150 分。
样本量表示当前口径内有效实测的数量。样本不足时会明确标记,并与稳定结果区分。
时间来自有效运行的实际耗时,不使用模型厂商宣传的理想速度。
API 等价成本使用完整 token 用量和页面当前说明的官方 API 价段重算,证据不足时显示“–”。
最近样本口径
主榜每格 IQ 默认使用最近 3 次有效运行并让任务等权;耗时和价格使用页面对应说明里的最近有效样本。某些公开内测频道可能使用不同窗口,具体以实时卡片下方的口径文字为准。
成本不代表实际账单
“API 等价成本”是比较指标,不是订阅服务商向参与者实际收取的金额。只有 token 证据完整、来源可核验的样本才会被计价;认领估价、冷启动估价和来源不明的历史金额不会冒充真实实耗。
如何正确引用结果
- 记录模型、档位、运行工具、频道、样本量和查看日期。
- 比较时保持统计口径一致,不把 DeepSWE 与庞贝频道分数直接混合。
- 把短期榜单理解为持续更新的实测快照,并同时查看样本量和趋势。