众测雷达
Visual reasoning benchmark

庞贝壁画 AI 视觉推理评测

模型观察一组壁画碎片,判断哪些碎片原本直接相邻。第一版只评估邻接拓扑,不要求复原绝对坐标、旋转、尺度或最终拼图图像。

主指标:86 道正式题的 Macro-F1。每道题先独立计算 F1,再等权平均,避免边数较多的题压过其他题。

题集怎样组成

频道从 RePAIR 数据的 87 个独立 RP group 中保留 1 个作为公开示例,其余 86 个 group 各形成 1 道正式题。正式答案由隐藏评分器持有,首页提供公开例题帮助理解输入与输出格式。

模型需要输出什么

模型只提交它能够确认的无向直接邻接边。如果碎片 A 与 B 直接相邻,A–B 和 B–A 被视作同一条边;间接相连不计入答案。

怎样评分

Precision预测为邻接的边中,有多少确实存在;误报会降低精确率。
Recall标准答案中的邻接边,有多少被模型找回;漏报会降低召回率。
F1综合 Precision 与 Recall。每题单独计算后进入 Macro-F1。
恢复 IQ页面把平均 F1 百分比乘以 1.5 映射到 0–150 分,便于与主榜同尺度阅读。

结果边界

这个频道测的是碎片直接邻接推理,不等同于完整的考古修复能力。模型可以在邻接关系上表现好,却未必能输出视觉上完整、方向准确的最终拼图;榜单不会把两者混为一谈。