# Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准
- 来源:Moonshot AI:Kimi Blog
- 作者:Kimi
- 发布时间:2026-07-16 00:00
- AIHOT 分数:70
- AIHOT 标记:精选
- AIHOT 链接:https://aihot.virxact.com/items/cmrnvwztt01bebixyznbje716
- 原文链接:https://www.kimi.com/blog/perception-bench
## 精选理由
这是一个把视觉感知拆成原子能力的基准,所有模型不及格,而且猜测多于感知的发现很扎心,做多模态的团队应该拿来测一下自家模型。
## AI 摘要
Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,表明模型更多是猜测而非真正感知。PerceptionBench 旨在精确诊断多模态 AI 的视觉感知断裂点,推动其实现忠实、一致的视觉理解。
## 正文
概述
我们发布了 PerceptionBench,这是一个将视觉感知能力独立出来,并将其作为一组原子能力进行评估的基准测试——这些能力是从当前模型的失败模式中发现的,而非预先定义。通过将前沿模型在 40 多个基准测试中的失败归因于其最早的视觉原因,我们提炼出 10 种感知能力和 3000 道经过验证的题目,每道题仅凭观察即可作答,无需任何推理或外部知识。
其结果更像是一份精准的诊断报告,而非又一个分数。我们评估的所有模型准确率均未超过 60%,而整体得分几乎相同的模型,其感知能力的强弱项也可能大相径庭。更引人注目的是,大量正确答案在重复提问时无法保持稳定——这证明当前模型往往是在猜测而非感知。PerceptionBench 的设计初衷正是为了精确揭示感知在何处失效,并推动多模态 AI 朝着可靠且一致的视觉理解方向发展。
使用 PerceptionBench 比较模型
每个源基准测试都只捕捉了感知错误的一个狭窄切片,而这些切片之间的重叠程度很低(平均成对加权 Jaccard 系数为 0.20)。没有任何单一基准测试(或少数几个基准测试的组合)能够覆盖感知能力的全貌,这促使我们构建一个以能力为中心的基准测试,来聚合并重新平衡这些碎片化的视角。
数据集
该数据集包含 3000 个高质量、经过验证的样本。其分布旨在将原子感知能力与混淆因素分离开来,并通过三个核心设计原则来体现其独特性:
失败驱动分类法:每个类别都源自真实模型的失败案例,并归因于其在 40 多个现有基准测试中最早出现的错误步骤。
十种原子感知类别:视觉关系、计数、属性、深度与三维、定位、比较、细粒度识别、上下文整合、光学字符识别(OCR)和模型幻觉。
感知,而非推理:样本经过精心筛选、分解和难度平衡,使得难度源于感知而非推理。
质量说明:为使该基准测试成为可靠的金标准,所有样本均经过了严格的验证和难度平衡,仅保留那些存在单一可验证答案的真正感知失败案例。
视觉定位
紫色线条连接的是杯子的哪个部分?
答案:侧面
视觉定位
边 AC 的长度是多少?
答案:8
视觉属性
出现了多少种不同颜色的帽子?
答案:2
视觉属性
图片中有多少个红点?
答案:10
视觉计数
有多少个人?
答案:8
视觉计数
u₁ 轴被分成了多少个相等的子区间?
答案:7
视觉关系
图中最右边的音符接触到了几条五线谱线?
答案:2
视觉关系
有多少个双箭头?
答案:3
深度与 3D
桌子上有多少个盘子?
答案:3
深度与 3D
这些小立方体中有多少个面直接接触地面?
答案:4
OCR
蓝色的数字是多少?
答案:2
OCR
右下角方框中的数字是多少?
答案:3
视觉比较
图片中有多少个动物剪影是完全相同的?
答案:99
视觉比较
有多少种箭头方向?
答案:4
细粒度识别
棋盘上有多少个黑后?
答案:2
细粒度识别
有多少节电池?
答案:2
上下文整合
有多少只猴子触碰过轮毂罩?
答案:1
上下文整合
单元格 x 位于多少个圆的交点上?
答案:2
模型幻觉
图中出现了多少个黄色空心环?
答案:0
模型幻觉
卡车里有多少个人?
答案:0
各类别任务分布
统计项数量
数据
总计3,000
原子感知类别10
任务类别
深度 3D 感知错误330 (11.00%)
视觉计数错误330 (11.00%)
细粒度识别错误290 (9.67%)
视觉关系错误330 (11.00%)
视觉属性错误330 (11.00%)
视觉定位错误330 (11.00%)
视觉比较错误279 (9.30%)
上下文整合错误255 (8.50%)
模型幻觉271 (9.03%)
OCR 错误255 (8.50%)
结论
PerceptionBench 是一个简单但极具挑战性的基准测试,用于评估前沿模型在原子级视觉感知方面的能力。它衡量的是多模态模型实际“看到”了什么,而非它们推断出了什么,从而为当前及未来多模态模型的感知能力提供忠实且细粒度的诊断。