Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准

来源:Moonshot AI:Kimi Blog 2026年7月15日 00:00 AIHOT 评分:70 精选
摘要:Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,表明模型更多是猜测而非真正感知。PerceptionBench 旨在精确诊断多模态 AI 的视觉感知断裂点,推动其实现忠实、一致的视觉理解。
# Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准 - 来源:Moonshot AI:Kimi Blog - 作者:Kimi - 发布时间:2026-07-16 00:00 - AIHOT 分数:70 - AIHOT 标记:精选 - AIHOT 链接:https://aihot.virxact.com/items/cmrnvwztt01bebixyznbje716 - 原文链接:https://www.kimi.com/blog/perception-bench ## 精选理由 这是一个把视觉感知拆成原子能力的基准,所有模型不及格,而且猜测多于感知的发现很扎心,做多模态的团队应该拿来测一下自家模型。 ## AI 摘要 Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,表明模型更多是猜测而非真正感知。PerceptionBench 旨在精确诊断多模态 AI 的视觉感知断裂点,推动其实现忠实、一致的视觉理解。 ## 正文 概述 我们发布了 PerceptionBench,这是一个将视觉感知能力独立出来,并将其作为一组原子能力进行评估的基准测试——这些能力是从当前模型的失败模式中发现的,而非预先定义。通过将前沿模型在 40 多个基准测试中的失败归因于其最早的视觉原因,我们提炼出 10 种感知能力和 3000 道经过验证的题目,每道题仅凭观察即可作答,无需任何推理或外部知识。 其结果更像是一份精准的诊断报告,而非又一个分数。我们评估的所有模型准确率均未超过 60%,而整体得分几乎相同的模型,其感知能力的强弱项也可能大相径庭。更引人注目的是,大量正确答案在重复提问时无法保持稳定——这证明当前模型往往是在猜测而非感知。PerceptionBench 的设计初衷正是为了精确揭示感知在何处失效,并推动多模态 AI 朝着可靠且一致的视觉理解方向发展。 使用 PerceptionBench 比较模型 每个源基准测试都只捕捉了感知错误的一个狭窄切片,而这些切片之间的重叠程度很低(平均成对加权 Jaccard 系数为 0.20)。没有任何单一基准测试(或少数几个基准测试的组合)能够覆盖感知能力的全貌,这促使我们构建一个以能力为中心的基准测试,来聚合并重新平衡这些碎片化的视角。 数据集 该数据集包含 3000 个高质量、经过验证的样本。其分布旨在将原子感知能力与混淆因素分离开来,并通过三个核心设计原则来体现其独特性: 失败驱动分类法:每个类别都源自真实模型的失败案例,并归因于其在 40 多个现有基准测试中最早出现的错误步骤。 十种原子感知类别:视觉关系、计数、属性、深度与三维、定位、比较、细粒度识别、上下文整合、光学字符识别(OCR)和模型幻觉。 感知,而非推理:样本经过精心筛选、分解和难度平衡,使得难度源于感知而非推理。 质量说明:为使该基准测试成为可靠的金标准,所有样本均经过了严格的验证和难度平衡,仅保留那些存在单一可验证答案的真正感知失败案例。 视觉定位 紫色线条连接的是杯子的哪个部分? 答案:侧面 视觉定位 边 AC 的长度是多少? 答案:8 视觉属性 出现了多少种不同颜色的帽子? 答案:2 视觉属性 图片中有多少个红点? 答案:10 视觉计数 有多少个人? 答案:8 视觉计数 u₁ 轴被分成了多少个相等的子区间? 答案:7 视觉关系 图中最右边的音符接触到了几条五线谱线? 答案:2 视觉关系 有多少个双箭头? 答案:3 深度与 3D 桌子上有多少个盘子? 答案:3 深度与 3D 这些小立方体中有多少个面直接接触地面? 答案:4 OCR 蓝色的数字是多少? 答案:2 OCR 右下角方框中的数字是多少? 答案:3 视觉比较 图片中有多少个动物剪影是完全相同的? 答案:99 视觉比较 有多少种箭头方向? 答案:4 细粒度识别 棋盘上有多少个黑后? 答案:2 细粒度识别 有多少节电池? 答案:2 上下文整合 有多少只猴子触碰过轮毂罩? 答案:1 上下文整合 单元格 x 位于多少个圆的交点上? 答案:2 模型幻觉 图中出现了多少个黄色空心环? 答案:0 模型幻觉 卡车里有多少个人? 答案:0 各类别任务分布 统计项数量 数据 总计3,000 原子感知类别10 任务类别 深度 3D 感知错误330 (11.00%) 视觉计数错误330 (11.00%) 细粒度识别错误290 (9.67%) 视觉关系错误330 (11.00%) 视觉属性错误330 (11.00%) 视觉定位错误330 (11.00%) 视觉比较错误279 (9.30%) 上下文整合错误255 (8.50%) 模型幻觉271 (9.03%) OCR 错误255 (8.50%) 结论 PerceptionBench 是一个简单但极具挑战性的基准测试,用于评估前沿模型在原子级视觉感知方面的能力。它衡量的是多模态模型实际“看到”了什么,而非它们推断出了什么,从而为当前及未来多模态模型的感知能力提供忠实且细粒度的诊断。