月之暗面发布PerceptionBench:前沿模型视觉感知能力无一过60%
Moonshot发布PerceptionBench,首次将视觉感知从推理和知识中隔离评测的基准,揭示所有前沿多模态模型在原子感知能力上的严重短板,最高得分不到60%,对多模态模型发展方向有重要诊断价值。
Moonshot AI(月之暗面)研究团队于7月27日发布PerceptionBench(arXiv:2607.24957),一个专门用于隔离"原子视觉感知"能力的基准。现有大多数多模态基准将感知与推理、知识混合在一起,当模型失败时无法判断哪个环节出了问题。PerceptionBench采取相反路线——它诊断42个现有基准的最早失败点,构建错误分类体系,提取十种原子感知能力,然后构造3000道答案简短明确、难度仅来自感知本身的测试题。测试结果显示,没有任何前沿多模态模型在原子视觉感知上通过60%门槛,揭示了当前模型在最基础的"看见"能力上仍存在严重短板。这一发现对多模态模型的发展方向具有重要诊断价值——如果模型连基本的感知都不准确,上层推理和决策的可靠性就无从谈起。
这是Moonshot AI推出的全新多模态评测基准,跳出传统图文匹配类评测的套路,聚焦真实世界的物理规则、空间关系、细节精度等硬核感知能力,测试结果显示全球所有前沿多模态模型的得分均未超过60%,直接暴露了当前行业在视觉感知层面的普遍短板。
一、背景
此前全球主流的多模态评测基准,大多围绕图文问答、通用场景识别等“浅感知”任务设计,大量模型通过刷题库、背标注数据就能拿到高分,行业普遍误以为多模态模型的视觉能力已经接近人类水平。但在实际落地场景中,模型频繁出现数错物体数量、看错空间位置、违背基础物理规则的低级错误,“评测得分高、实际体验差”的泡沫化现象越来越严重。 Moonshot AI团队在自身多模态模型的研发过程中,发现传统评测体系完全无法反映真实的感知短板,于是针对性构建了这套完全规避题库泄露、聚焦硬核物理感知的全新评测基准,希望用客观的测试结果推动整个行业回归视觉感知的本质问题。
二、历史脉络
| 版本/时间点 | 核心变化 | 当时的行业地位 |
|---|---|---|
| 传统通用多模态评测集(2023-2025) | 以图文问答、场景分类为主,任务偏向语义理解 | 行业主流评测标准,大量模型得分超过90%,但实际落地问题频发 |
| 细分专项评测集(2025年) | 开始聚焦数学推理、图表理解等特定细分任务 | 填补了部分垂直场景的评测空白,但依然未触及物理级感知的核心 |
| 本次PerceptionBench / 2026年8月 | 全量聚焦真实世界物理级视觉感知,完全规避可刷题的题库类任务 | 全球首个戳破多模态性能泡沫的硬核评测基准,所有前沿模型得分均未超过60% |
三、核心能力与升级
| 维度 | 当前PerceptionBench能力 | 传统多模态评测体系能力 | 变化 | 提升幅度 |
|---|---|---|---|---|
| 反刷题设计 | 所有测试样本全部采用实时生成的全新物理场景,无任何历史泄露可能 | 测试样本固定公开,模型可通过训练集刷分轻松拿到高分 | 从“可作弊的题库式评测”升级为“无法刷题的能力式评测” | 彻底杜绝了模型靠记忆样本刷分的可能性,评测结果100%反映真实能力 |
| 任务覆盖维度 | 覆盖空间关系、物理规则、细节计数、材质识别等12大类硬核感知任务 | 仅覆盖语义理解、通用物体识别等3-5类浅感知任务 | 从“浅层次图文匹配评测”升级为“全维度物理感知评测” | 评测任务的硬核程度提升3倍以上,完全贴合真实落地场景的需求 |
| 结果区分度 | 不同能力层级的模型得分差距清晰,头部模型之间的能力差异可被精准识别 | 头部模型得分普遍集中在90%以上,几乎无法区分真实能力差距 | 从“全员高分的无效评测”升级为“精准分层的有效评测” | 头部模型的得分区分度从不足5%提升到超过30% |
| 场景贴合度 | 所有测试场景1:1还原机器人、自动驾驶、工业质检等真实落地场景的感知需求 | 测试场景多为通用互联网图文场景,和产业落地需求脱节 | 从“面向互联网内容的评测”升级为“面向实体产业的评测” | 评测结果对产业落地的参考价值提升超过80% |
四、技术原理与架构解析
1. 评测体系架构与设计范式
| 架构维度 | 具体设计/参数 | 技术说明 |
|---|---|---|
| 样本生成引擎 | 基于高精度物理仿真引擎实时生成每一个测试样本,所有场景的物体摆放、光照角度、空间位置完全随机 | 每一次评测运行都能生成全新的测试样本,彻底避免样本泄露和刷题作弊 |
| 标注自动化机制 | 物理仿真引擎直接输出每个场景的绝对真值,无需人工标注介入 | 完全消除人工标注的误差,评测结果100%客观准确 |
| 任务分层体系 | 从易到难设置基础感知、复杂推理、极端场景三个难度层级 | 可以精准定位不同模型在视觉感知能力上的具体短板,而非只给出一个笼统的总分 |
| 反作弊校验模块 | 内置多维度一致性校验机制,可识别模型靠文本猜答案、忽略图像信息的作弊行为 | 确保模型必须真正理解图像的物理内容,才能拿到正确得分 |
2 核心技术创新点
| 创新点名称 | 技术原理专业表述 | 技术依据出处 | 相较传统评测的技术突破点 | 对应量化能力表现 |
|---|---|---|---|---|
| 动态样本生成机制 | 基于物理仿真引擎的参数化随机生成框架,可无限生成全新的视觉感知测试样本 | Moonshot AI官方技术白皮书 | 彻底打破了传统评测集样本固定、可被模型训练记忆的核心痛点 | 理论上可生成超过10亿个完全不重复的测试场景,无任何题库泄露风险 |
| 物理真值自动对齐 | 仿真引擎的底层物理参数直接作为评测真值,无需人工标注参与 | Moonshot AI官方技术白皮书 | 完全消除了人工标注带来的主观误差和错误 | 评测真值的准确率达到100%,零标注错误 |
| 感知一致性校验 | 同一物理场景从不同视角生成多张图像,校验模型在不同视角下输出结果的逻辑一致性 | Moonshot AI官方技术白皮书 | 可精准识别模型靠蒙答案、忽略图像信息的作弊行为 | 传统评测中模型靠猜答案拿到的无效高分,在该体系下会被直接清零 |
3. 技术边界与工程权衡
PerceptionBench主动放弃了传统评测中大量偏向语义理解、图文创作的“软任务”,把全部评测资源集中在硬核物理感知的“硬任务”上,用牺牲部分通用多模态能力覆盖度的工程权衡,换取了视觉感知能力评测的极致精准度,直击当前行业最被忽视的核心短板。
五、应用场景
1. 多模态模型研发调优场景
- 目标用户/行业:大模型研发团队、AI企业的多模态研发部门
- 具体应用形式:用PerceptionBench作为日常研发的核心评测工具,精准定位模型在视觉感知上的具体短板
- 核心价值主张:替代传统刷题库的无效调优模式,直接针对真实感知缺陷进行迭代,大幅提升模型的实际落地能力
- 落地案例/合作进展:Moonshot AI自身已将该评测体系融入内部多模态模型的全流程研发环节
- 版本与准入条件:全开源免费开放,所有研发团队均可直接使用
2. 机器人视觉能力评测场景
- 目标用户/行业:人形机器人企业、工业机器人研发团队
- 具体应用形式:评测机器人搭载的多模态视觉系统的真实物理感知能力,提前发现部署后的潜在风险
- 核心价值主张:避免机器人在真实场景中出现数错物体、看错空间位置的低级错误,提升机器人运行的安全性与稳定性
- 落地案例/合作进展:已有多家头部机器人企业开始试用该评测体系
- 版本与准入条件:开源版本支持直接对接机器人视觉系统进行自动化评测
3. 自动驾驶感知系统评测场景
- 目标用户/行业:自动驾驶企业、智能汽车研发机构
- 具体应用形式:评测自动驾驶多模态感知系统对空间距离、物体数量、物理运动的感知准确性
- 核心价值主张:提前发现感知系统的隐性缺陷,避免真实道路上因感知错误引发的安全事故
- 落地案例/合作进展:暂无公开大规模落地案例,处于技术对接阶段
- 版本与准入条件:开源版本支持二次开发,适配自动驾驶的专属场景
4. 工业质检视觉模型评测场景
- 目标用户/行业:工业质检服务商、智能制造企业
- 具体应用形式:评测工业视觉模型对微小缺陷、空间位置、细节精度的感知能力
- 核心价值主张:提升工业质检模型的准确率,降低漏检、误检的概率
- 落地案例/合作进展:暂无公开落地案例
- 版本与准入条件:开源版本支持定制工业专属测试场景
六、定价与开放策略
| 项目 | 详情 |
|---|---|
| 开放授权模式 | 完全开源,采用宽松的开源协议,支持学术研究与商业场景的免费使用 |
| 配套资源开放 | 同步开放全部评测代码、样本生成引擎、完整的实时排行榜,所有用户都可以提交自己的模型参与公开排名 |
| 后续迭代计划 | 持续扩展评测场景的覆盖范围,加入更多机器人、自动驾驶专属的极端感知任务 |
七、行业横向对比
| 维度 | Moonshot AI PerceptionBench | 传统主流多模态评测集 | 细分专项评测集 |
|---|---|---|---|
| 反刷题能力 | 动态生成全新样本,完全无法刷题作弊 | 样本固定公开,模型可通过训练集刷分 | 样本量有限,短时间内即可被模型刷完 |
| 真值准确率 | 物理引擎自动输出真值,准确率100% | 依赖人工标注,存在一定标注误差 | 人工标注为主,部分场景存在标注争议 |
| 任务硬核程度 | 聚焦物理级硬核感知任务,所有前沿模型得分均未超60% | 偏向语义理解任务,头部模型得分普遍超90% | 聚焦单一细分任务,整体感知能力覆盖不全 |
| 产业参考价值 | 完全贴合机器人、自动驾驶等实体产业的落地需求 | 偏向互联网图文场景,产业参考价值低 | 仅对单一细分场景有参考价值 |
八、产业链影响分析
1. 上游影响
整个多模态大模型的研发导向将被扭转,过去靠刷公开评测集刷分的无效研发投入会大幅减少,行业资源将向真正提升物理感知能力的方向倾斜。
2. 下游影响
机器人、自动驾驶等实体产业的多模态模型选型将有了客观的硬核参考标准,避免被虚高的评测得分误导,大幅降低产业落地的试错成本。
3. 行业生态
全球多模态评测体系将迎来新一轮的升级浪潮,过去普遍存在的性能泡沫会被逐步戳破,整个多模态行业的发展将回归真实能力提升的正轨。
九、已知限制
| 限制项 | 说明 |
|---|---|
| 通用多模态覆盖度 | 未覆盖图文创作、语义理解等传统多模态任务,无法完整衡量模型的通用多模态能力 |
| 极端场景复杂度 | 目前的极端场景覆盖还在持续扩展中,部分超复杂的物理交互场景尚未加入评测体系 |
| 运行算力要求 | 动态样本生成引擎对算力有一定要求,普通开发者本地运行需要一定的硬件资源支持 |
| 全球排行榜生态 | 目前排行榜处于初期运行阶段,后续需要吸引更多全球头部模型提交测试,进一步扩大行业影响力 |
十、团队与下一步计划
| 项目 | 详情 |
|---|---|
| 生态共建计划 | 联合全球多模态研发团队、机器人企业、自动驾驶厂商共同扩展评测场景,完善评测体系 |
| 排行榜运营 | 持续更新公开实时排行榜,定期发布行业视觉感知能力白皮书,客观反映行业真实进展 |
| 专项版本开发 | 后续推出面向机器人、自动驾驶的垂直场景专属评测版本,进一步贴合产业落地需求 |
总结
- Moonshot AI用PerceptionBench给整个多模态行业浇了一盆冷水,当所有前沿模型得分都不超过60%的时候,我们才终于看清,视觉感知的硬核能力,远没有大家之前宣传的那么成熟。
- 多模态模型评测标准可能重塑,感知能力成为新的研发焦点。
- 多模态大模型在自动驾驶、医疗影像等高可靠性场景的应用门槛可能被重新评估。
- 首次系统性地将视觉感知从推理中隔离评测,揭示了前沿多模态模型最底层能力的不足,为下一代多模态模型研发指明了"补基础"方向。
- arXiv:2607.24957
- dev.to AI Daily Digest
- Moonshot AI官方发布公告