8月2日,Kimi 宣布开源视觉感知评测基准 PerceptionBench。

基准构成


  • 将视觉感知拆分为 10 项原子能力,覆盖视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 与幻觉检测

  • 3000 道人工校验题目,取自 42 个现有评测集的模型失败案例,每题仅测单一视觉能力


评测结果


16 款多模态大模型无一整体准确率超过 60%:

  • GPT-5.6-Sol:59.7%,居首

  • Kimi K3:58.5%

  • Claude-Fable-5:57.2%

  • Gemini-3.1-Pro:56.2%

  • GPT-5.5:55.8%


视觉幻觉为全部模型最薄弱环节,整体感知能力仍有明显提升空间。