Kimi开源视觉基准 多模态模型准确率均未破60%
8月2日,Kimi 宣布开源视觉感知评测基准 PerceptionBench。
基准构成
- 将视觉感知拆分为 10 项原子能力,覆盖视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 与幻觉检测
- 3000 道人工校验题目,取自 42 个现有评测集的模型失败案例,每题仅测单一视觉能力
评测结果
16 款多模态大模型无一整体准确率超过 60%:
- GPT-5.6-Sol:59.7%,居首
- Kimi K3:58.5%
- Claude-Fable-5:57.2%
- Gemini-3.1-Pro:56.2%
- GPT-5.5:55.8%
视觉幻觉为全部模型最薄弱环节,整体感知能力仍有明显提升空间。