Kimi는 시각적 인식 벤치마크 PerceptionBench를 오픈소스로 공개했으며, GPT-5.6-Sol이 정확도 1위를 차지했지만 어떤 모델도 60%를 돌파하지 못했다.
2026-08-02 15:17
Odaily星球日报 보도에 따르면, Kimi는 멀티모달 대형 언어 모델의 시각적 인식 평가 벤치마크인 PerceptionBench를 오픈소스로 공개했다. 이 벤치마크는 시각적 인식 능력을 10가지 원자적 능력으로 세분화하여 독립적으로 평가하는 것을 목표로 하며, 시각적 관계, 계산, 속성, 깊이 및 3D, 위치 파악, 비교, 미세 인식, 맥락 통합, OCR 및 환각 인식 등의 차원을涵盖한다. 이 벤치마크는 42개의 기존 평가 세트에서 모델 실패 사례를 기반으로 구축되었으며, 총 3,000개의 수동 검증된 문제를 포함하고 각 문제는 단일 시각 능력만 평가하며 추론이나 외부 지식이 필요하지 않다.
평가 결과에 따르면, 16개의 최첨단 멀티모달 대형 모델 중 어떤 모델도 전체 정확도 60%를 넘지 못했다. GPT-5.6-Sol이 59.7%의 정확도로 1위를 차지했으며, Kimi K3(58.5%), Claude-Fable-5(57.2%), Gemini-3.1-Pro(56.2%), GPT-5.5(55.8%)가 상위 5위를 기록했다. 보고서는 시각적 환각(Hallucination)이 여전히 모든 모델에서 가장 약한 능력이며, 전반적인 인식 능력에는 여전히 상당한 개선 여지가 있다고 지적했다.
