Kimi開源PerceptionBench視覺感知基準,GPT-5.6-Sol準確率居首但無模型突破60%
2026-08-02 15:17
Odaily星球日報訊 Kimi 宣佈開源多模態大模型視覺感知評測基準 PerceptionBench,旨在將視覺感知能力拆解為 10 項原子級能力進行獨立評估,涵蓋視覺關係、計數、屬性、深度與 3D、定位、比較、細粒度識別、上下文整合、OCR 及幻覺識別等維度。該基準基於 42 個現有評測集中的模型失敗案例構建,共包含 3000 道經人工驗證的問題,每題僅考察單一視覺能力,無需推理或外部知識。
評測結果顯示,在 16 款前沿多模態大模型中,沒有任何模型整體準確率超過 60%。GPT-5.6-Sol 以 59.7%的準確率排名第一,Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和 GPT-5.5(55.8%)位列前五。報告指出,視覺幻覺(Hallucination)仍是各模型表現最弱的能力,整體感知能力仍存在顯著提升空間。
