BTC
ETH
HTX
SOL
BNB
View Market
简中
繁中
English
日本語
한국어
ภาษาไทย
Tiếng Việt

Kimiが視覚認識ベンチマークPerceptionBenchをオープンソース化、GPT-5.6-Solが精度首位も60%を超えるモデルはなし

2026-08-02 15:17

Odaily星球日报訊 Kimi は、マルチモーダル大規模言語モデル向けの視覚認識評価ベンチマーク「PerceptionBench」をオープンソース化したと発表した。このベンチマークは、視覚認識能力を10の原子的な能力に分解し、それぞれ独立して評価することを目的としており、視覚関係、計数、属性、深度と3D、位置特定、比較、細粒度認識、コンテキスト統合、OCR、幻覚認識などの次元をカバーしている。このベンチマークは、既存の42の評価セットにおけるモデルの失敗事例に基づいて構築されており、合計3000問の人間による検証済みの問題を含み、各問題は単一の視覚能力のみを評価し、推論や外部知識は不要である。

評価結果によると、16の最先端マルチモーダル大規模モデルのうち、全体的な精度が60%を超えるモデルはなかった。GPT-5.6-Sol が59.7%の精度で首位となり、Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)、GPT-5.5(55.8%)がトップ5に入った。報告書は、視覚幻覚(Hallucination)が依然として各モデルで最も弱い能力であり、全体的な認識能力には依然として大幅な改善の余地があると指摘している。