Moonshot AI új PerceptionBench nevű benchmarkja alaposan feltérképezi a mesterséges intelligencia modellek vizuális észlelési képességeit, elkülönítve azokat a logikai gondolkodástól. Az eredmények szerint a jelenlegi legfejlettebb modellek sem képesek túlszárnyalni az 60 százalékos pontosságot ezen a speciális teszten, ami rávilágít a technológia korlátaira.
Moonshot AI kutatócsapata bemutatta az PerceptionBench tesztet, amely kifejezetten a multimodális nyelvi modellek vizuális észlelését méri fel. A PerceptionBench tíz alapvető vizuális részfeladatra bontja le a látást, kizárva a logikai gondolkodást és a háttértudást. Így minden kérdésre kizárólag a kép alapján kell válaszolni, logikai érvelés nélkül[^1].
Az új benchmark kategóriáit valós modellhibákból, nem elméleti megközelítésből alakították ki. A teszt 3 000 feladatot tartalmaz egy 17 000 kérdésből álló, ellenőrzött adatbázisból, amelyek 60 százaléka attribútumhibákból származik, 40 százaléka pedig újonnan generált képeken alapul. A feladatok elsőre egyszerűnek tűnnek, például egy óralap szimbólumának helyét kell meghatározni vagy virágokat megszámolni egy képen[^1].
16 csúcskategóriás, úgynevezett Frontier-modellt vizsgáltak, melyek közül a legjobb, a GPT-5.6 Sol, 59,7 százalékos pontosságot ért el. A Kimi K3 58,5, a Claude Fable 5 57,2, míg a Gemini 3.1 Pro 56,2 százalékot teljesített. Az open-source modellek, mint például a Qwen3.5-397B-A17B (47,5%) vagy a GLM-4.6V (32,5%) jelentősen elmaradnak[^1].
“Egyetlen modell sem lépi át az 60 százalékos küszöböt, és az első öt helyezett között is csak négy százalékpont a különbség.”
Bár a modellek összteljesítménye közel azonos, az egyes vizuális képességekben jelentős különbségek tapasztalhatók. A Hallucináció kategória például különösen gyenge: a vezető GPT-5.6 Sol itt csak 26,9 százalékos pontosságot ért el, míg a gyengébb Gemini 3.5 Flash ebben a részfeladatban 50,6 százalékot produkált. Ez a kategória azt méri, hogy a modellek kitalálnak-e nem létező objektumokat, amikor a helyes válasz “nulla” lenne[^1].
A tanulmány szerzői szerint sok, úgynevezett “logikai hibát” valójában már az első, vizuális értelmezési lépésben követnek el a modellek. A PerceptionBench lehetővé teszi, hogy pontosabban diagnosztizálják, melyik vizuális képességnél bukik el az adott modell. Az adatbázis és az értékelő kód nyíltan elérhető a GitHubon[^1].
A vizuális észlelés terén már korábbi benchmarkok is hasonló hiányosságokat mutattak. A WorldVQA teszt szerint például a legjobb modell is csak 47,4 százalékot ért el tisztán vizuális objektumfelismerésben. A BabyVision benchmark alapján pedig az MI-modellek még az óvodás szintű vizuális alapfeladatokban is gyakran kudarcot vallanak: míg az emberi teljesítmény 94,1 százalék, a legjobb MI-modell csak 49,7 százalékot ért el. A kutatók ezt a vizuális információk nyelvi átalakításának veszteségeivel magyarázzák[^1].
Az új PerceptionBench benchmark ismételten megerősíti, hogy a mesterséges intelligencia modellek vizuális érzékelése jelentős fejlesztést igényel. Hiába fejlődnek a modellek a logikai és nyelvi feladatokban, a látás szintjén továbbra is komoly korlátokba ütköznek. Az iparág szereplőinek a jövőben külön figyelmet kell fordítaniuk a vizuális észlelés fejlesztésére, ha valóban megbízható, multimodális MI-rendszereket szeretnének létrehozni.
[^1]: Redaktion THE DECODER (2026-08-15). “Neuer Benchmark bestätigt: KI-Modelle sehen weiterhin schlecht”. THE DECODER. Közzétéve [2026. 08. 15.].