Új benchmark igazolja: az MI-modellek továbbra is gyengék a vizuális felismerésben

Hírek2026.08.15.26 megtekintés

  • Az új PerceptionBench teszt szerint egyetlen csúcskategóriás MI-modell sem éri el a 60 százalékos pontosságot a vizuális feladatokban.
  • A kutatás megmutatta, hogy az MI-modellek vizuális érzékelése jelentős hiányosságokat mutat, függetlenül a logikai következtetéstől.
  • Több különböző benchmark is hasonló eredményre jutott korábban.

Moonshot AI új PerceptionBench nevű benchmarkja alaposan feltérképezi a mesterséges intelligencia modellek vizuális észlelési képességeit, elkülönítve azokat a logikai gondolkodástól. Az eredmények szerint a jelenlegi legfejlettebb modellek sem képesek túlszárnyalni az 60 százalékos pontosságot ezen a speciális teszten, ami rávilágít a technológia korlátaira.

Az új PerceptionBench: a vizuális érzékelés részletes vizsgálata

Moonshot AI kutatócsapata bemutatta az PerceptionBench tesztet, amely kifejezetten a multimodális nyelvi modellek vizuális észlelését méri fel. A PerceptionBench tíz alapvető vizuális részfeladatra bontja le a látást, kizárva a logikai gondolkodást és a háttértudást. Így minden kérdésre kizárólag a kép alapján kell válaszolni, logikai érvelés nélkül[^1].

Kategóriák és módszertan

Az új benchmark kategóriáit valós modellhibákból, nem elméleti megközelítésből alakították ki. A teszt 3 000 feladatot tartalmaz egy 17 000 kérdésből álló, ellenőrzött adatbázisból, amelyek 60 százaléka attribútumhibákból származik, 40 százaléka pedig újonnan generált képeken alapul. A feladatok elsőre egyszerűnek tűnnek, például egy óralap szimbólumának helyét kell meghatározni vagy virágokat megszámolni egy képen[^1].

A csúcstechnológiás modellek eredményei a PerceptionBench-en

16 csúcskategóriás, úgynevezett Frontier-modellt vizsgáltak, melyek közül a legjobb, a GPT-5.6 Sol, 59,7 százalékos pontosságot ért el. A Kimi K3 58,5, a Claude Fable 5 57,2, míg a Gemini 3.1 Pro 56,2 százalékot teljesített. Az open-source modellek, mint például a Qwen3.5-397B-A17B (47,5%) vagy a GLM-4.6V (32,5%) jelentősen elmaradnak[^1].

“Egyetlen modell sem lépi át az 60 százalékos küszöböt, és az első öt helyezett között is csak négy százalékpont a különbség.”

Kategóriánkénti eltérések

Bár a modellek összteljesítménye közel azonos, az egyes vizuális képességekben jelentős különbségek tapasztalhatók. A Hallucináció kategória például különösen gyenge: a vezető GPT-5.6 Sol itt csak 26,9 százalékos pontosságot ért el, míg a gyengébb Gemini 3.5 Flash ebben a részfeladatban 50,6 százalékot produkált. Ez a kategória azt méri, hogy a modellek kitalálnak-e nem létező objektumokat, amikor a helyes válasz “nulla” lenne[^1].

A vizuális érzékelés, mint önálló kihívás az MI számára

A tanulmány szerzői szerint sok, úgynevezett “logikai hibát” valójában már az első, vizuális értelmezési lépésben követnek el a modellek. A PerceptionBench lehetővé teszi, hogy pontosabban diagnosztizálják, melyik vizuális képességnél bukik el az adott modell. Az adatbázis és az értékelő kód nyíltan elérhető a GitHubon[^1].

Visszatérő problémák: miért stagnál a fejlődés?

A vizuális észlelés terén már korábbi benchmarkok is hasonló hiányosságokat mutattak. A WorldVQA teszt szerint például a legjobb modell is csak 47,4 százalékot ért el tisztán vizuális objektumfelismerésben. A BabyVision benchmark alapján pedig az MI-modellek még az óvodás szintű vizuális alapfeladatokban is gyakran kudarcot vallanak: míg az emberi teljesítmény 94,1 százalék, a legjobb MI-modell csak 49,7 százalékot ért el. A kutatók ezt a vizuális információk nyelvi átalakításának veszteségeivel magyarázzák[^1].

Összefoglaló

Az új PerceptionBench benchmark ismételten megerősíti, hogy a mesterséges intelligencia modellek vizuális érzékelése jelentős fejlesztést igényel. Hiába fejlődnek a modellek a logikai és nyelvi feladatokban, a látás szintjén továbbra is komoly korlátokba ütköznek. Az iparág szereplőinek a jövőben külön figyelmet kell fordítaniuk a vizuális észlelés fejlesztésére, ha valóban megbízható, multimodális MI-rendszereket szeretnének létrehozni.

Forrás:

[^1]: Redaktion THE DECODER (2026-08-15). “Neuer Benchmark bestätigt: KI-Modelle sehen weiterhin schlecht”. THE DECODER. Közzétéve [2026. 08. 15.].

Follow
Keresés Népszerű
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...