A GPT-6 Astra ismét az érdemi MI-fejlődés kérdését helyezi előtérbe

Hírek2026.09.04.13 megtekintés

Röviden:

  • A GPT-6 Astra több teszten jelentős előrelépést mutatott, különösen az ARC-AGI-3 ismeretlen játékkörnyezetében.[^1]
  • A modell az ARC-AGI-3 összehasonlítható standard mérésén 62,7 százalékot ért el, szemben az előd GPT-5.6 Sol 7,8 százalékos eredményével.[^1]
  • A magasabb következtetési szint ennél a tesztnél egyszerre javította az eredményt és csökkentette a futtatási költséget.[^1]
  • François Chollet szerint az eredmény nem bizonyítja az általános mesterséges intelligencia megjelenését, de a fejlődés a vártnál gyorsabb.[^1]

A OpenAI új modellje, a GPT-6 Astra több mérőszámban is erős teljesítményt ért el, miközben a különböző tesztek eredményei továbbra sem rajzolnak ki egyetlen, minden területen domináns modellt. A legnagyobb figyelmet az ARC-AGI-3 eredménye kapta: a rendszernek olyan játékszabályokat és célokat kellett kísérletezéssel feltárnia, amelyeket előre nem magyaráztak el számára.[^1]

A GPT-6 Astra teljesítménye és költségei

A beszámoló szerint a GPT-6 Astra feldolgozott szövegegységenként két és félszer többe kerül, mint a GPT-5.6 Sol, így egy feladat hozzávetőleg 75 százalékkal drágább lehet az elődhöz képest. Programozási feladatoknál ugyanakkor az Artificial Analysis adatai alapján hasonló pontszintet ér el, mint a Claude Fable 5, miközben feladatonként annak költsége kevesebb mint fele lehet.[^1]

A hatékonyság egyik lehetséges oka, hogy az Astra a forrás szerint a Sol számítási lépéseinek körülbelül egyharmadát, az Opus 5 számítási lépéseinek pedig mintegy egyötödét használja. A modell az Epoch ECI összesített értékelésében 169 pontot szerzett, míg az AA Intelligence Indexen 61 ponton állt; utóbbi mutatóban több versenytársa megelőzte.[^1]

Vegyes kép a benchmarkokon

Az Astra több feladattípusban javulást mutatott, de nem minden mérésen teljesített jobban az elődjénél vagy a konkurens rendszereknél. A Coding Agent Indexen 67 pontot ért el, nagyjából a Sol tokenfelhasználásának harmadával, míg a Fable 5.1 70 ponttal vezetett. Az AA-Omniscience tesztben a hallucinációs arány 92 százalékról 51 százalékra csökkent, ugyanakkor a GDPval-AA v2 értékelésében mintegy 80 Élő-pontot veszített, és egyes banki ügyfélszolgálati, tudományos programozási, valamint hosszú kontextusú feladatokban gyengébb eredményt ért el.[^1]

Az Epoch AI FrontierMath Erdős tesztjén az Astra két, Lean rendszerrel ellenőrzött bizonyítást adott a 68 nyitott Erdős-probléma közül, egyenként 300 dolláros próbálkozási keret mellett. Nem szabványos további futtatásokban három további megoldás is született, de ezek a több mint 220 ezer dolláros számítási költség miatt sem kerültek be a hivatalos pontszámba.[^1]

ARC-AGI-3: nagy ugrás ismeretlen szabályrendszerekben

Az ARC-AGI-3 olyan játékkörnyezeteket használ, amelyekben a modell nem kap előzetes leírást a szabályokról vagy a célokról. A rendszernek saját próbálkozásai alapján kell feltárnia, milyen műveletek vezetnek eredményre. A standard, szolgáltatófüggetlen mérési keretben a GPT-6 Astra 62,7 százalékos eredményt ért el, hozzávetőleg 26 ezer dolláros tesztköltség mellett. A Sol 7,78 százalékot, a Claude Opus 5 pedig 30,16 százalékot ért el ugyanitt.[^1]

A OpenAI által közölt 99,9 százalékos eredmény eltérő feltételek között született. Ebben a modell használhatta a vállalat saját keretrendszerét, amely megőrzi az egyes lekérdezések közötti következtetési láncokat, és automatikusan összegzi a hosszú előzményeket. Az ARC Prize szerint ezek a futások 167 összevethető eset alapján mintegy 3,66-szor gyorsabbak voltak, és 49 százalékkal kevesebb tokent használtak, mint a szervezet belső keretrendszerében végzett futtatások.[^1]

„Minden, amit jelenleg tudunk a rendszerről, a benchmarkértékei.” – írta François Chollet, az ARC társalapítója.[^1]

ARC Prize ezért hangsúlyozza, hogy a 62,7 százalékos, belső keretrendszerrel mért érték alkalmasabb a szolgáltatók közötti összehasonlításra. A szervezet a jövőben a gyártói keretrendszerekkel elért eredményeket is közzé kívánja tenni.[^1]

Amikor a nagyobb következtetési erőfeszítés olcsóbb

Az Astra egyik szokatlan eredménye, hogy az ARC-AGI-3 standard környezetében a magasabb következtetési szint nem növelte, hanem csökkentette a költséget. Következtetési mód nélkül a teszt 49 791 dollárba került és 35,2 százalékos eredményt adott, míg maximális következtetési szinten a költség 26 098 dollárra esett, az eredmény pedig 62,7 százalékra emelkedett.[^1]

A magyarázat szerint a modell kevesebb játéklépésből jutott el a megoldásig, ezért kevesebb modellhívásra és tokenre volt szüksége. Az alacsony következtetési szint ugyanakkor 17,5 százalékos eredményt hozott, ami még a következtetési mód nélküli futtatásnál is gyengébb volt; az ARC Prize ezt a kiugró értéket nem magyarázta.[^1]

Saját jelölésrendszer és eszközhasználat

A beszámoló alapján az Astra saját, tömör jegyzetelési rendszert alakított ki a játékok állapotának, az objektumoknak, a koordinátáknak és a lehetséges lépéseknek a rögzítésére. A standard környezetben ez különösen fontos, mert a modellnek minden lényeges információt a számára látható jegyzetekben kell megőriznie.[^1]

François Chollet ezt „rendkívül hatékony, menet közbeni szimbolikus világmodellezésnek” nevezte, és kiemelte, hogy a rendszer saját, játékspecifikus algebrai rövidítést fejlesztett.[^1]

A külső fejlesztésű PRO-LONG keretrendszerben a modell kódot is futtathatott egy elkülönített környezetben. Ebben a felállásban játékonként kisebb programkönyvtárakat, például pályafeldolgozókat, állapotmodelleket, keresőalgoritmusokat és tervezőmodulokat írt. Ezek az eredmények azonban nem hasonlíthatók közvetlenül az emberi tesztelők teljesítményéhez, akik nem kaptak programértelmezőt vagy jegyzetelési lehetőséget.[^1]

Nem AGI-bizonyíték, hanem újabb mérési kihívás

Chollet egyértelművé tette, hogy az ARC-AGI-3 megoldása önmagában nem bizonyítja az általános mesterséges intelligenciát. A benchmark olyan képességeket vizsgál, mint a bizonytalanság melletti feltárás, az útmutatás nélküli alkalmazkodás és a kevés adatból felépített oksági világmodell, de mindezt korlátozott, rövid idejű játékszituációkban teszi.[^1]

A társalapító szerint az Astra hozzávetőleg kétszer gyorsabban érkezett el erre a szintre, mint amire az ARC Prize korábban számított. A szervezet már fejleszti az ARC-AGI-4 benchmarkot, amely a tervek szerint 2027 első negyedévében jelenik meg, és többek között a rekurzív önfejlesztést, valamint a nyitott innovációt vizsgálná.[^1]

Összefoglaló

A GPT-6 Astra eredményei arra utalnak, hogy egyes, korábban különösen nehéznek tartott alkalmazkodási és feltárási feladatokban gyorsul a fejlődés. A mérési eredmények ugyanakkor területenként eltérnek, a költségek erősen függnek a választott keretrendszertől, és a benchmarkok nem helyettesítik a nyílt valós környezetben végzett értékelést. Az újabb tesztek ezért nem végleges választ adnak az általános mesterséges intelligencia kérdésére, hanem pontosabbá teszik azt, hogy milyen képességeket kell még mérni.[^1]

Forrás:

[^1]: The Decoder szerkesztősége (2026. 09. 04.). „GPT-6 Astra rückt die Frage nach echtem KI-Fortschritt wieder in den Mittelpunkt”. The Decoder. Közzétéve [2026. 09. 04. 10:40:36 +0000].

Follow
Keresés Népszerű
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...