GPT-6 Astra: az MI-modell már drónnal követ és automatát vezet

MI ipari alkalmazás2026.09.13.20 megtekintés

  • Az OpenAI GPT-6 Astra modellje az Andon Labs tesztjeiben kiemelkedő eredményt ért el egy értékesítőautomata-szimulációban és egy autonóm drónos feladatcsomagban.[^1]
  • Az értékesítőautomata-benchmarkban az Astra átlagosan 15 515 dolláros záróegyenleget ért el, míg a Claude Fable 5.1 átlaga 5 422 dollár volt.[^2]
  • A drónos benchmark mind az öt részfeladatában született a humán–MI referenciaértéket felülmúló Astra-megoldás, de az egyetlen végig sikeres futás becsült esélye továbbra is csak 2,8 százalék.[^3]

Az Andon Labs két, hosszabb távú önálló cselekvést vizsgáló tesztben értékelte az OpenAI GPT-6 Astra modelljét. Az eredmények egyszerre jelzik az autonóm kereskedelmi döntések és a fizikai rendszerekhez fejlesztett szoftverek gyors fejlődését, miközben a drónos képességek megbízhatósága még messze van a rutinszerű alkalmazhatóságtól.[^1]

GPT-6 Astra az értékesítőautomata kezelésében

A Vending-Bench 2 feladatában a modell 500 dolláros kezdőtőkével működtet egy szimulált értékesítőautomatát egy éven át. Beszállítókat keres, árakról tárgyal, árut rendel, eladási árakat állapít meg, és a lehető legmagasabb számlaegyenleg elérésére törekszik.[^2]

Nagyobb bevétel és fegyelmezettebb beszerzés

Hat futás alapján a GPT-6 Astra átlagos záróegyenlege 15 515 dollár volt. A Claude Fable 5.1 5 422 dolláros átlagot ért el; utóbbi modell legerősebb, 9 874 dolláros futása is elmaradt az Astra leggyengébb, 13 272 dolláros eredményétől.[^2]

A labor elemzése szerint az eltérés egyik oka a beszerzési alkuk kezelése. Egy dokumentált esetben a beszállító 226,32 dollárt kért egy kosárnyi áruért, az Astra azonban kitartott a 108 dolláros ajánlata mellett, amelyet a partner végül elfogadott.[^2]

A beszállítói kockázatoknál is jelentős különbséget mértek. A Fable 5.1 hat futás alatt 45 alkalommal fizetett előre már bezárt beszállítóknak, ami összesen 14 331 dolláros veszteséget okozott. Az Astra 64 beszállítói bezárással találkozott, de az Andon Labs nem azonosított nála ilyen előrefizetésekből eredő veszteséget.[^2]

Árkartelljavaslat elutasítása

A több MI-ügynököt egy helyszínen versenyeztető Vending-Bench Arenában az Astra visszautasította a GLM-5.3 ár-egyeztetési javaslatát. A labor három vizsgált játékban nem észlelt hazugságot az Astránál, amely mindhárom játékot megnyerte.[^4]

„A benchmark nem segít az MI-nek drónokat irányítani, hanem azt méri, hogy a jelenlegi modellek erre már milyen mértékben képesek.” – az Andon Labs válasza a tesztet érő kritikákra.[^5]

A labor az eredmények alapján az Astrát gazdaságilag erősebbnek és a vizsgált helyzetben szabálykövetőbbnek minősítette. Ez a következtetés azonban kifejezetten a benchmark megfigyelt viselkedésére vonatkozik, ezért nem tekinthető minden valós helyzetre érvényes bizonyítéknak.[^4]

GPT-6 Astra és az autonóm drónos felügyelet

A Drone-Bench azt méri, képes-e egy modell olyan kódot készíteni, amellyel egy DJI Tello EDU drón önállóan navigál egy irodában, felismer egy kijelölt személyt, majd követi őt. A feladat öt részből áll: háromdimenziós környezetrekonstrukcióból, drónlokalizációból, navigációból, személyfelismerésből és követésből.[^3]

Először sikerült mind az öt részfeladatban túlszárnyalni a referenciát

Minden részfeladatban tíz futást végeztek, és egy futáson belül a modell legfeljebb tíz kódváltozatot nyújthatott be. Referenciaként egy ember által, programozóügynökök segítségével készített demó kódja szolgált.[^3]

Az Andon Labs szerint a GPT-6 Astra az első tesztelt modell, amelynek legjobb beadásai mind az öt részfeladatban felülmúlták ezt a humán–MI alapvonalat. A korábban megoldatlan háromdimenziós rekonstrukcióhoz az Astra COLMAP- és DA3-alapú, mélységszűréssel kiegészített eljárást állított össze.[^3]

A legjobb eredmény nem azonos a megbízhatósággal

A részfeladatok eredményei erős ingadozást mutattak. A személyfelismerésben az Astra tízből négy futásban, a háromdimenziós rekonstrukcióban pedig csupán tízből egy futásban haladta meg a referenciaértéket. Az egyes sikerrátákból a labor 2,8 százalékra becsülte annak valószínűségét, hogy egy átlagos Astra-futás mind az öt lépést egymás után sikerrel teljesíti.[^3]

Az Andon Labs bemutatójában az Astra egyetlen utasításra bejárta az irodát, azonosította a megadott személyt, majd követte őt. A labor szerint a tesztben a térérzékelés, a navigáció és a személy követése emberi beavatkozás nélkül kapcsolódott össze.[^5]

Összefoglaló: gyors képességnövekedés, nyitott biztonsági kérdések

A GPT-6 Astra teljesítménye azt mutatja, hogy az általános célú MI-modellek egyre összetettebb gazdasági és fizikai környezetekben is képesek működő megoldásokat előállítani. A drónos teszt alacsony teljes végrehajtási aránya ugyanakkor azt jelzi, hogy a látványos csúcseredmény még nem jelent kiszámítható, sorozatosan ismételhető autonómiát.[^3]

A labor szerint a nyilvánosságnak és a jogalkotóknak még azelőtt meg kell ismerniük ezeket a képességeket, hogy az MI-vel vezérelt drónok emberfeletti navigációs teljesítményt érnének el. A Drone-Bench-hez nem biztosítanak külső hozzáférést, és az értékeléseket maga az Andon Labs futtatja, hogy a fejlesztők ne hangolhassák célzottan modelljeiket a tesztre.[^5]

Forrás:

[^1]: THE DECODER (2026. 09. 13.). „GPT-6 Astra taugt als Überwachungsdrohnen-Pilot und als autonomer Händler”. THE DECODER. Közzétéve 2026. 09. 13..

[^2]: Andon Labs (2026. 09. 13.). „GPT-6 Astra Vending-Bench”. Andon Labs. Közzétéve 2026. 09. 13..

[^3]: Andon Labs (2026. 09. 13.). „Drone-Bench”. Andon Labs. Közzétéve 2026. 09. 13..

[^4]: Andon Labs (2026. 09. 13.). „Vending-Bench Arena”. Andon Labs. Közzétéve 2026. 09. 13..

[^5]: Andon Labs (2026. 09. 13.). „Drone-Bench demonstráció”. X. Közzétéve 2026. 09. 13..

Follow
Keresés Népszerű
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...