Az OpenAI új GPT-6 Astra modellje a vállalat rendszerkártyája szerint kevesebb ténybeli hibát produkál, és több biztonsági mérésben is felülmúlja a GPT-5.6 Sol modellt. A javulás ellenére a külső dokumentumokban, weboldalakban vagy más feldolgozott tartalmakban elrejtett utasítások továbbra is befolyásolhatják a modellt. Ez különösen az olyan MI-ügynököknél jelent kockázatot, amelyek kódot írnak, eszközöket kezelnek vagy számítógépes műveleteket hajtanak végre.[^1]
Az OpenAI a GPT-6 Astra hallucinációs arányát olyan ChatGPT-beszélgetéseken vizsgálta, amelyeket a felhasználók pontatlan állítások miatt jelentettek. Ezek szándékosan hibára hajlamos esetek, ezért a vállalat hangsúlyozza, hogy nem tekinthetők a hétköznapi használat átlagos mintájának.[^1]
A rendszerkártya alapján az Astra ezekben a beszélgetésekben jóval ritkábban ismételte meg a korábban jelentett hibákat, mint a GPT-5.6 Sol. A különbség különösen rövid válaszidő és alacsonyabb következtetési beállítás mellett volt látványos.[^1]
„Az új Astra-modell a GPT-5.6 Sol elődjénél lényegesen kevesebb ténybeli hibát produkál” – foglalja össze az OpenAI rendszerkártyájára hivatkozó elemzés.[^1]
A közvetlen promptinjekció olyan támadás, amelyben a felhasználó a saját utasításával próbálja felülírni vagy eltéríteni a modell szabályait. Az OpenAI mérése szerint a GPT-6 Astra ezekkel a kísérletekkel szemben 99,99%-os eredményt ért el.[^1]
A vállalat a modell megerősítéséhez a GPT-Red eljárást alkalmazta: ebben egy automatizált támadó rendszeresen támadási stratégiákat generál, hogy a fejlesztés során feltárja és csökkentse a sebezhetőségeket.[^1]
A jailbreaktesztekben a támadók biológiai, erőszakos vagy kiberbiztonsági témájú, potenciálisan káros válaszokat próbáltak kiváltani. Egy rögzített, ismert támadásokból álló tesztkészlet esetén az Astra az esetek 91,5–98,3%-ában megtagadta a segítséget.[^1]
Az eredmény romlott, amikor a támadók több beszélgetési fordulón át módosíthatták a taktikájukat. Magas támadói erőforráskeret mellett az Astra megközelítőleg 67%-os sikerességet ért el, vagyis a modell nagyjából minden harmadik esetben legalább egyszer problémás választ adott. A korábbi modellek hasonló mérésben 50% alatti eredményt értek el.[^1]
Az OpenAI szerint ezeket a teszteket az alapmodellen végezték, nem pedig a tényleges termékben működő további védelmi rétegekkel, például osztályozókkal együtt.[^1]
Az indirekt promptinjekció során a rosszindulatú utasítás nem közvetlenül a felhasználótól érkezik, hanem például egy megnyitott dokumentumba, e-mailbe vagy weboldalba van beágyazva. Az ilyen tartalom feldolgozásakor a modell az eredeti feladat helyett a rejtett utasítást követheti.[^1]
A Gray Swan 1 810 válogatott támadást tartalmazó IPI Arena tesztjében, forgatókönyvenként 15 próbálkozással, a GPT-6 Astrát az esetek 8,5%-ában legalább egyszer sikerült eltéríteni. A GPT-5.6 Solnál ez az arány 27% volt. A Anthropic Claude Opus 5 modellje 4,8%-os eredményt ért el ugyanebben az értékelésben, de ez a modell sem bizonyult teljesen ellenállónak.[^1][^2]
Az eltérő tesztkészletek és következtetési beállítások érdemben befolyásolhatják az összehasonlításokat. Az Anthropic korábban egy könnyebb, első negyedéves teszt alapján 2%-os sikeres támadási arányról számolt be az Opus 5 esetében, miközben a kombinált első és második negyedéves mérésben magasabb arányok jelentek meg.[^1][^3]
A rejtett utasítások kockázata akkor válik különösen súlyossá, ha egy MI-ügynök nemcsak szöveget állít elő, hanem jogosultságokkal és műveleti képességekkel is rendelkezik. Egy kompromittált ügynök adatokat szivárogtathat ki, jogosulatlan tranzakciót indíthat vagy adatokat törölhet, ha hozzáfér a megfelelő rendszerekhez.[^1]
A vállalati telepítésben ezért a modell biztonsági képességei önmagukban nem elegendők. A hozzáférési jogosultságok szűkítése, a műveletek emberi jóváhagyása, a megbízhatatlan dokumentumok elkülönítése, a kimenetek ellenőrzése és a naplózás egyaránt csökkentheti az indirekt promptinjekciók következményeit.
A GPT-6 Astra érzékelhető előrelépést mutat a ténybeli pontosság és a közvetlen manipulációs kísérletekkel szembeni ellenállás terén. A többfordulós jailbreakek és főként a külső tartalmakba rejtett promptinjekciók eredményei ugyanakkor azt mutatják, hogy az autonómabb MI-ügynökök biztonságos alkalmazása még nem tekinthető megoldott problémának. A modellek fejlődését ezért továbbra is technikai, szervezeti és hozzáférés-kezelési védelmi intézkedésekkel kell kiegészíteni.
[^1]: THE DECODER (2026. 09. 04.). „OpenAIs GPT-6 Astra halluziniert weniger, bleibt aber anfällig für versteckte Prompt-Injections”. THE DECODER. Közzétéve [2026. 09. 04. 17:12:35 +0000].
[^2]: Gray Swan (2026). „IPI Arena”. arXiv. Közzétéve [2026. 09. 04.].
[^3]: THE DECODER. „Opus 5 ist laut Anthropic kaum noch anfällig für Prompt-Injection-Angriffe”. THE DECODER. Közzétéve [2026. 09. 04.].