Az OpenAI GPT-6 Astra kevesebbet hallucinál, de a rejtett promptinjekciók továbbra is kockázatot jelentenek

Hírek2026.09.05.14 megtekintés

Röviden:

  • Az OpenAI szerint a GPT-6 Astra a korábbi GPT-5.6 Solnál ritkábban ismétel meg felhasználók által jelentett ténybeli hibákat.[^1]
  • A modell a közvetlen promptinjekciós teszteken 99,99%-os eredményt ért el, az alkalmazkodó, többfordulós jailbreakkísérletekkel szemben azonban körülbelül 67%-os sikerességet mutatott.[^1]
  • A Gray Swan vizsgálatában a rejtett, dokumentumokba ágyazott promptinjekciók az esetek 8,5%-ában legalább egyszer sikerrel jártak a GPT-6 Astra ellen.[^1]
  • Az eredmények azt jelzik, hogy az önállóan eszközöket használó MI-ügynökök vállalati alkalmazásához továbbra is többrétegű védelem szükséges.

Bevezető: javuló megbízhatóság, fennmaradó biztonsági rés

Az OpenAI új GPT-6 Astra modellje a vállalat rendszerkártyája szerint kevesebb ténybeli hibát produkál, és több biztonsági mérésben is felülmúlja a GPT-5.6 Sol modellt. A javulás ellenére a külső dokumentumokban, weboldalakban vagy más feldolgozott tartalmakban elrejtett utasítások továbbra is befolyásolhatják a modellt. Ez különösen az olyan MI-ügynököknél jelent kockázatot, amelyek kódot írnak, eszközöket kezelnek vagy számítógépes műveleteket hajtanak végre.[^1]

A GPT-6 Astra kevesebb hallucinációt mutat

Az OpenAI a GPT-6 Astra hallucinációs arányát olyan ChatGPT-beszélgetéseken vizsgálta, amelyeket a felhasználók pontatlan állítások miatt jelentettek. Ezek szándékosan hibára hajlamos esetek, ezért a vállalat hangsúlyozza, hogy nem tekinthetők a hétköznapi használat átlagos mintájának.[^1]

A rendszerkártya alapján az Astra ezekben a beszélgetésekben jóval ritkábban ismételte meg a korábban jelentett hibákat, mint a GPT-5.6 Sol. A különbség különösen rövid válaszidő és alacsonyabb következtetési beállítás mellett volt látványos.[^1]

„Az új Astra-modell a GPT-5.6 Sol elődjénél lényegesen kevesebb ténybeli hibát produkál” – foglalja össze az OpenAI rendszerkártyájára hivatkozó elemzés.[^1]

Promptinjekciók és jailbreakek elleni védelem

A közvetlen támadásokkal szemben közel teljes védelem

A közvetlen promptinjekció olyan támadás, amelyben a felhasználó a saját utasításával próbálja felülírni vagy eltéríteni a modell szabályait. Az OpenAI mérése szerint a GPT-6 Astra ezekkel a kísérletekkel szemben 99,99%-os eredményt ért el.[^1]

A vállalat a modell megerősítéséhez a GPT-Red eljárást alkalmazta: ebben egy automatizált támadó rendszeresen támadási stratégiákat generál, hogy a fejlesztés során feltárja és csökkentse a sebezhetőségeket.[^1]

A kitartó, többfordulós támadók már nagyobb eséllyel járnak sikerrel

A jailbreaktesztekben a támadók biológiai, erőszakos vagy kiberbiztonsági témájú, potenciálisan káros válaszokat próbáltak kiváltani. Egy rögzített, ismert támadásokból álló tesztkészlet esetén az Astra az esetek 91,5–98,3%-ában megtagadta a segítséget.[^1]

Az eredmény romlott, amikor a támadók több beszélgetési fordulón át módosíthatták a taktikájukat. Magas támadói erőforráskeret mellett az Astra megközelítőleg 67%-os sikerességet ért el, vagyis a modell nagyjából minden harmadik esetben legalább egyszer problémás választ adott. A korábbi modellek hasonló mérésben 50% alatti eredményt értek el.[^1]

Az OpenAI szerint ezeket a teszteket az alapmodellen végezték, nem pedig a tényleges termékben működő további védelmi rétegekkel, például osztályozókkal együtt.[^1]

A rejtett promptinjekciók továbbra is veszélyesek

Az indirekt promptinjekció során a rosszindulatú utasítás nem közvetlenül a felhasználótól érkezik, hanem például egy megnyitott dokumentumba, e-mailbe vagy weboldalba van beágyazva. Az ilyen tartalom feldolgozásakor a modell az eredeti feladat helyett a rejtett utasítást követheti.[^1]

A Gray Swan 1 810 válogatott támadást tartalmazó IPI Arena tesztjében, forgatókönyvenként 15 próbálkozással, a GPT-6 Astrát az esetek 8,5%-ában legalább egyszer sikerült eltéríteni. A GPT-5.6 Solnál ez az arány 27% volt. A Anthropic Claude Opus 5 modellje 4,8%-os eredményt ért el ugyanebben az értékelésben, de ez a modell sem bizonyult teljesen ellenállónak.[^1][^2]

Az eltérő tesztkészletek és következtetési beállítások érdemben befolyásolhatják az összehasonlításokat. Az Anthropic korábban egy könnyebb, első negyedéves teszt alapján 2%-os sikeres támadási arányról számolt be az Opus 5 esetében, miközben a kombinált első és második negyedéves mérésben magasabb arányok jelentek meg.[^1][^3]

Miért fontos ez az MI-ügynökök vállalati használatában?

A rejtett utasítások kockázata akkor válik különösen súlyossá, ha egy MI-ügynök nemcsak szöveget állít elő, hanem jogosultságokkal és műveleti képességekkel is rendelkezik. Egy kompromittált ügynök adatokat szivárogtathat ki, jogosulatlan tranzakciót indíthat vagy adatokat törölhet, ha hozzáfér a megfelelő rendszerekhez.[^1]

A vállalati telepítésben ezért a modell biztonsági képességei önmagukban nem elegendők. A hozzáférési jogosultságok szűkítése, a műveletek emberi jóváhagyása, a megbízhatatlan dokumentumok elkülönítése, a kimenetek ellenőrzése és a naplózás egyaránt csökkentheti az indirekt promptinjekciók következményeit.

Összefoglaló

A GPT-6 Astra érzékelhető előrelépést mutat a ténybeli pontosság és a közvetlen manipulációs kísérletekkel szembeni ellenállás terén. A többfordulós jailbreakek és főként a külső tartalmakba rejtett promptinjekciók eredményei ugyanakkor azt mutatják, hogy az autonómabb MI-ügynökök biztonságos alkalmazása még nem tekinthető megoldott problémának. A modellek fejlődését ezért továbbra is technikai, szervezeti és hozzáférés-kezelési védelmi intézkedésekkel kell kiegészíteni.

Forrás:

[^1]: THE DECODER (2026. 09. 04.). „OpenAIs GPT-6 Astra halluziniert weniger, bleibt aber anfällig für versteckte Prompt-Injections”. THE DECODER. Közzétéve [2026. 09. 04. 17:12:35 +0000].

[^2]: Gray Swan (2026). „IPI Arena”. arXiv. Közzétéve [2026. 09. 04.].

[^3]: THE DECODER. „Opus 5 ist laut Anthropic kaum noch anfällig für Prompt-Injection-Angriffe”. THE DECODER. Közzétéve [2026. 09. 04.].

Follow
Keresés Népszerű
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...