Az IIT Bombay és az Adobe Research kutatói egy új módszert mutattak be, mellyel egy mesterséges intelligencia chatbot válaszaiból szinte teljes pontossággal vissza lehet fejteni az eredeti felhasználói promptot. Az eljárás nem csak saját, de más cégek modelljein is működik, így jelentős adatvédelmi kockázatokat hordoz magában.[^1]
Az úgynevezett „Previous-Token Prediction” (PTP) technika a hagyományos nyelvi modellezést fordítja meg: míg a nagy nyelvi modellek (LLM-ek) jellemzően a következő szót jósolják meg, az új, inverz modell a válaszból visszafelé próbálja kitalálni az eredeti promptot. Ehhez csupán az MI által generált szövegre van szükség, sem a modell súlyaihoz, sem más belső adatokhoz nem kell hozzáférni.[^1]
Az inverz modell képes nemcsak az eredeti prompt szinte szóról szóra történő visszaállítására, hanem több, eltérő megfogalmazású, de azonos jelentésű alternatíva generálására is. A kutatók például egy üzleti stratégiára vonatkozó angol kérdésnél hét, jelentésében azonos, de szóhasználatban eltérő promptot rekonstruáltak egyetlen chatbot-válaszból.[^1]
„A rekonstrukciók bár szóhasználatban eltérnek, a felhasználó eredeti szándékát pontosan visszaadják.”
A kutatók azt is kimutatták, hogy egy nyílt forráskódú, kisebb modellen (Qwen-3-0.6B-Chat) betanított inverz modell képes a GPT-4o által generált válaszokból is rekonstruálni a promptokat. Ezek a rekonstrukciók ugyan nem szó szerintiek, de jelentésükben és kontextusukban hűek az eredeti kérdéshez. Ez azt jelenti, hogy egy támadónak nem kell tudnia, pontosan melyik MI-modell áll a válasz mögött, hogy visszafejthesse a felhasználói promptot.[^1]
Az új eljárás jelentős biztonsági kockázatot jelenthet vállalatok és felhasználók számára. Nemcsak bizalmas rendszerpromtokat, üzleti titkokat vagy moderációs szabályokat, hanem érzékeny személyes adatokat is ki lehet nyerni az MI-válaszokból. A kutatás szerint akár egy kis, szabadon elérhető inverz modell is elegendő lehet a prompt-rekonstrukcióhoz.[^1]
Az új kutatási eredmények rávilágítanak arra, hogy a mesterséges intelligencia által generált szövegek nemcsak információt adnak, hanem vissza is élhetőek lehetnek, ha nem megfelelően védettek. Modellgyártóknak sürgősen vizsgálniuk kell, hogy módszerük mennyire sérülékeny az ilyen típusú támadásokkal szemben, és szükség esetén gyorsan be kell vezetniük a védelmi intézkedéseket.
[^1]: Matthias Bastian (2026-08-12). “LLM-Hacking: Forscher können aus Chatbot-Antworten den Nutzer-Prompt rekonstrukieren”. THE DECODER. Közzétéve [2026. 08. 12.].