LLM-hackelés: kutatók képesek chatbot-válaszokból a felhasználói promptot rekonstruálni

Hírek2026.08.12.16 megtekintés

  • A kutatók új módszert fejlesztettek ki, mellyel az MI-chatbotok válaszaiból visszafejthető az eredeti prompt.
  • Az eljárás nem igényli az eredeti modell paramétereinek ismeretét, sőt, idegen modelleken is működik.
  • A technika súlyos biztonsági kockázatokat jelenthet vállalatok és felhasználók számára.

Az IIT Bombay és az Adobe Research kutatói egy új módszert mutattak be, mellyel egy mesterséges intelligencia chatbot válaszaiból szinte teljes pontossággal vissza lehet fejteni az eredeti felhasználói promptot. Az eljárás nem csak saját, de más cégek modelljein is működik, így jelentős adatvédelmi kockázatokat hordoz magában.[^1]

Az új módszer: prompt-rekonstrukció LLM-válaszokból

Az úgynevezett „Previous-Token Prediction” (PTP) technika a hagyományos nyelvi modellezést fordítja meg: míg a nagy nyelvi modellek (LLM-ek) jellemzően a következő szót jósolják meg, az új, inverz modell a válaszból visszafelé próbálja kitalálni az eredeti promptot. Ehhez csupán az MI által generált szövegre van szükség, sem a modell súlyaihoz, sem más belső adatokhoz nem kell hozzáférni.[^1]

Pontos és alternatív promptok egyetlen válaszból

Az inverz modell képes nemcsak az eredeti prompt szinte szóról szóra történő visszaállítására, hanem több, eltérő megfogalmazású, de azonos jelentésű alternatíva generálására is. A kutatók például egy üzleti stratégiára vonatkozó angol kérdésnél hét, jelentésében azonos, de szóhasználatban eltérő promptot rekonstruáltak egyetlen chatbot-válaszból.[^1]

„A rekonstrukciók bár szóhasználatban eltérnek, a felhasználó eredeti szándékát pontosan visszaadják.”

Módszer működése idegen modelleken

A kutatók azt is kimutatták, hogy egy nyílt forráskódú, kisebb modellen (Qwen-3-0.6B-Chat) betanított inverz modell képes a GPT-4o által generált válaszokból is rekonstruálni a promptokat. Ezek a rekonstrukciók ugyan nem szó szerintiek, de jelentésükben és kontextusukban hűek az eredeti kérdéshez. Ez azt jelenti, hogy egy támadónak nem kell tudnia, pontosan melyik MI-modell áll a válasz mögött, hogy visszafejthesse a felhasználói promptot.[^1]

Biztonsági és adatvédelmi aggályok

Az új eljárás jelentős biztonsági kockázatot jelenthet vállalatok és felhasználók számára. Nemcsak bizalmas rendszerpromtokat, üzleti titkokat vagy moderációs szabályokat, hanem érzékeny személyes adatokat is ki lehet nyerni az MI-válaszokból. A kutatás szerint akár egy kis, szabadon elérhető inverz modell is elegendő lehet a prompt-rekonstrukcióhoz.[^1]

Összefoglaló

Az új kutatási eredmények rávilágítanak arra, hogy a mesterséges intelligencia által generált szövegek nemcsak információt adnak, hanem vissza is élhetőek lehetnek, ha nem megfelelően védettek. Modellgyártóknak sürgősen vizsgálniuk kell, hogy módszerük mennyire sérülékeny az ilyen típusú támadásokkal szemben, és szükség esetén gyorsan be kell vezetniük a védelmi intézkedéseket.

Forrás:

[^1]: Matthias Bastian (2026-08-12). “LLM-Hacking: Forscher können aus Chatbot-Antworten den Nutzer-Prompt rekonstrukieren”. THE DECODER. Közzétéve [2026. 08. 12.].

Follow
Keresés Népszerű
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...