Az MI-benchmarkok megbízhatósága komoly kihívásokkal néz szembe, mivel fennáll annak a veszélye, hogy a modellek a tesztelés előtt már találkoztak a kérdésekkel. A Google Deepmind most egy új, kriptográfiai módszerrel próbálja biztosítani az értékelések tisztaságát, különösen érzékeny területeken, például kiberbiztonságban vagy állami tesztek során.[^1]
Ha egy vizsgázó előre ismeri a kérdéseket, az eredmények torzulnak – ugyanez igaz az MI-modellek esetében is. Amennyiben egy modell a tanulás során már találkozott a tesztkérdésekkel, az értékelés nem tükrözi valós képességeit, így a felhasználók bizalma is meginog.[^1]
A Google Deepmind az első doppelblind, vagyis kettős vak értékelést vezeti be az MI-modellek világában. Ennek lényege, hogy sem az értékelő, sem a modell fejlesztője nem fér hozzá a másik fél szenzitív adataihoz a tesztelés során.[^1]
A Google Cloud Confidential Computing portfóliójából származó Confidential Space technológiát alkalmazzák. Ez kriptográfiai módon garantálja, hogy a tesztkérdések és a modell súlyai mindkét fél számára titkosak maradnak.[^1] Ezzel megszűnik az eddigi kompromisszum: sem a tesztkészítőknek, sem a modell fejlesztőinek nem kell megosztaniuk bizalmas információikat.
Az új módszert a Singapore AI Safety Institute és további partnerek közreműködésével próbálják ki, ahol egy Gemini Flash Lite modellet vizsgálnak titkosított, érzékeny benchmarkokkal.[^1]
Az MI-modellek egyre fontosabb szerepet töltenek be a kiberbiztonságban, az állami rendszerekben és más érzékeny szektorokban. Ezekben a környezetekben létfontosságú, hogy az értékelések valóban megbízhatóak és manipulációtól mentesek legyenek.[^1]
A Google innovatív kriptográfiai módszere áttörést jelenthet az MI-modellek értékelésében, új standardot teremtve az átláthatóság és bizalom terén. Ha a pilotprojekt sikeres, az egész iparág számára lehetővé válik a biztonságosabb, megbízhatóbb AI-fejlesztés és -ellenőrzés.[^1]
[^1]: Maximilian Schreiner (2026. augusztus 28.). “Warum KI-Benchmarks ein Vertrauensproblem haben und wie Google es lösen will”. The Decoder. Közzétéve [2026. 08. 28.].