
Az AllSpark kínai kutatólabor két, webes információkeresésre optimalizált mesterségesintelligencia-modellt mutatott be. Az Iris-mini és az Iris-pro a Qwen modellcsaládra épül, 256 ezer tokenes kontextusablakkal dolgozik, és nyílt súlyú formában érhető el.[^1]
Az Iris-mini a Qwen3.6-35B-A3B alapmodellre épül, és 35 milliárd paraméteres, míg az Iris-pro alapja a Qwen3.5-397B-A17B, paraméterszáma pedig 397 milliárd. A két modell feladata nem csupán dokumentumok megtalálása, hanem a több forrásból származó bizonyítékok összekapcsolása és az összetett kérdések megválaszolása.[^1]
A fejlesztők olyan adatépítési folyamatot alkalmaztak, amely a weboldalak hivatkozási struktúrájából indul ki. Egy kiinduló oldal és az onnan elérhető linkek alapján fogalmakból, illetve kapcsolatokból álló hálót hoznak létre, majd ebből több lépéses kérdést képeznek.[^1]
A kérdésben a végső válaszon kívüli fogalmakat körülírásokkal helyettesítik. Így a megoldás nem szerezhető meg egyszerű kulcsszavas kereséssel: az ügynöknek következtetnie kell, és össze kell fűznie a releváns forrásokat. A rendszer csak olyan feladatokat tart meg, amelyeket egy referencia-modell külső eszközök nélkül nem, megfelelő forrásokkal viszont már meg tud oldani.[^1]
Egy erősebb tanítói modell megoldási útvonalakat készít, amelyek érvelési lépéseket, keresőkérdéseket és találatokat is tartalmaznak. Ezeket először teljes folyamatként szűrik a helyesség, az ismétlődő ciklusok és a keresés mélysége alapján, majd egy ellenőrző modell lépésenként is értékeli őket.[^1]
„SFT-RL climbing”
Az AllSpark ezzel a névvel illeti azt az eljárást, amelyben a felügyelt finomhangolás és a megerősítéses tanulás váltakozik. Az egyes körök legnehezebb, de hatékonyan megoldott keresési útvonalai bekerülnek a következő tanítási fordulóba.[^1]
A megerősítéses tanítás valós webes keresést használ, miközben az értékelő modell és a keresési találatok összegzése a tanítási klaszterben fut. A csapat saját nagyméretű Qwen-modellt alkalmazott azért, hogy a tanítás során ne legyen szükség külső szolgáltatásra.[^1]
A kutatók szerint a hosszú keresési feladatoknál a kontextuskezelés jelentősen befolyásolhatja az eredményeket. Ha az ügynök a részfeladatok lezárása előtt eléri a kontextusablak korlátját, a keresés félbeszakadhat, vagy a rendszernek kezelnie kell a korábbi előzményeket.[^1]
Ezért az AllSpark minden benchmarkot kontextuskezeléssel és anélkül is tesztelt, miközben a használt eszközöket, a kontextuskorlátot és az értékelő modellt változatlanul hagyta. A közzétett Iris-eredmények egyetlen ügynöktől származnak, segédügynökök és utólagos ellenőrzési lépések nélkül.[^1]
Aktív kontextuskezeléssel az Iris-mini a BrowseComp, a BrowseComp-ZH, a DeepSearchQA és a Humanity’s Last Exam teszteken rendre 82,2, 84,8, 86,9 és 52,3 pontos eredményt ért el. Az Iris-pro ugyanezeken a benchmarkokon 88,6, 85,1, 92,9 és 56,4 pontot szerzett.[^1]
A kontextuskezelés különösen az Iris-mini esetében hozott nagy javulást: BrowseCompon a különbség elérte a 21,2 pontot. A jelentés szerint ez elsősorban abból következik, hogy a kisebb modell több lépést használ ugyanazon feladatokhoz, ezért gyorsabban fogyasztja el a rendelkezésre álló kontextust.[^1]
A kutatás egy BrowseComp-ZH példát is bemutat, amelyben a hivatalos értékelőkulcs és a forrásanyag ellentmondásba került. A Game of Thrones sorozatra vonatkozó kérdésnél az ügynök a „Bolton” választ adta, míg a referencia-válasz „Lannister” volt. A fejlesztők szerint az ügynök válasza helyes, mert Sansa Stark második házasságában Ramsay Bolton felesége lett.[^1]
Az eset arra utal, hogy a benchmarkok pontszámai nem mindig választják el hibátlanul a modell hibáját az értékelőkulcs hibájától. Az AllSpark ezt az érvet új, megbízhatóbban ellenőrizhető keresési benchmarkok fejlesztésének indokaként említi.[^1]
A szerzők arról is beszámoltak, hogy a kereséshez előállított tanítóadatok és a specializált modellek pozitív hatást mutattak olyan feladatoknál is, amelyekre nem közvetlenül tanították őket, például általános eszközhasználatban és irodai munkafolyamatokban.[^1]
Az Iris-mini és az Iris-pro modelljei az AllSpark Hugging Face-gyűjteményében érhetők el. A GitHubon közzétett Iris-Harness tartalmazza az ügynökciklust, az eszközöket, a kontextuskezelési stratégiákat, valamint a négy benchmark értékelését. A keretrendszer bármely OpenAI-kompatibilis végponttal használható.[^2][^3]
Az Iris-mini és az Iris-pro kiadása a nyílt súlyú keresőügynökök fejlődésének fontos lépése lehet. A bemutatott eredmények alapján a modellméret, a tanítási módszer és a futásidejű kontextuskezelés együtt határozza meg a teljesítményt. A nyilvános súlyok és eszközök lehetővé teszik a független reprodukciót, miközben a még hiányzó adatépítési és tanítási pipeline korlátozza a teljes folyamat átláthatóságát.[^1][^2][^3]
[^1]: The Decoder (2026. 09. 13.). „Iris-mini und Iris-pro: Stärkste offene Suchagenten ihrer Klasse stehen jetzt als Open-Weight-Modelle bereit”. The Decoder. Közzétéve 2026. 09. 13.
[^2]: AllSpark Research. „Iris”. Hugging Face. Közzétéve 2026. 09. 13.
[^3]: AllSpark Research. „Iris”. GitHub. Közzétéve 2026. 09. 13.