A Wharton School kutatócsoportja friss tanulmányában azt vizsgálta, mennyire megbízhatóan működnek az MI-shopping agentek, ha termékeket kell ajánlaniuk különböző keresési feltételek és bemeneti információk mellett. Az eredmények szerint már apróbb változások is jelentősen befolyásolják az ajánlásokat, így az MI-agentek jelenleg nem tekinthetők objektív vásárlási tanácsadónak.[^1]
A kutatók hat, jelenleg elérhető MI-modellt teszteltek az Agentic e-Commerce Simulator (ACES) rendszerrel. A feladat az volt, hogy egy adott kínálatból válasszanak fitness órát. Már az is kiderült, hogy az agentek különböző alappreferenciákkal rendelkeznek, de az igazán nagy eltérések akkor jelentkeztek, amikor a modell egyetlen külső információs forrást (például Reddit-posztot vagy szakmai cikket) kapott a termékoldal előtt. Egyes források, különösen a Wirecutter, akár 99 százalékpontos eltolódást is okoztak a választásban bizonyos modelleknél.
„Wirecutter volt a legerősebb hatású: Claude Opus 4.8 esetében 90, Gemini 3.5 Flash-nél pedig 99 százalékpontos eltolódást okozott a Fitbit Inspire 3 javára.”
A kombinációk sem javítottak a helyzeten: ha két vagy három forrásból álló információcsomagot adtak a modellnek, akkor sem váltak kiegyensúlyozottabbá az ajánlások. Ha a Wirecutter szerepelt a források között, akkor szinte minden esetben ez a forrás dominált, míg más kombinációknak alig volt hatása.
Még ugyanazon források eltérő sorrendű bemutatása is jelentősen befolyásolta az ajánlások kimenetelét. Egyes modelleknél, például Gemini 3.1 Flash Lite esetén, az ajánlott termék valószínűsége 2 és 56 százalékpont között ingadozott a sorrend függvényében. Más modellek (például Claude Haiku 4.5) stabilabbak voltak, de még itt is voltak változások.
A kutatók továbbá azt is vizsgálták, hogy egy objektíven legjobb termék (pl. olcsó, minden paraméterben kimagasló óra) ajánlása mennyiben változik, ha a rendszer rövid felhasználói memóriát is kap (például: „Szeretek túrázni!”). Az eredmények szerint a modellek többsége elmozdult a drágább, kevésbé előnyös alternatívák felé, szemben az objektíven legjobb választással.
„A felhasználói memória rövid állításai, mint például ‘I love hiking!’, a legtöbb modellnél a drágább termékek irányába tolták el a választást.”
Kivétel volt például a Gemini 3.5 Flash modell, amely továbbra is az objektíven legjobb terméket választotta, de a legtöbb agentre nem volt jellemző ilyen stabilitás.
A kutatás összefoglalója szerint a jelenlegi MI-shopping agentek ajánlásai nem elég konzisztenssek ahhoz, hogy megbízható, objektív vásárlási döntést hozzanak. Két azonos kereséssel rendelkező felhasználó, vagy akár ugyanaz a felhasználó két különböző időpontban is teljesen eltérő ajánlásokat kaphat – mindezt anélkül, hogy látható ok állna a háttérben. Ez jelentős eltérés ahhoz képest, amit a felhasználók elvárnának egy MI-alapú tanácsadótól.[^1]
Az eladók számára ez azt jelenti, hogy a hagyományos keresőoptimalizálásnál jóval összetettebb feladat lehet az MI-agentekre szabott optimalizálás, hiszen nem tudni, melyik modell választ, mit olvasott előtte, vagy hogyan dolgozza fel az információkat.
Az MI-shopping agentek jelenlegi formájukban nem biztosítanak megbízható, objektív vásárlási ajánlásokat. Az ajánlások érzékenyek a bemeneti forrásokra, azok sorrendjére, és a felhasználói memóriákra. Így sem a fogyasztók, sem az eladók nem támaszkodhatnak teljes mértékben az MI-alapú vásárlási tanácsadásra – legalábbis a mostani modellek mellett.
[^1]: Allouah et al. (2026. 08. 27). “KI-Shopping-Agenten taugen laut Studie noch nicht als objektiver Einkaufsberater”. The Decoder. Közzétéve [2026. 08. 27.].