Az Alibaba legújabb mesterséges intelligencia modellje, az Qwen3.8 Max, jelentős előrelépést mutat a teljesítményben, ugyanakkor új kihívásokkal is szembesül. Az Artificial Analysis Intelligence Indexen elért 56 pontjával 10 ponttal múlja felül az előző generációs Qwen3.7 Maxot, azonban a működése lassabb és drágább lett, miközben a találgatás aránya is megnőtt.[^1]
Az Artificial Analysis Intelligence Index szerint az Qwen3.8 Max a második helyen áll, megegyezve Claude Opus 4.8 modelljével, és megelőzve GLM-5.2-t (51 pont), de lemaradva Kimi K3-tól (57 pont).[^1] Ez utóbbi ráadásul 25 százalékkal olcsóbban működik.
Az úgynevezett GDPval-AA tesztben az Qwen3.8 Max 468 Elo ponttal javított, elérve az 1739-et, amivel megelőzi Kimi K3-at (1685), de elmarad Claude Opus 5-től (1852). Figyelemre méltó azonban, hogy a feladatonkénti munkafolyamatban 64 lépést igényel, míg a korábbi verzió csak 14-et. Ez a tesztben azért történik, mert minden lépésnél a teljes előző beszélgetési előzményt visszaküldik a modellnek, így a bemeneti tokenek száma is tizenötszörösére nő.[^1]
Bár a tokenek ára csökkent (2 dollár/millió bemeneti token, 6 dollár/millió kimeneti token, cache találat: 0,25 dollár), a teljes feladatonkénti költség jelentősen emelkedett. Egy Intelligence Index feladat most 1,14 dollárba kerül, több mint duplája a Qwen3.7 Max költségének (0,53 dollár). Az Kimi K3 egy ponttal többet ér el, de csak 0,86 dollárba kerül feladatonként, míg GLM-5.2 0,57 dollárba.[^1]
Az új verzióval bizonyos területeken visszalépés történt: az AA-LCR tesztben (amely a hosszú szövegekből való információkinyerést méri) 2 ponttal gyengébb eredményt ért el, míg az AA-Omniscience tesztben (tudásalapú kérdések helyes megválaszolása vagy annak beismerése, ha nem tudja a választ) 10 ponttal maradt el, és a találati arány 31 százalék körül maradt. Eközben a hallucinációk aránya 23-ról 40 százalékra nőtt, vagyis az Qwen3.8 Max gyakrabban találgat, mint korábban.[^1]
Az Alibaba Qwen3.8 Max bemutatja, hogy az erősebb teljesítmény nem mindig jelent jobb ár-érték arányt vagy megbízhatóságot. A fejlesztőknek további optimalizációra és a hallucinációk csökkentésére lesz szükségük, hogy a modell valóban felvegye a versenyt a piac legjobbjaival.
[^1]: The Decoder (2026. 08. 06.). “Qwen3.8 Max: Alibabas stärkstes Modell rät häufiger und kostet mehr pro Aufgabe”. Közzétéve [2026. 08. 06.].