Qwen3.8 Max: az Alibaba legerősebb MI modellje többet találgat és drágább feladatonként

Hírek2026.08.06.16 megtekintés

  • Az Alibaba új Qwen3.8 Max MI modellje 56 pontot ért el az Artificial Analysis Intelligence Indexen, ezzel megelőzve a korábbi Qwen3.7 Max verziót.
  • Az új modell jelentősen többet találgat, és feladatonként több mint kétszer annyiba kerül, mint elődje.
  • Bár az alap tokenárak csökkentek, az összesített ár-érték arány romlott, mivel sokkal több számítási lépést igényel.

Az Alibaba legújabb mesterséges intelligencia modellje, az Qwen3.8 Max, jelentős előrelépést mutat a teljesítményben, ugyanakkor új kihívásokkal is szembesül. Az Artificial Analysis Intelligence Indexen elért 56 pontjával 10 ponttal múlja felül az előző generációs Qwen3.7 Maxot, azonban a működése lassabb és drágább lett, miközben a találgatás aránya is megnőtt.[^1]

Qwen3.8 Max: az Alibaba új mesterséges intelligencia modelljének eredményei

Teljesítmény és helyezések az AI ranglistán

Az Artificial Analysis Intelligence Index szerint az Qwen3.8 Max a második helyen áll, megegyezve Claude Opus 4.8 modelljével, és megelőzve GLM-5.2-t (51 pont), de lemaradva Kimi K3-tól (57 pont).[^1] Ez utóbbi ráadásul 25 százalékkal olcsóbban működik.

Több lépés, lassabb és drágább működés

Az úgynevezett GDPval-AA tesztben az Qwen3.8 Max 468 Elo ponttal javított, elérve az 1739-et, amivel megelőzi Kimi K3-at (1685), de elmarad Claude Opus 5-től (1852). Figyelemre méltó azonban, hogy a feladatonkénti munkafolyamatban 64 lépést igényel, míg a korábbi verzió csak 14-et. Ez a tesztben azért történik, mert minden lépésnél a teljes előző beszélgetési előzményt visszaküldik a modellnek, így a bemeneti tokenek száma is tizenötszörösére nő.[^1]

Ár-érték arány és költségek

Bár a tokenek ára csökkent (2 dollár/millió bemeneti token, 6 dollár/millió kimeneti token, cache találat: 0,25 dollár), a teljes feladatonkénti költség jelentősen emelkedett. Egy Intelligence Index feladat most 1,14 dollárba kerül, több mint duplája a Qwen3.7 Max költségének (0,53 dollár). Az Kimi K3 egy ponttal többet ér el, de csak 0,86 dollárba kerül feladatonként, míg GLM-5.2 0,57 dollárba.[^1]

Visszalépések és kihívások a Qwen3.8 Max esetében

Hosszú szövegek és ismeretellenőrzés

Az új verzióval bizonyos területeken visszalépés történt: az AA-LCR tesztben (amely a hosszú szövegekből való információkinyerést méri) 2 ponttal gyengébb eredményt ért el, míg az AA-Omniscience tesztben (tudásalapú kérdések helyes megválaszolása vagy annak beismerése, ha nem tudja a választ) 10 ponttal maradt el, és a találati arány 31 százalék körül maradt. Eközben a hallucinációk aránya 23-ról 40 százalékra nőtt, vagyis az Qwen3.8 Max gyakrabban találgat, mint korábban.[^1]

Következtetés: az Alibaba MI fejlesztései előtt álló út

Az Alibaba Qwen3.8 Max bemutatja, hogy az erősebb teljesítmény nem mindig jelent jobb ár-érték arányt vagy megbízhatóságot. A fejlesztőknek további optimalizációra és a hallucinációk csökkentésére lesz szükségük, hogy a modell valóban felvegye a versenyt a piac legjobbjaival.

Forrás:

[^1]: The Decoder (2026. 08. 06.). “Qwen3.8 Max: Alibabas stärkstes Modell rät häufiger und kostet mehr pro Aufgabe”. Közzétéve [2026. 08. 06.].

Follow
Keresés Népszerű
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...