Az Deepseek, egy kínai mesterséges intelligencia vállalat, új szintre emeli az ügynökalapú MI-megoldásokat a V4-Flash-Vision-Exp modellel. Ez a multimodális modell képes képek és szövegek együttes feldolgozására, ezzel támogatva a fejlett vizuális workflow-kat és jelentősen bővítve az MI-alapú ügynökök lehetőségeit.[^1]
Az új modell, a Deepseek-V4-Flash-Vision-Exp, az előző Deepseek-V4-Flash verzió képességeit egészíti ki a képfeldolgozással. Megőrzi az eredeti modell Reasoning és világismereti teljesítményét, miközben lehetővé teszi képek értelmezését, például képleírás készítését, szöveg kinyerését képernyőképekből vagy diagramok elemzését.[^1]
A támogatott képformátumok között megtalálható a JPEG, PNG, GIF és WebP, a rendszer pedig a tényleges fájltartalom alapján azonosítja a formátumot, nem a fájlnév vagy MIME-típus szerint.[^1]
Az Deepseek Vision-modellt kifejezetten ügynökalapú alkalmazásokhoz fejlesztették, és képes együttműködni különféle agent-frameworkökkel. Kompatibilis az OpenAI Chat Completions formátummal, az Anthropic Messages Endpointtal, valamint a Responses API-val is.[^1]
Az új Harness-Framework 0.1.1 verziójának megjelenésével a fejlesztők közvetlenül integrálhatják az új Vision-modellt saját rendszereikbe.[^1]
A fejlesztők többféle módon tölthetnek fel képeket: Base64 kódolással, nyilvános URL-en keresztül (legfeljebb 32 MiB méretig), vagy az új, ingyenes Files-API használatával, mely utóbbinál egyszeri feltöltés után többször is hivatkozhatnak ugyanarra a fájlra, akár 64 MiB méretig.[^1]
A képek automatikusan kb. 800 × 800 pixelre normalizálódnak, de igény szerint 512 × 512 pixelre is skálázhatók a részletesség csökkentése érdekében. Egy kép maximális token-felhasználása 384, függetlenül az eredeti felbontástól. Egy kérésben maximum 600 kép dolgozható fel, de 15 kép fölött a képméret felső határa 4096 pixel oldalanként.[^1]
Az első belső tesztek szerint az Deepseek Vision-modell teljesítménye megközelíti, sőt bizonyos esetekben eléri az Opus-4.8 szintjét multimodális ügynök benchmarkokon. Független mérésekre azonban még várni kell.[^1]
„A Deepseek Vision-modell új lehetőségeket nyit a vizuális adatokkal dolgozó mesterséges intelligencia alkalmazások előtt, különösen ügynökalapú workflow-k esetében.”
Az Deepseek V4-Flash-Vision-Exp modell bevezetése új távlatokat nyit a multimodális MI-alapú ügynökök számára. A fejlett képfeldolgozó képességek, a nagy token-határértékek és a széleskörű integrációs lehetőségek miatt az új Vision-modell komoly előrelépést jelent az ügynökalapú MI-megoldások területén. Az iparági szereplők és fejlesztők izgatottan várják a független benchmarkokat és a további fejlesztéseket.
[^1]: THE DECODER (2026. 08. 21.). “Deepseek bringt experimentelles Vision-Modell für multimodale Agenten auf den Markt”. Közzétéve [2026. 08. 21.].