A Deepseek bemutatja az új multimodális Vision-modellt ügynökalapú rendszerekhez

Hírek2026.08.22.8 megtekintés

  • Az Deepseek bemutatta az új V4-Flash-Vision-Exp nevű mesterséges intelligencia modellt, amely képes képek és szövegek feldolgozására egyaránt.[^1]
  • Az új modell a Reasoning és világismeret terén megőrzi az előző változat erősségeit, miközben vizuális feladatokban is kiváló teljesítményt nyújt.
  • Az Deepseek Vision-modell kompatibilis több vezető MI-API-val, és akár 600 képet is kezel egy kérésben.
  • Fő célja az ügynökalapú alkalmazások támogatása, ahol a vizuális adatok értelmezése kulcsfontosságú.

Az Deepseek, egy kínai mesterséges intelligencia vállalat, új szintre emeli az ügynökalapú MI-megoldásokat a V4-Flash-Vision-Exp modellel. Ez a multimodális modell képes képek és szövegek együttes feldolgozására, ezzel támogatva a fejlett vizuális workflow-kat és jelentősen bővítve az MI-alapú ügynökök lehetőségeit.[^1]

Az új Deepseek Vision-modell főbb jellemzői és képességei

Képfeldolgozás és szövegértés egy platformon

Az új modell, a Deepseek-V4-Flash-Vision-Exp, az előző Deepseek-V4-Flash verzió képességeit egészíti ki a képfeldolgozással. Megőrzi az eredeti modell Reasoning és világismereti teljesítményét, miközben lehetővé teszi képek értelmezését, például képleírás készítését, szöveg kinyerését képernyőképekből vagy diagramok elemzését.[^1]

A támogatott képformátumok között megtalálható a JPEG, PNG, GIF és WebP, a rendszer pedig a tényleges fájltartalom alapján azonosítja a formátumot, nem a fájlnév vagy MIME-típus szerint.[^1]

Ügynökalapú MI-alkalmazások és integrációk

Az Deepseek Vision-modellt kifejezetten ügynökalapú alkalmazásokhoz fejlesztették, és képes együttműködni különféle agent-frameworkökkel. Kompatibilis az OpenAI Chat Completions formátummal, az Anthropic Messages Endpointtal, valamint a Responses API-val is.[^1]

Az új Harness-Framework 0.1.1 verziójának megjelenésével a fejlesztők közvetlenül integrálhatják az új Vision-modellt saját rendszereikbe.[^1]

Token-használat, képméret és feltöltési lehetőségek

Hatékony feldolgozás nagy mennyiségű képpel

A fejlesztők többféle módon tölthetnek fel képeket: Base64 kódolással, nyilvános URL-en keresztül (legfeljebb 32 MiB méretig), vagy az új, ingyenes Files-API használatával, mely utóbbinál egyszeri feltöltés után többször is hivatkozhatnak ugyanarra a fájlra, akár 64 MiB méretig.[^1]

A képek automatikusan kb. 800 × 800 pixelre normalizálódnak, de igény szerint 512 × 512 pixelre is skálázhatók a részletesség csökkentése érdekében. Egy kép maximális token-felhasználása 384, függetlenül az eredeti felbontástól. Egy kérésben maximum 600 kép dolgozható fel, de 15 kép fölött a képméret felső határa 4096 pixel oldalanként.[^1]

Az MI-fejlesztés aktuális irányai és jelentősége

Benchmark-eredmények és jövőbeli kilátások

Az első belső tesztek szerint az Deepseek Vision-modell teljesítménye megközelíti, sőt bizonyos esetekben eléri az Opus-4.8 szintjét multimodális ügynök benchmarkokon. Független mérésekre azonban még várni kell.[^1]

„A Deepseek Vision-modell új lehetőségeket nyit a vizuális adatokkal dolgozó mesterséges intelligencia alkalmazások előtt, különösen ügynökalapú workflow-k esetében.”

Összefoglaló

Az Deepseek V4-Flash-Vision-Exp modell bevezetése új távlatokat nyit a multimodális MI-alapú ügynökök számára. A fejlett képfeldolgozó képességek, a nagy token-határértékek és a széleskörű integrációs lehetőségek miatt az új Vision-modell komoly előrelépést jelent az ügynökalapú MI-megoldások területén. Az iparági szereplők és fejlesztők izgatottan várják a független benchmarkokat és a további fejlesztéseket.

Forrás:

[^1]: THE DECODER (2026. 08. 21.). “Deepseek bringt experimentelles Vision-Modell für multimodale Agenten auf den Markt”. Közzétéve [2026. 08. 21.].

Follow
Keresés Népszerű
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...