A Google ügynöki videoelemzéssel bővítette a Gemini 3.7 Flash, a Gemini 3.6 Flash és a Gemini 3.5 Flash-Lite képességeit. Az új működés eltér a hagyományos, rögzített képkockasebességű feldolgozástól: a modell maga dönti el, hogy a kérdés megválaszolásához a videó mely részét, milyen sűrűséggel és milyen formában vizsgálja meg.[^1]
A korábbi statikus eljárásnál a Gemini alapértelmezésben másodpercenként egy képkockát elemzett, és feldolgozta a hangsáv átiratát is. Ez hosszú felvételeknél jelentős tokenigényt eredményezhetett, miközben az alacsony mintavételezés miatt rövid, akár egy másodpercnél is rövidebb események elveszhettek.[^1]
Az új ügynöki megközelítésben a modell a saját következtetési folyamata és natív videóeszközök segítségével választja ki a szükséges információforrásokat. Lekérheti például a megadott időintervallum képkockáit, a hangsáv egy részletét vagy az átirat releváns szakaszát.[^1]
„A modell csak az adott feladathoz szükséges pillanatokat és jeleket kéri le.”[^1]
A Google szerint a célzott újramintavételezés révén a Gemini olyan gyors állapotváltozásokat és vágásokat is azonosíthat, amelyek másodpercenként egy képkockás elemzésnél kimaradhatnak. A rendszer gyanús időablakokban nagyobb képkockasebességgel vizsgálódhat, valamint hosszabb időtartamban számlálhat ismétlődő mozdulatokat és objektumokat.[^1]
Ez a megközelítés különösen a több tíz perces vagy többórás anyagoknál lehet fontos, például oktatóvideóknál, előadásoknál és hosszú felvételeknél. A fejlesztőknek így elvileg nem kell kizárólag a részletgazdag, de költséges feldolgozás és az olcsóbb, ám részleteket elhagyó módszerek között választaniuk.[^1]
A Google által közzétett összehasonlítás szerint az ügynöki feldolgozás az 1H-VideoQA és az LVBench értékelési készleteken egyaránt 88 százalékkal alacsonyabb tokenfelhasználást mutatott, mint a statikus módszer. A vállalat közlése alapján a pontosság eközben kis mértékben emelkedett.[^1]
A cég saját LongVideoBench, 1H-VideoQA és más tesztjeiben a Gemini 3.7 Flash ügynöki üzemmódban a legjobb összesített minőséget, illetve a minőség és költséghatékonyság legerősebb kombinációját érte el. Ezek vállalati belső értékelések, ezért az eredményeket független vizsgálatok is árnyalhatják.[^1]
Az ügynöki videoelemzés már elérhető videófájlok és YouTube-videók esetében a Gemini API-n, a Google AI Studio felületén, valamint a Gemini Enterprise Agent Platformon. A fejlesztőknek az API konfigurációjában az agentic feldolgozási módot kell kiválasztaniuk.[^2][^3]
A Google tájékoztatása szerint ezért nincs külön díj: a Gemini API szokásos tokenalapú árazása érvényes. A vállalat azt is jelezte, hogy a funkciót később a Gemini alkalmazás Flash és Flash-Lite modelljeihez, majd az YouTube lejátszási oldalán működő Ask YouTube funkcióhoz is kiterjeszti.[^1][^2]
Az ügynöki videoelemzés lényege, hogy a Gemini nem előre meghatározott szabály szerint dolgozza fel a teljes felvételt, hanem az adott kérdéshez igazítja a keresést. Ha a Google által közölt költség- és pontossági eredmények más környezetekben is megismételhetők, a módszer különösen a hosszú videók automatizált elemzésénél és szerkesztésénél mérsékelheti az MI-rendszerek üzemeltetési költségét.[^1]
[^1]: THE DECODER (2026. 09. 02.). „Google Gemini analysiert Videos jetzt agentisch und spart bis zu 88 Prozent Token”. THE DECODER. Közzétéve [2026. 09. 02. 07:18:38 +0000].
[^2]: Google AI for Developers. „Video understanding with Gemini API: Agentic video understanding”. Google. Közzétéve [2026. 09. 02.].
[^3]: Google Cloud Documentation. „Video understanding”. Google Cloud. Közzétéve [2026. 09. 02.].