
A Google DeepMind bemutatta a Gemini 3.8 Live és a Gemini 3.8 Live Extended Thinking hangmodelleket, amelyekkel fejlesztők beszédalapú MI-ügynököket építhetnek. A modellek a Gemini API-n és a Google AI Studión keresztül érhetők el, és több mint 97 nyelvet támogatnak.[^1]
A Gemini 3.8 Live célja olyan hangalapú alkalmazások fejlesztése, amelyek nem csupán válaszolnak a felhasználónak, hanem a párbeszéd fenntartása mellett műveleteket is végrehajtanak. A modell háttérben API-hívásokat indíthat, és a beszélgetés megszakítása nélkül dolgozhat fel vizuális bemeneteket.[^1]
Ez a működés például ügyfélszolgálati, foglalási, információkeresési vagy eszközvezérlési feladatoknál lehet fontos: az ügynök a beszélgetés alatt külső rendszerekből kérhet le adatokat, miközben továbbra is fenntartja a hangos interakciót.
„A Gemini 3.8 Live lehetővé teszi a beszédalapú ügynökök számára, hogy a háttérben API-hívásokat hajtsanak végre, vizuális bemeneteket dolgozzanak fel, és közben folytassák a beszélgetést.”[^1]
A Google DeepMind szerint a Gemini 3.8 Live több mint 97 nyelvet kezel.[^1] A széles nyelvi támogatás a több országban működő szolgáltatások és a többnyelvű ügyfélkapcsolati rendszerek fejlesztésében lehet különösen releváns.
A Gemini 3.8 Live Extended Thinking a hangos ügynöki feladatokhoz kialakított, kiterjesztett gondolkodási változat. Az Artificial Analysis Speech-to-Speech ranglistáján a Google közlése szerint 82,6 százalékos eredménnyel az első helyet szerezte meg.[^2]
A ranglista a beszéd-beszéd rendszerek ügynöki teljesítményét és futtatási költségét is vizsgálja. Az eredmény ugyanakkor egy külső értékelési keretrendszerhez kötődik, ezért a gyakorlati választásnál a fejlesztőknek a késleltetést, a feladatok összetettségét, a nyelvi minőséget és az integrációs igényeket is mérlegelniük kell.
A Google árazása szerint a Gemini 3.8 Live hangbemenete percenként 0,005 dollárba, hangkimenete pedig percenként 0,018 dollárba kerül.[^1] Egy olyan egyórás hangbeszélgetés, amelyben bemenet és kimenet is van, így megközelítőleg 1,38 dollárba kerülhet.
Összehasonlításként a OpenAI nemrég bemutatott GPT-Live-1 modelljének díja percenként 0,05 dollár, ami egyórás használat során legalább 3 dolláros költséget jelenthet.[^3] A két ajánlat közötti különbség különösen a nagy volumenű, hosszabb ügyfélinterakciókat kezelő szolgáltatásoknál lehet lényeges.
A GPT-Live-1 ugyanakkor teljes duplex működést kínál: képes egyszerre hallgatni és beszélni. Ez természetesebb társalgási élményt adhat, mert a rendszer gyorsabban reagálhat a félbeszakításokra és a beszélgetés ritmusára.[^3] A Gemini 3.8 Live kedvezőbb ára ezzel szemben a költségtudatos fejlesztések számára jelenthet előnyt.
A két modell a Gemini API-n, valamint a Google AI Studión keresztül érhető el.[^1] A Google nyílt forráskódú példaprojekteket is közzétett a GitHubon, hogy a fejlesztők gyorsabban próbálhassák ki a valós idejű hangalapú interakciókat.[^4]
Összefoglaló: A Gemini 3.8 Live megjelenése tovább erősítheti a hangalapú MI-ügynökök versenyét. A többnyelvű támogatás, az API-hívásokkal kombinált párbeszéd és az alacsonyabb, használatalapú díjazás elsősorban a fejlesztők és a vállalati alkalmazásokat építő csapatok számára lehet fontos. A természetes, félbeszakításokat is kezelő beszélgetésben azonban a teljes duplex rendszerek továbbra is eltérő technológiai előnyt kínálhatnak.
[^1]: THE DECODER (2026. 09. 15.). „Google DeepMind stellt Gemini 3.8 Live für Sprach-Agenten vor”. THE DECODER. Közzétéve 2026. 09. 15..
[^2]: Artificial Analysis (2026). „Speech-to-Speech Arena Results”. Artificial Analysis. Közzétéve 2026. 09. 15..
[^3]: THE DECODER (2026). „GPT-Live-1: OpenAIs Full-Duplex-Sprachmodell ist jetzt für Entwickler verfügbar”. THE DECODER. Közzétéve 2026. 09. 15..
[^4]: Google Gemini. „Gemini Live API Examples”. GitHub. Közzétéve 2026. 09. 15..