A Gemini 3.8 Live 97 nyelven hozhat olcsóbb hangalapú MI-ügynököket

MI ipari alkalmazás2026.09.16.1 megtekintés

  • A Google DeepMind két új hangmodellt tett elérhetővé fejlesztőknek: a Gemini 3.8 Live-ot és a Gemini 3.8 Live Extended Thinkinget.[^1]
  • A Gemini 3.8 Live beszéd közben háttérben API-hívásokat futtathat, valamint vizuális bemeneteket is feldolgozhat.[^1]
  • A Google percenként 0,005 dollárt kér a hangbemenetért és 0,018 dollárt a hangkimenetért, ami egyórás beszélgetésnél körülbelül 1,38 dolláros költséget jelent.[^1]
  • Az Extended Thinking változat az Artificial Analysis Speech-to-Speech ranglistáján 82,6 százalékos eredménnyel az első helyen szerepel.[^2]

A Google DeepMind bemutatta a Gemini 3.8 Live és a Gemini 3.8 Live Extended Thinking hangmodelleket, amelyekkel fejlesztők beszédalapú MI-ügynököket építhetnek. A modellek a Gemini API-n és a Google AI Studión keresztül érhetők el, és több mint 97 nyelvet támogatnak.[^1]

Gemini 3.8 Live: beszéd közben is dolgozhat az MI-ügynök

A Gemini 3.8 Live célja olyan hangalapú alkalmazások fejlesztése, amelyek nem csupán válaszolnak a felhasználónak, hanem a párbeszéd fenntartása mellett műveleteket is végrehajtanak. A modell háttérben API-hívásokat indíthat, és a beszélgetés megszakítása nélkül dolgozhat fel vizuális bemeneteket.[^1]

Ez a működés például ügyfélszolgálati, foglalási, információkeresési vagy eszközvezérlési feladatoknál lehet fontos: az ügynök a beszélgetés alatt külső rendszerekből kérhet le adatokat, miközben továbbra is fenntartja a hangos interakciót.

„A Gemini 3.8 Live lehetővé teszi a beszédalapú ügynökök számára, hogy a háttérben API-hívásokat hajtsanak végre, vizuális bemeneteket dolgozzanak fel, és közben folytassák a beszélgetést.”[^1]

Több mint 97 nyelv támogatása

A Google DeepMind szerint a Gemini 3.8 Live több mint 97 nyelvet kezel.[^1] A széles nyelvi támogatás a több országban működő szolgáltatások és a többnyelvű ügyfélkapcsolati rendszerek fejlesztésében lehet különösen releváns.

Gemini 3.8 Live Extended Thinking: első hely a hangmodellek ranglistáján

A Gemini 3.8 Live Extended Thinking a hangos ügynöki feladatokhoz kialakított, kiterjesztett gondolkodási változat. Az Artificial Analysis Speech-to-Speech ranglistáján a Google közlése szerint 82,6 százalékos eredménnyel az első helyet szerezte meg.[^2]

A ranglista a beszéd-beszéd rendszerek ügynöki teljesítményét és futtatási költségét is vizsgálja. Az eredmény ugyanakkor egy külső értékelési keretrendszerhez kötődik, ezért a gyakorlati választásnál a fejlesztőknek a késleltetést, a feladatok összetettségét, a nyelvi minőséget és az integrációs igényeket is mérlegelniük kell.

Gemini 3.8 Live árak: jelentős különbség az OpenAI GPT-Live-1-hez képest

A Google árazása szerint a Gemini 3.8 Live hangbemenete percenként 0,005 dollárba, hangkimenete pedig percenként 0,018 dollárba kerül.[^1] Egy olyan egyórás hangbeszélgetés, amelyben bemenet és kimenet is van, így megközelítőleg 1,38 dollárba kerülhet.

Összehasonlításként a OpenAI nemrég bemutatott GPT-Live-1 modelljének díja percenként 0,05 dollár, ami egyórás használat során legalább 3 dolláros költséget jelenthet.[^3] A két ajánlat közötti különbség különösen a nagy volumenű, hosszabb ügyfélinterakciókat kezelő szolgáltatásoknál lehet lényeges.

A természetes társalgás és a költség eltérő előnyei

A GPT-Live-1 ugyanakkor teljes duplex működést kínál: képes egyszerre hallgatni és beszélni. Ez természetesebb társalgási élményt adhat, mert a rendszer gyorsabban reagálhat a félbeszakításokra és a beszélgetés ritmusára.[^3] A Gemini 3.8 Live kedvezőbb ára ezzel szemben a költségtudatos fejlesztések számára jelenthet előnyt.

Hozzáférés és fejlesztői példák a Gemini 3.8 Live-hoz

A két modell a Gemini API-n, valamint a Google AI Studión keresztül érhető el.[^1] A Google nyílt forráskódú példaprojekteket is közzétett a GitHubon, hogy a fejlesztők gyorsabban próbálhassák ki a valós idejű hangalapú interakciókat.[^4]

Összefoglaló: A Gemini 3.8 Live megjelenése tovább erősítheti a hangalapú MI-ügynökök versenyét. A többnyelvű támogatás, az API-hívásokkal kombinált párbeszéd és az alacsonyabb, használatalapú díjazás elsősorban a fejlesztők és a vállalati alkalmazásokat építő csapatok számára lehet fontos. A természetes, félbeszakításokat is kezelő beszélgetésben azonban a teljes duplex rendszerek továbbra is eltérő technológiai előnyt kínálhatnak.

Forrás:

[^1]: THE DECODER (2026. 09. 15.). „Google DeepMind stellt Gemini 3.8 Live für Sprach-Agenten vor”. THE DECODER. Közzétéve 2026. 09. 15..
[^2]: Artificial Analysis (2026). „Speech-to-Speech Arena Results”. Artificial Analysis. Közzétéve 2026. 09. 15..
[^3]: THE DECODER (2026). „GPT-Live-1: OpenAIs Full-Duplex-Sprachmodell ist jetzt für Entwickler verfügbar”. THE DECODER. Közzétéve 2026. 09. 15..
[^4]: Google Gemini. „Gemini Live API Examples”. GitHub. Közzétéve 2026. 09. 15..

Follow
Keresés Népszerű
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...