Az OpenAI elérhetővé tette a GPT-Live-1 nevű, teljes duplex működésre tervezett hangmodelljét az API-t használó fejlesztőknek. A rendszer nem külön lépésekben kapcsolja össze a beszédfelismerést, a nyelvi modellt és a beszédszintézist, hanem ezeket egy modellen belül kezeli.[^1]
A teljes duplex működés azt jelenti, hogy a modell beszéd közben is képes figyelni a felhasználóra. Ez különösen akkor lehet lényeges, amikor a beszélő félbeszakítja a rendszert, pontosítja a kérését, vagy még a válasz befejezése előtt új információt ad meg.[^1]
A korábbi, egymásra épített hangfeldolgozási folyamatokban a beszédfelismerés, a szövegértelmezés és a hanggenerálás külön komponensként működött. A GPT-Live-1 integrált megközelítése az OpenAI célja szerint csökkentheti a késleltetést, és gördülékenyebbé teheti a hangalapú párbeszédeket.[^1]
„A modell egyszerre tud hallgatni és beszélni” – az OpenAI ezt a működést teljes duplex hanginterakcióként írja le.[^2]
Az OpenAI saját mérései alapján a GPT-Live-1 a teljes duplex teszteken 80,1 százalékos eredményt ért el, míg a GPT-Realtime-2.1 45,4 százalékot teljesített. A válaszidő a közölt adatok szerint 1,4 másodpercről 0,8 másodpercre csökkent.[^1]
Az eszközhívások pontossága a korábbi modell 60 százalékos eredményéről 87 százalékra nőtt. Egy banki hangtesztben a GPT-Live-1 32 százalékos eredményt ért el, szemben az előd 12,4 százalékával. Ezek az adatok az OpenAI belső értékeléseiből származnak, ezért külső, független összehasonlítás nélkül értelmezendők.[^1]
A fejlesztők a GPT-Live-1-et különböző háttérmodellekkel kombinálhatják. Ez lehetőséget ad arra, hogy az adott feladathoz igazítsák a számítási igényt, a sebességet és a működtetési költséget.[^1]
A modell használati díja percenként 0,05 dollár. Ez a hangalapú ügyfélszolgálati vagy telefonos alkalmazásoknál gyorsan jelentős kiadássá válhat, különösen nagy hívásvolumen esetén.[^1]
A Yelp már telefonos foglalások kezelésére használja a modellt. Alex Levy, a vállalat technológiai igazgatója szerint a rendszer javította a hívások feldolgozását.[^1][^2]
Az OpenAI emellett tizenkét új hangot vezetett be, amelyek különböző akcentusokat, nyelvjárásokat és nyelveket fednek le. A bővítés a többnyelvű, régiókhoz igazított hangalapú szolgáltatások fejlesztését segítheti.[^1]
A GPT-Live-1 az OpenAI hangalapú MI-rendszereinek új fejlesztői eleme: az egyidejű hallgatásra és beszédre épülő architektúra a késleltetés és a megszakításkezelés terén ígér előrelépést. A költségszint miatt a modell elsősorban azokban az alkalmazásokban lehet vonzó, ahol a természetesebb beszélgetés és a gyors reakció közvetlen üzleti értéket jelent.
[^1]: The Decoder (2026. 09. 10.). „GPT-Live-1: OpenAIs Full-Duplex-Sprachmodell ist jetzt für Entwickler verfügbar”. The Decoder. Közzétéve [2026. 09. 10. 17:28:35 +0000].
[^2]: OpenAI (2026). „Introducing GPT-Live-1 in the API”. OpenAI.