GPT-Live-1: az OpenAI teljes duplex hangmodellje már elérhető a fejlesztőknek

Hírek2026.09.11.19 megtekintés

Röviden:

  • Az OpenAI API-n keresztül elérhetővé tette a GPT-Live-1 hangmodellt a fejlesztők számára.[^1]
  • A modell egyidejűleg képes hallgatni és beszélni, ami természetesebb, megszakításokat is kezelő beszélgetéseket tehet lehetővé.[^1]
  • Az OpenAI összehasonlításai szerint a GPT-Live-1 gyorsabb válaszidőt és jobb eszközhívási pontosságot ért el az előző valós idejű modellnél.[^1]
  • A szolgáltatás ára percenként 0,05 dollár, ezért a költségoptimalizálás továbbra is fontos szempont lehet a fejlesztői használatban.[^1]

Az OpenAI elérhetővé tette a GPT-Live-1 nevű, teljes duplex működésre tervezett hangmodelljét az API-t használó fejlesztőknek. A rendszer nem külön lépésekben kapcsolja össze a beszédfelismerést, a nyelvi modellt és a beszédszintézist, hanem ezeket egy modellen belül kezeli.[^1]

Mit jelent a GPT-Live-1 teljes duplex működése?

A teljes duplex működés azt jelenti, hogy a modell beszéd közben is képes figyelni a felhasználóra. Ez különösen akkor lehet lényeges, amikor a beszélő félbeszakítja a rendszert, pontosítja a kérését, vagy még a válasz befejezése előtt új információt ad meg.[^1]

A korábbi, egymásra épített hangfeldolgozási folyamatokban a beszédfelismerés, a szövegértelmezés és a hanggenerálás külön komponensként működött. A GPT-Live-1 integrált megközelítése az OpenAI célja szerint csökkentheti a késleltetést, és gördülékenyebbé teheti a hangalapú párbeszédeket.[^1]

„A modell egyszerre tud hallgatni és beszélni” – az OpenAI ezt a működést teljes duplex hanginterakcióként írja le.[^2]

Gyorsabb válaszidő és pontosabb eszközhívások

Az OpenAI által közölt benchmarkeredmények

Az OpenAI saját mérései alapján a GPT-Live-1 a teljes duplex teszteken 80,1 százalékos eredményt ért el, míg a GPT-Realtime-2.1 45,4 százalékot teljesített. A válaszidő a közölt adatok szerint 1,4 másodpercről 0,8 másodpercre csökkent.[^1]

Az eszközhívások pontossága a korábbi modell 60 százalékos eredményéről 87 százalékra nőtt. Egy banki hangtesztben a GPT-Live-1 32 százalékos eredményt ért el, szemben az előd 12,4 százalékával. Ezek az adatok az OpenAI belső értékeléseiből származnak, ezért külső, független összehasonlítás nélkül értelmezendők.[^1]

Rugalmas háttérmodell-választás

A fejlesztők a GPT-Live-1-et különböző háttérmodellekkel kombinálhatják. Ez lehetőséget ad arra, hogy az adott feladathoz igazítsák a számítási igényt, a sebességet és a működtetési költséget.[^1]

A modell használati díja percenként 0,05 dollár. Ez a hangalapú ügyfélszolgálati vagy telefonos alkalmazásoknál gyorsan jelentős kiadássá válhat, különösen nagy hívásvolumen esetén.[^1]

Ügyfélszolgálati felhasználás és új hangok

A Yelp már telefonos foglalások kezelésére használja a modellt. Alex Levy, a vállalat technológiai igazgatója szerint a rendszer javította a hívások feldolgozását.[^1][^2]

Az OpenAI emellett tizenkét új hangot vezetett be, amelyek különböző akcentusokat, nyelvjárásokat és nyelveket fednek le. A bővítés a többnyelvű, régiókhoz igazított hangalapú szolgáltatások fejlesztését segítheti.[^1]

Összefoglaló

A GPT-Live-1 az OpenAI hangalapú MI-rendszereinek új fejlesztői eleme: az egyidejű hallgatásra és beszédre épülő architektúra a késleltetés és a megszakításkezelés terén ígér előrelépést. A költségszint miatt a modell elsősorban azokban az alkalmazásokban lehet vonzó, ahol a természetesebb beszélgetés és a gyors reakció közvetlen üzleti értéket jelent.

Forrás:

[^1]: The Decoder (2026. 09. 10.). „GPT-Live-1: OpenAIs Full-Duplex-Sprachmodell ist jetzt für Entwickler verfügbar”. The Decoder. Közzétéve [2026. 09. 10. 17:28:35 +0000].

[^2]: OpenAI (2026). „Introducing GPT-Live-1 in the API”. OpenAI.

Follow
Keresés Népszerű
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...