OpenAI udostępniło GPT-Live-1 w API 10 września 2026 r. Model prowadzi rozmowę głosową w trybie full duplex, czyli może słuchać i mówić jednocześnie, a trudniejsze zadania przekazuje do osobnego backendu. Cena wynosi 0,05 USD za minutę, ale ta kwota obejmuje tylko warstwę głosową. Model rozumujący, narzędzia, telefonia i usługi zewnętrzne są rozliczane oddzielnie.
To ważne rozróżnienie, bo GPT-Live-1 nie jest kolejnym monolitycznym modelem „robiącym wszystko”. OpenAI proponuje architekturę, w której jeden system odpowiada za płynność rozmowy, wykrywanie tur i przerwań, a drugi wykonuje właściwą pracę: wyszukuje informacje, korzysta z firmowych danych, uruchamia narzędzia albo prowadzi dłuższe rozumowanie.
GPT-Live-1 w skrócie
- warstwa głosowa kosztuje 0,05 USD za minutę i jest rozliczana co sekundę;
- full duplex pozwala modelowi słuchać i mówić jednocześnie;
- backend może działać na modelu OpenAI albo w zewnętrznym systemie;
- model obsługuje audio i tekst, lecz nie obraz ani wideo;
- dostępne są WebRTC, WebSocket, telefonia SIP i integracje partnerskie;
- sesja ma domyślnie 128 tys. tokenów kontekstu;
- zapis sesji jest domyślnie wyłączony, a włączone nagrania wygasają po 30 dniach.
Co naprawdę zmienia full duplex
Klasyczny agent głosowy często działa jak łańcuch: rozpoznawanie mowy zamienia audio na tekst, model językowy przygotowuje odpowiedź, a syntezator odczytuje ją użytkownikowi. Taka konstrukcja jest modułowa i łatwa do kontroli, ale każda granica między elementami dodaje opóźnienie. Utrudnia też naturalne reagowanie na krótkie potwierdzenia, zawahania i wejście rozmówcy w słowo.
GPT-Live-1 ma utrzymywać ciągły strumień rozmowy. Może jednocześnie odbierać głos użytkownika i generować własny, a natywne wykrywanie tur pomaga zdecydować, kiedy słuchać, kiedy odpowiedzieć i kiedy delegować zadanie. OpenAI zapowiada także transkrypcje wejścia i odpowiedzi, lepsze rozumienie ciągów alfanumerycznych oraz możliwość wskazania słów kluczowych, takich jak nazwy produktów czy nazwiska.
Producent podaje, że GPT-Live-1 poprawił wynik Full Duplex Bench o 30 punktów procentowych względem GPT-Realtime-2.1 i zajął pierwsze miejsce w teście Tau3 po połączeniu z GPT-6 Astra. To jednak pomiary OpenAI, a nie wyniki niezależnej instytucji. Podobnie informacja firmy Speak o niemal 80-procentowym spadku liczby niepotrzebnych przerwań jest wczesną oceną klienta przytoczoną w komunikacie producenta.
Głos z przodu, rozumowanie na zapleczu
Warstwa Live odpowiada za prowadzenie rozmowy i decyzję o delegowaniu. Backend wykonuje zadania wymagające aktualnych danych, narzędzi lub większej mocy obliczeniowej. Dokumentacja delegowania GPT-Live opisuje wariant zarządzany przez Responses API z modelem takim jak GPT-5.6 Luna, Terra lub GPT-6 Astra. Wariant klienta pozwala przekazać pracę do własnego serwisu, innego modelu lub firmowego agenta.
Ta separacja pozwala dobrać koszt i jakość backendu do zadania. Proste sprawdzenie statusu zamówienia może korzystać z tańszego modelu, a analiza umowy — z mocniejszego. Rozmowa nie musi przy tym zamierać: warstwa głosowa może informować użytkownika, że zadanie nadal trwa.
Nie zwalnia to aplikacji z odpowiedzialności. Według dokumentacji to ona ma egzekwować uprawnienia, prosić o potwierdzenie wrażliwych działań, wykonywać prywatne funkcje i przechowywać trwały stan zadania. Przerwanie wypowiedzi agenta nie anuluje automatycznie pracy backendu. Trzeba więc jawnie zaprojektować anulowanie, idempotencję i komunikat o zakończeniu operacji.
0,05 USD za minutę nie jest ceną całej rozmowy
Według cennika aktualnego 11 września 2026 r. GPT-Live-1 kosztuje 0,05 USD za minutę. Rozliczenie jest sekundowe, bez zaokrąglania do pełnej minuty. Do czasu płatnego wlicza się jednak nie tylko mowa użytkownika i odpowiedź systemu, lecz również cisza oraz oczekiwanie na backend.
| Składnik przykładowej rozmowy | Założenie | Koszt |
|---|---|---|
| Warstwa GPT-Live-1 | 10 minut × 0,05 USD | 0,500 USD |
| GPT-5.6 Terra — wejście | 20 tys. tokenów × 1 USD/1 mln | 0,020 USD |
| GPT-5.6 Terra — wyjście | 4 tys. tokenów × 6 USD/1 mln | 0,024 USD |
| Suma przed narzędziami | głos + backend | 0,544 USD |
To modelowy rachunek, nie uniwersalna wycena. Do sumy trzeba dodać wyszukiwanie internetowe, bazę wiedzy, połączenie telefoniczne, infrastrukturę i usługi firm trzecich. W europejskim regionalnym przetwarzaniu nowe modele objęte rezydencją danych mają ponadto 10-procentową dopłatę. Rzeczywisty koszt należy liczyć z telemetrii całej ścieżki, a nie z samego licznika minut Live.
Najprostszą optymalizacją może być skrócenie sesji. Długi proces może kontynuować się w backendzie po zamknięciu kanału głosowego, a użytkownik wrócić do nowej sesji po zakończeniu pracy. Jedna minuta bezczynnego oczekiwania kosztuje tyle samo co minuta aktywnej rozmowy.
Transporty i formaty audio
Dla przeglądarek naturalnym wyborem jest WebRTC. Integracje serwerowe mogą korzystać z WebSocket, a systemy telefoniczne z SIP lub partnerów takich jak Twilio, Telnyx, LiveKit i Daily/Pipecat. Wdrożenie przez WebSocket przypomina ciągły kanał zdarzeń, ale nie jest tym samym co tryb WebSocket w Responses API. OpenAI publikuje osobną instrukcję strumieniowania audio przez WebSocket.
W sesji WebSocket dostępne są PCM16 mono przy 24 kHz lub 16 kHz oraz telefoniczne kodeki G.711 μ-law i A-law przy 8 kHz. Jeden format dotyczy wejścia i wyjścia i nie może zmienić się w trakcie sesji. Aplikacja nadal odpowiada za przechwytywanie, buforowanie, odtwarzanie i ewentualne próbkowanie dźwięku.
Kontekst, limity i języki
GPT-Live-1 ma domyślne okno 128 tys. tokenów, a instrukcje początkowe mogą mieć maksymalnie 16 384 tokeny. Po wykorzystaniu ponad 90% kontekstu system uruchamia nowy silnik głosowy z oryginalnymi instrukcjami oraz skrótem i ostatnimi elementami historii o łącznej długości do 8192 tokenów. Starsze szczegóły mogą zniknąć, dlatego stan zamówienia, zgody i wyniki narzędzi nie powinny istnieć wyłącznie w pamięci rozmowy.
Dokumentacja podaje limity współbieżności od 25 sesji w Tier 1 do 500 w Tier 5; plan Free nie jest obsługiwany. Nie podaje natomiast liczbowego maksymalnego czasu pojedynczej sesji. Nie publikuje też kompletnej listy wspieranych języków ani wyników dla języka polskiego. Nowe głosy obejmują różne akcenty i odmiany językowe, lecz sama dostępność głosu nie dowodzi jakości rozpoznawania i dialogu po polsku. Wdrożenie w Polsce wymaga własnego testu na realnych mikrofonach, hałasie, nazwach własnych i branżowym słownictwie.
Retencja i kontrola danych
Zgodnie z tabelą kontroli danych OpenAI sesje /v1/live/sessions kwalifikują się do Zero Data Retention. Zapisywanie jest domyślnie wyłączone. Jeśli projekt na to pozwala, ustawienie store: true zachowuje ukończone nagranie i jego indeks przez 30 dni, aby można było je pobrać lub utworzyć rozwidloną sesję. Przy ZDR parametr jest traktowany jak false.
Istotnym ograniczeniem jest brak publicznego endpointu do ręcznego usunięcia zapisanej sesji przed upływem tego czasu. GPT-Live wspiera rezydencję danych w Stanach Zjednoczonych oraz Europie, obejmującej EOG i Szwajcarię. Delegowany backend i każde narzędzie mają jednak własne reguły przetwarzania; regionalna konfiguracja warstwy głosowej nie przenosi się na nie automatycznie.
Kiedy pełny dupleks ma sens
GPT-Live-1 pasuje do obsługi klienta, nauki języków, asystentów telefonicznych i interaktywnych interfejsów, w których przerwania i szybkie potwierdzenia są częścią zadania. Może też być głosowym wejściem do bardziej złożonych agentów — podobnie jak głosowe sterowanie komputerem i koordynacja agentów, ale już jako komponent budowany przez dewelopera.
Nie jest automatycznym następcą każdej kaskady STT–LLM–TTS. Oddzielne komponenty pozostają rozsądne dla nagrań wsadowych, dokładnie audytowanych transkrypcji, aplikacji wymagających konkretnego dostawcy syntezy albo produktów, w których tekstowy etap pośredni ma być deterministycznym kontraktem. Kaskada ułatwia również niezależną wymianę każdego elementu.
Jak ocenić wdrożenie przed produkcją
Sam czas do pierwszego dźwięku nie wystarczy. Zespół powinien mierzyć udane zakończenie zadania, liczbę niepotrzebnych przerwań, poprawność rozpoznawania nazw własnych, czas oczekiwania na narzędzia i odsetek operacji wymagających powtórzenia. Osobno warto rejestrować sekundy Live, tokeny backendu i opłaty narzędzi, aby koszt błędnej rozmowy nie ginął w średniej.
Test powinien obejmować gorsze mikrofony, sieć mobilną, hałas, różne tempo mowy i celowe wejście użytkownika w słowo. Trzeba też sprawdzić, czy przerwanie komunikatu rzeczywiście zatrzymuje operację, jeśli taki jest kontrakt produktu. W aplikacjach regulowanych transkrypcja, zgody i wynik działania powinny trafić do oddzielnego dziennika audytowego zgodnie z polityką danych firmy.
Najważniejszą zmianą jest więc nie sam głos, lecz podział pracy. GPT-Live-1 ma dbać o rytm rozmowy, a backend o wykonanie zadania. To obiecujący model budowy agentów, ale jego jakość po polsku, łączny koszt i niezawodność działań trzeba mierzyć w docelowym środowisku. Stawka 0,05 USD za minutę jest początkiem kalkulacji, nie jej wynikiem.
Częste pytania
Jakie są koszty korzystania z GPT-Live-1 w API?
Koszt korzystania z GPT-Live-1 wynosi 0,05 USD za minutę rozmowy, a rozliczenie jest dokonywane co sekundę. Warto jednak pamiętać, że ta kwota obejmuje tylko warstwę głosową, a inne usługi są rozliczane oddzielnie.
Kiedy OpenAI udostępniło GPT-Live-1 w API?
OpenAI udostępniło GPT-Live-1 w API 10 września 2026 roku. Model ten wprowadza nową jakość w prowadzeniu rozmów głosowych.
Jak działa pełny dupleks w GPT-Live-1?
Pełny dupleks w GPT-Live-1 pozwala modelowi słuchać i mówić jednocześnie, co eliminuje opóźnienia związane z tradycyjnymi agentami głosowymi. Dzięki temu użytkownicy mogą prowadzić bardziej naturalne rozmowy.
Jakie są limity kontekstowe w GPT-Live-1?
GPT-Live-1 ma domyślne okno kontekstowe wynoszące 128 tys. tokenów, a instrukcje początkowe mogą mieć maksymalnie 16 384 tokeny. Po wykorzystaniu ponad 90% kontekstu system uruchamia nowy silnik głosowy.
Jakie formaty audio są obsługiwane przez GPT-Live-1?
GPT-Live-1 obsługuje różne formaty audio, w tym PCM16 mono przy 24 kHz oraz kodeki telefoniczne G.711 μ-law i A-law przy 8 kHz. Format audio musi być jednolity przez całą sesję.







