Aktualności

Gemini 3.8 Live: głosowy model Google i wariant Extended Thinking

Kobieta rozmawia z abstrakcyjnym asystentem głosowym połączonym świetlnymi falami dźwięku; Gemini 3.8 Live

Google wprowadził dwa modele do rozmów głosowych w czasie rzeczywistym: Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking. Pierwszy stawia na szybkie odpowiedzi i obsługę wielu rozmów, drugi może rozumować i wykonywać dłuższe zadania w tle, podtrzymując dialog. Oba przyjmują także obraz i wideo. To osobna premiera od Gemini 3.8 Flash, modelu do kodowania i pracy agentów, który nie obsługuje Live API.

Gemini 3.8 Live

Premiera odbyła się 15 września 2026 r. Google przedstawia Gemini 3.8 Live jako model do płynnej, taniej w skali rozmowy z asystentem. Extended Thinking ma obsługiwać bardziej złożone prośby, które wymagają kilku kroków i wywołań narzędzi. Oba modele generują mowę bezpośrednio, zamiast sprowadzać całe doświadczenie do osobnych etapów transkrypcji, odpowiedzi tekstowej i syntezy mowy.

Istotna zmiana dotyczy tego, co dzieje się podczas oczekiwania na wynik. W zwykłym agencie głosowym sprawdzenie rezerwacji lub danych klienta może skończyć się niezręczną ciszą. Według Google nowy wariant Extended Thinking może w tym czasie przekazać krótką informację o postępie, wykonać asynchroniczne wywołanie narzędzia i wrócić do odpowiedzi bez kończenia rozmowy. To obietnica producenta, której nie należy mylić z gwarancją stałego czasu reakcji w każdej aplikacji.

Dwa warianty, dwa sposoby prowadzenia rozmowy

W dokumentacji Live API Google zaleca podstawowy model do krótkich, bezpośrednich zadań, takich jak ćwiczenie języka czy głosowa obsługa klienta. Extended Thinking jest przeznaczony do planowania, diagnostyki i pracy z narzędziami, które odpowiadają po kilku sekundach. Deweloper musi wybrać odrębny identyfikator modelu; Extended Thinking nie jest przełącznikiem w podstawowej wersji.

CechaGemini 3.8 LiveGemini 3.8 Live Extended Thinking
Identyfikator APIgemini-3.8-livegemini-3.8-live-extended-thinking
Główne zastosowanieSzybka, naturalna wymiana zdań i proste działaniaWieloetapowe zadania z rozumowaniem i narzędziami w tle
Sterowanie głębokością rozumowaniaBez parametru thinking_levelPoziomy low, medium, high
Wywołania funkcjiSynchroniczne lub asynchroniczneAsynchroniczne
Kontekst wejściowy131 072 tokeny131 072 tokeny
WyjścieAudio i tekst, do 65 536 tokenówAudio i tekst, do 65 536 tokenów

Dane o limitach i funkcjach pochodzą z karty Gemini 3.8 Live, karty Extended Thinking i dokumentacji interfejsu. W wariancie rozszerzonym aplikacja musi śledzić sygnał interaction_status: koniec jednej wypowiedzi głosowej nie oznacza jeszcze końca całego zadania. To ważne przy migracji istniejącego agenta.

Co model widzi i słyszy?

Obie wersje przyjmują strumień audio, tekst, obrazy oraz wideo, a odpowiadają głosem i tekstem. Według karty modelu DeepMind okno kontekstowe sięga 128 tys. tokenów. Google opisuje zastosowania, w których użytkownik pokazuje kamerą problem i równocześnie o nim opowiada. Takie połączenie może pomóc na przykład przy instrukcji naprawy urządzenia lub omawianiu dokumentu, ale jakość zależy od obrazu, połączenia i integracji przygotowanej przez twórcę aplikacji.

Producent deklaruje automatyczne przełączanie między 97 językami w trakcie rozmowy, także bez ręcznej zmiany ustawień. Na tym etapie jest to informacja z komunikatu Google; nie przeprowadziliśmy własnego testu jakości mowy w języku polskim. Każdy wygenerowany dźwięk ma według Google niewidoczny znak wodny SynthID.

Karta modelu mówi, że Gemini 3.8 Audio bazuje na Gemini 3 Pro. Nie ujawnia osobno liczby parametrów, kosztu treningu ani pełnej listy danych użytych do przygotowania nowych wariantów. Są to modele udostępniane jako usługa, bez publicznych wag do samodzielnego uruchomienia.

Jak wypada w testach?

Najbardziej przejrzyste porównanie niezależne w dniu 16 września 2026 r. daje Speech Agent Arena firmy Artificial Analysis. W ślepych rozmowach uczestnicy oceniają, którego z dwóch agentów wolą przy tym samym zadaniu. Gemini 3.8 Live zajmuje tam 2. miejsce z wynikiem 1083 Elo i przedziałem 95% ± 30 punktów, na podstawie 482 próbek. Na 1. miejscu jest starszy Gemini 3.1 Flash Live Minimal: 1096 Elo, ± 27 punktów, 841 próbek.

Różnica między tymi dwoma wynikami jest mała wobec podanych przedziałów niepewności. Z tabeli nie wynika więc jednoznaczna przewaga nowego modelu pod względem preferencji rozmówców. W tej samej Arenie Gemini 3.8 Live Extended Thinking w konfiguracji High zajmuje 10. miejsce. To pokazuje, że głębsze rozumowanie i płynność samej rozmowy są różnymi kryteriami.

Google podaje, że Extended Thinking zdobył 82,6 punktu i 1. miejsce w złożonym wskaźniku jakości mowy Artificial Analysis oraz 68,6% w teście zadań agenta τ-Voice. Przytaczamy te liczby jako wyniki wskazane przez producenta. Różne rankingi mierzą inne umiejętności i nie należy traktować pojedynczego miejsca jako dowodu, że model będzie najlepszy w każdej rozmowie.

Ile kosztuje Gemini 3.8 Live?

Według cennika Gemini API, sprawdzonego 16 września 2026 r., oba warianty 3.8 Live mają tę samą stawkę jednostkową. W płatnym planie audio wejściowe kosztuje 0,005 USD za minutę, a wygenerowane audio 0,018 USD za minutę. Dla tekstu stawki wynoszą 0,75 USD za milion tokenów wejściowych i 4,50 USD za milion wyjściowych. Obraz i wideo na wejściu mają osobną stawkę: 0,002 USD za minutę albo 1 USD za milion tokenów.

Rzeczywisty koszt rozmowy zależy od długości mowy po obu stronach, ilości obrazu, tekstu i użycia narzędzi. Tokeny rozumowania są wliczane w rozliczenie wyjścia, więc bardziej wymagające zadanie w Extended Thinking może kosztować więcej mimo identycznych stawek. Google oferuje również darmowy poziom API z limitami; dane przesyłane w tym poziomie mogą być używane do ulepszania jego produktów, podczas gdy cennik płatnego poziomu wskazuje inaczej.

Gdzie można skorzystać?

Oba modele są dostępne deweloperom przez Gemini API i Google AI Studio. Zgodnie z komunikatem z 15 września podstawowy Gemini 3.8 Live trafia także do Search Live. Extended Thinking jest wdrażany w Gemini Live oraz w głosowych funkcjach Workspace: Docs dla subskrybentów Google AI Pro i Ultra, Gmail i Keep dla subskrybentów Google AI. Dostęp firmowy przez Gemini Enterprise jest na razie w prywatnym podglądzie.

Strony modeli podają stabilne identyfikatory API, choć sam interfejs Live API jest nadal oznaczony jako preview. Deweloper migrujący ze starszego gemini-3.1-flash-live-preview powinien sprawdzić zmianę identyfikatora, ustawienia rozumowania i sposób obsługi wywołań asynchronicznych. Konsumencka usługa Gemini Live była dostępna wcześniej; obecna premiera dotyczy modeli i nowych możliwości pod jej maską, a nie pierwszego uruchomienia funkcji rozmowy.

Co naprawdę zmienia ta premiera?

Największa zmiana dotyczy agentów, którzy mają rozmawiać, widzieć kontekst i wykonywać pracę w tle w jednej sesji. Zwykły Gemini 3.8 Live może być rozsądnym wyborem tam, gdzie liczy się tempo odpowiedzi. Extended Thinking daje programistom osobny wariant do zadań, przy których chwila rozumowania jest uzasadniona, ale użytkownik powinien słyszeć, że sprawa jest nadal obsługiwana.

Na razie warto zachować ostrożność wobec obietnic „naturalnej” rozmowy. Niezależny ranking preferencji nie pokazuje wyraźnej przewagi podstawowego 3.8 Live nad poprzednikiem, a karta modelu wprost wspomina o możliwych halucynacjach, spowolnieniach i przekroczeniach czasu. O jakości zastosowania zdecydują testy konkretnego przepływu rozmowy, opóźnienia narzędzi, bezpieczeństwo działań oraz koszt pełnej sesji.

Częste pytania

Jakie są główne różnice między modelami Gemini 3.8 Live a Extended Thinking?

Gemini 3.8 Live jest zaprojektowany do szybkiej, naturalnej wymiany zdań i prostych działań, podczas gdy Extended Thinking obsługuje bardziej złożone prośby wymagające rozumowania i asynchronicznych wywołań narzędzi.

Kiedy miała miejsce premiera modelu Gemini 3.8 Live?

Premiera modelu Gemini 3.8 Live odbyła się 15 września 2026 roku, wprowadzając nowe możliwości w rozmowach głosowych w czasie rzeczywistym.

Czy Gemini 3.8 Live obsługuje różne języki podczas rozmowy?

Tak, Gemini 3.8 Live ma możliwość automatycznego przełączania między 97 językami w trakcie rozmowy, co ułatwia komunikację w różnych językach.

Jakie są koszty korzystania z Gemini 3.8 Live?

Koszt korzystania z Gemini 3.8 Live wynosi 0,005 USD za minutę audio wejściowego i 0,018 USD za minutę wygenerowanego audio, a stawki dla tekstu wynoszą 0,75 USD za milion tokenów wejściowych.

Gdzie można skorzystać z modeli Gemini 3.8 Live?

Modele Gemini 3.8 Live są dostępne dla deweloperów przez Gemini API i Google AI Studio, a także w funkcjach głosowych Workspace dla subskrybentów Google AI Pro i Ultra.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *