Google udostępnił produkcyjnie dwa nowe modele syntezy mowy: Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS. Ważna w tym wydaniu jest cała warstwa Voices: własne persony głosowe, replikacja głosu po nagraniu zgody i biblioteka ponad 150 gotowych oraz niestandardowych głosów. W płatnym API wygenerowanie 10 sekund audio kosztuje obecnie około 0,86 gr w wariancie Flash lub 0,58 gr w wariancie Flash-Lite.
Modele TTS mają status GA, ale endpoint Voices nadal działa pod wersją /v1beta/voices. Google nie opublikował też niezależnych pomiarów jakości ani szczegółów architektury. Dlatego w tym tekście oddzielamy funkcje potwierdzone w dokumentacji od ocen producenta dotyczących „studyjnej” wierności dźwięku.
Najważniejsze informacje w skrócie
gemini-3.8-flash-ttsto droższy wariant nastawiony na ekspresję, dialogi wielogłosowe i długą narrację.gemini-3.8-flash-lite-ttsma być szybszym następcągemini-3.1-flash-tts-previewdla dużej liczby generacji i kaskad agentów głosowych.- Oba modele obsługują polski, wielu mówców, projektowanie głosu z opisu i replikację z nagraniem zgody.
- Polska znajduje się na liście regionów Gemini API i Google AI Studio.
- Promocyjne ceny obowiązują do 31 grudnia 2026 r.; od 1 stycznia 2027 r. stawki standardowe mają się podwoić.
Dwa modele, jeden schemat API
Warianty Flash i Flash-Lite korzystają z tego samego schematu wywołań, więc przełączenie modelu sprowadza się do zmiany identyfikatora. Różnica dotyczy przede wszystkim deklarowanego profilu pracy. Według przewodnika TTS Google Flash ma priorytetowo traktować wierność głosu, aktorską ekspresję, trudną wymowę, dialekty i stabilność w długiej narracji. Flash-Lite jest pozycjonowany jako wariant o mniejszych opóźnieniach i niższym koszcie.
| Cecha | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| Identyfikator | gemini-3.8-flash-tts | gemini-3.8-flash-lite-tts |
| Główne zastosowanie według Google | Narracja kreatywna, dialogi wielogłosowe, długie formy | Produkcja masowa, read-aloud, kaskady agentów głosowych |
| Obsługiwane języki | 130, w tym polski | 101, w tym polski |
| Voice Design i Voice Replication | Tak | Tak |
| Limit wejścia / wyjścia | 8192 / 16 384 tokeny | 8192 / 16 384 tokeny |
Google nie przedstawił publicznie liczby parametrów, danych treningowych, kosztu szkolenia ani pełnej architektury. Nie są to modele z otwartymi wagami, lecz usługi dostępne przez Gemini API i AI Studio. Deklarowane różnice jakościowe między wariantami pozostają więc wskazówkami producenta, dopóki nie pojawią się niezależne testy na tych samych tekstach, językach i kryteriach odsłuchu.
Nowe modele nie zastępują Gemini 3.8 Live. TTS zamienia gotowy tekst na audio, natomiast Live obsługuje dwukierunkową rozmowę audio–audio w czasie rzeczywistym. To podobna warstwa głosowa, ale inny problem techniczny i inny cennik.
Synteza, projektowanie i replikacja to trzy różne funkcje
1. Synteza z gotowego głosu
Najprostszy wariant korzysta z jednego z 30 podstawowych głosów studyjnych albo z rozszerzonej biblioteki. API obsługuje wypowiedzi jednego i wielu mówców. Instrukcje dotyczące tempa, emocji i sposobu mówienia trafiają teraz do pola speech_metadata.style, a nie do samego tekstu. Krótkie zdarzenia, takie jak westchnienie, kaszel czy pauza, można oznaczyć tagami w nawiasach ostrych.
To ważna zmiana migracyjna względem starszego preview. Gemini 3.8 traktuje tekst jako dosłowny transkrypt, więc polecenie w rodzaju „powiedz wesoło” umieszczone w treści może zostać przeczytane na głos. Przy zwykłym żądaniu odpowiedzią jest domyślnie plik WAV 24 kHz, mono, 16 bit. Streaming zwraca natomiast surowe fragmenty PCM, które aplikacja może odtwarzać na bieżąco.
2. Voice Design
Voice Design tworzy trwałą personę głosową z opisu tekstowego. Zamiast za każdym razem budować rozbudowany profil „lektora”, aplikacja otrzymuje identyfikator voice_... i używa go w kolejnych syntezach. Funkcja jest przydatna, gdy produkt potrzebuje powtarzalnego charakteru narracji, ale nie ma odwzorowywać głosu konkretnej osoby.
3. Voice Replication
Replikacja próbuje odwzorować cechy konkretnego mówcy. Dokumentacja Google wymaga dwóch nagrań tej samej dorosłej osoby: 10–30 sekund czystej próbki głosu oraz osobnego klipu z obowiązkową formułą zgody. Rekomendowany format to WAV 24 kHz, mono, 16 bit. Polski jest jednym z 30 języków, w których można nagrać formułę zgody.
W trybie domyślnym profil jest przechowywany w projekcie Google przez rok, a limit wynosi 200 zapisanych głosów łącznie dla Voice Design i Voice Replication. Alternatywa store=False zwraca zaszyfrowany klucz przechowywany po stronie klienta i ważny przez siedem dni. Ten wariant ogranicza trwałe składowanie profilu po stronie Google, ale nie usuwa obowiązków związanych z ochroną próbki i danych biometrycznych w aplikacji.
Weryfikacja nagrania zgody jest konkretnym zabezpieczeniem na wejściu, nie pełną gwarancją etycznego użycia. Deweloper nadal musi kontrolować, kto może utworzyć profil, gdzie trafiają nagrania, jak długo są przechowywane i czy wygenerowane audio jest właściwie oznaczane.
Ile kosztuje Gemini 3.8 TTS?
Poniższe stawki dotyczą płatnego trybu Standard w Gemini Developer API i obowiązują według cennika sprawdzonego 25 września 2026 r. Google przelicza sekundę audio na 25 tokenów. Koszt wejścia tekstowego jest osobną, zwykle znacznie mniejszą pozycją.
| Model | Tekst wejściowy / 1 mln tokenów | Audio / 1 mln tokenów | Około 10 s audio | Około 1 min audio |
|---|---|---|---|---|
| Gemini 3.8 Flash TTS | 1,92 zł | 34,56 zł | 0,0086 zł (0,86 gr) | 0,0518 zł (5,18 gr) |
| Gemini 3.8 Flash-Lite TTS | 1,92 zł | 23,04 zł | 0,0058 zł (0,58 gr) | 0,0346 zł (3,46 gr) |
Są to stawki wprowadzające do 31 grudnia 2026 r. Od 1 stycznia 2027 r. Google zapowiada 1 USD za milion tokenów tekstu oraz odpowiednio 18 i 12 USD za milion tokenów audio. Batch i Flex kosztują połowę obecnej stawki audio, natomiast tryb Priority jest droższy. W praktycznym budżecie trzeba doliczyć przechowywanie, ruch, logikę aplikacji i ewentualny model językowy przygotowujący tekst.
Dla porównania, w przypadku systemów takich jak GPT-Live-1 płaci się za interakcję głosową obejmującą również warstwę rozmowy. Zestawianie tej ceny jeden do jednego z jednostronną syntezą TTS prowadziłoby do mylących wniosków.
Co musi zmienić deweloper migrujący z preview?
Google wskazuje Flash-Lite jako bezpośredniego następcę gemini-3.1-flash-tts-preview. Migracja nie ogranicza się jednak do zmiany nazwy modelu. Instrukcje długotrwałego stylu trzeba przenieść do metadanych, każdy mówca w dialogu musi mieć jawnie przypisany identyfikator, a kod zapisujący wynik powinien uwzględnić, że odpowiedź niestrumieniowa ma już nagłówek WAV. Starszy kod doklejający nagłówek ręcznie może więc uszkodzić plik.
Warto też rozdzielić wybór modelu od wyboru głosu. Ten sam identyfikator głosu może być używany z oboma wariantami, więc aplikacja może kierować droższe, wymagające fragmenty do Flash, a prostą produkcję masową do Flash-Lite. Podobną logikę koszt–jakość Google stosuje w rodzinie tekstowej, którą opisywaliśmy przy premierze Gemini 3.8 Flash.
Dostępność i najważniejsze ograniczenia
Gemini API oraz Google AI Studio są dostępne w Polsce według ogólnej listy regionów. Obie wersje TTS obsługują język polski, ale sama obecność na liście nie dowodzi naturalności wymowy, poprawnego akcentowania nazw ani jakości ekspresji. Google nie opublikował niezależnego benchmarku polskiego głosu, a AIoAI.pl nie przeprowadziło w tym materiale własnego odsłuchu.
Najważniejsza niejednoznaczność dotyczy dojrzałości całego rozwiązania. Modele są oznaczone jako GA, natomiast Voices API pozostaje w wersji beta. Produkcyjna aplikacja powinna więc izolować tę integrację, monitorować zmiany schematu i zachować możliwość przełączenia na gotowe głosy, jeżeli tworzenie lub replikacja persony przestanie działać zgodnie z oczekiwaniami.
Częste pytania
Jakie są różnice między Gemini 3.8 Flash TTS a Flash-Lite TTS?
Gemini 3.8 Flash TTS jest droższym wariantem, który koncentruje się na ekspresji, dialogach wielogłosowych i długiej narracji. Z kolei Flash-Lite TTS jest szybszym modelem, przeznaczonym do produkcji masowej i kaskad agentów głosowych, z mniejszymi opóźnieniami i niższym kosztem.
Czy można replikować głos za pomocą Gemini 3.8 TTS?
Tak, Gemini 3.8 TTS umożliwia replikację głosu, ale wymaga dwóch nagrań tej samej osoby: 10-30 sekund czystej próbki głosu oraz osobnego klipu z obowiązkową formułą zgody. Proces ten pozwala na odwzorowanie cech konkretnego mówcy.
Ile kosztuje generowanie audio w Gemini 3.8 TTS?
Koszt generowania 10 sekund audio w modelu Gemini 3.8 Flash TTS wynosi około 0,86 gr, a w modelu Flash-Lite TTS około 0,58 gr. Ceny te obowiązują do 31 grudnia 2026 roku, po czym mają wzrosnąć.
Jakie języki obsługują modele Gemini 3.8 TTS?
Oba modele Gemini 3.8 TTS obsługują 130 języków, w tym polski. Umożliwiają również projektowanie głosu oraz replikację głosu z nagraniem zgody.
Jakie są ograniczenia dotyczące użycia Gemini 3.8 TTS w Polsce?
Gemini API oraz Google AI Studio są dostępne w Polsce, ale brak niezależnych benchmarków jakości polskiego głosu może budzić wątpliwości co do naturalności wymowy i poprawności akcentowania. Użytkownicy powinni monitorować zmiany w integracji oraz być gotowi na przełączenie na gotowe głosy w przypadku problemów.






