Aktualności

Lyria 3.5 w public preview. Google otwiera API do generowania muzyki

Producentka muzyczna przy konsoli studyjnej i napis Lyria 3.5

Google udostępnił Lyria 3.5 w public preview w Gemini API. To rodzina modeli do generowania muzyki, która przyjmuje instrukcję tekstową, może wykorzystać obrazy jako inspirację i zwraca stereofoniczny plik MP3 44,1 kHz. Najważniejsze są dwa warianty: Clip tworzy zawsze 30-sekundowy fragment za 0,04 USD, a Pro generuje utwór trwający kilka minut za 0,08 USD. Bezpłatnego poziomu API nie ma.

Premiera z 3 września 2026 roku daje programistom więcej kontroli niż samo polecenie „stwórz piosenkę”. W promptach można określić strukturę, tempo, tonację, instrumenty, moment wejścia refrenu i własny tekst. Jednocześnie nazwa public preview ma znaczenie: modele mogą się zmienić przed stabilizacją, limity są bardziej restrykcyjne, a Google nie opublikował niezależnych porównań jakości ani liczbowych wyników ewaluacji.

Najważniejsze fakty:

  • Modele API to lyria-3.5-clip-preview i lyria-3.5-pro-preview.
  • Clip generuje 30 sekund, Pro pełny utwór trwający kilka minut i sterowany promptem.
  • Wejście może zawierać tekst i maksymalnie 10 obrazów, a wyjściem jest MP3 stereo 44,1 kHz.
  • Cena wynosi odpowiednio 0,04 i 0,08 USD za wygenerowany utwór; brak darmowego poziomu.
  • Każdy wygenerowany plik zawiera niewidoczny znak wodny SynthID.
  • Obecna wersja nie obsługuje wieloturowej edycji już wygenerowanego utworu.

Dwa modele: Clip do prób, Pro do pełnego utworu

Notatki wydaniowe Gemini API mówią o Lyria 3.5 jako następnej generacji modelu muzycznego Google. Producent deklaruje lepszą spójność kompozycji, naturalniejsze wokale oraz dokładniejsze sterowanie długością i strukturą. Są to jednak twierdzenia Google. W chwili przygotowania artykułu nie znaleźliśmy niezależnego testu, który porównywałby Lyria 3.5 z Suno, Udio lub wcześniejszą Lyria w kontrolowanych warunkach.

WariantIdentyfikator APIDługośćWyjścieCena
Lyria 3.5 Cliplyria-3.5-clip-previewzawsze 30 sMP3, stereo 44,1 kHz0,04 USD za utwór
Lyria 3.5 Prolyria-3.5-pro-previewkilka minut, sterowane promptemMP3, stereo 44,1 kHz0,08 USD za utwór
Źródło: dokumentacja i cennik Gemini API; stan na 4 września 2026 r. Oba modele mają status preview, a darmowy poziom jest niedostępny.

Google rekomenduje rozpoczęcie od Clip, aby szybciej sprawdzać prompt, a dopiero później przejście do Pro. To praktyczna różnica. Kilka krótkich prób pozwala ocenić kierunek stylistyczny bez generowania pełnej wersji za każdym razem. Trzeba jednak pamiętać, że model jest niedeterministyczny: identyczna instrukcja może zwrócić inny wynik, więc zaakceptowany klip nie jest gwarancją, że Pro rozwinie go w dokładnie oczekiwany sposób.

Jak sterować muzyką w Lyria 3.5

Przewodnik Google po generowaniu muzyki pozwala opisać gatunek, instrumentarium, tempo w BPM, tonację, nastrój oraz dynamikę. Prompt może też zawierać znaczniki [Intro], [Verse], [Chorus], [Bridge] i [Outro]. W Pro można wskazać oczekiwaną długość lub momenty, w których mają nastąpić konkretne zmiany.

Model generuje wokale i tekst domyślnie. Użytkownik może wkleić własne słowa, określić temat tekstu albo poprosić o wersję instrumentalną. Język promptu pomaga wskazać język wokalu. Google radzi oddzielić tekst piosenki od instrukcji muzycznych, bo mieszanie obu warstw zwiększa ryzyko, że fragment polecenia zostanie potraktowany jako słowa do zaśpiewania.

Rozsądny prompt produkcyjny powinien opisywać parametry możliwe do sprawdzenia. Zamiast „nowoczesny utwór reklamowy” lepiej podać: długość 60 sekund, 112 BPM, tonację G-dur, instrumenty, układ sekcji i moment kulminacji. Taki zapis nie gwarantuje perfekcyjnego wykonania, ale ułatwia ocenę, czy model rzeczywiście zastosował się do instrukcji.

Obraz może stać się wejściem do kompozycji

Lyria 3.5 obsługuje do 10 obrazów dołączonych do tekstu w Interactions API. Model ma potraktować warstwę wizualną jako inspirację dla nastroju, kolorystyki brzmienia lub dramaturgii. Nie oznacza to mechanicznego „odczytania muzyki” z obrazu. Rezultat pozostaje interpretacją modelu i warto opisać w tekście, co dokładnie powinien zaczerpnąć z ilustracji: tempo, napięcie, epokę, instrumenty czy energię.

To funkcja ciekawa m.in. dla twórców materiałów wideo, gier, prezentacji i identyfikacji dźwiękowej. Obraz sceny może stać się punktem startowym do szkicu muzycznego, a nie tylko luźną inspiracją dla człowieka. Podobną zmianę widać w innych narzędziach generatywnych: interfejs przestaje ograniczać się do tekstu, a brief może składać się z kilku modalności.

Co wiadomo o architekturze i treningu

Karta modelu Google DeepMind podaje, że Lyria 3.5 wykorzystuje latent diffusion na czasowych reprezentacjach latentnych audio. W uproszczeniu model nie tworzy bezpośrednio każdej próbki dźwięku. Operuje na skompresowanej reprezentacji przebiegu audio, a następnie zamienia ją w gotowy sygnał. To pozwala pracować nad dłuższą strukturą bez kosztu przetwarzania pełnej fali na każdym etapie.

Model szkolono na danych audio opatrzonych opisami tekstowymi o różnym poziomie szczegółowości. Google wymienia deduplikację, filtrowanie jakości i bezpieczeństwa, ale nie podaje wielkości ani pełnego składu zbioru. Trening odbywał się na TPU z użyciem JAX i ML Pathways. Wśród metod dostrajania i zabezpieczeń firma wymienia supervised fine-tuning oraz reinforcement learning z informacją zwrotną od ludzi i modeli-krytyków.

Nie znamy liczby parametrów całkowitych ani aktywnych, skali klastra TPU, czasu i kosztu treningu. Nie opublikowano wag ani kodu szkoleniowego. Lyria 3.5 jest więc własnościową usługą, a nie modelem open source lub open weights.

Wyniki jakości pochodzą na razie od producenta

Google opisuje ewaluacje automatyczne i odsłuchy z udziałem ludzi, prowadzone m.in. z ekspertami muzycznymi. Badano jakość kompozycji, estetykę, wokale, wierność audio i zgodność z promptem. Karta modelu mówi o znaczącej poprawie wierności audio względem Lyria 2 oraz lepszym wykonywaniu prostych i złożonych instrukcji przy generowaniu tekstów piosenek.

Brakuje jednak liczbowych tabel, rozkładu ocen, informacji o liczbie uczestników i pełnej procedury porównania. Nie da się więc obliczyć wielkości poprawy ani ocenić, czy ma ona znaczenie dla konkretnego gatunku lub języka. Twierdzenie „najlepszy generator muzyki” byłoby dziś nieuprawnione. Sensowniejsze jest porównanie na własnym zestawie promptów oraz ślepy odsłuch kilku narzędzi, podobnie jak przy ocenie Suno v5.5 i innych modeli muzycznych.

Cena jest prosta, ale koszt eksperymentu zależy od liczby prób

Oficjalny cennik Gemini API nie rozlicza Lyria 3.5 za tokeny ani sekundę. Jedno żądanie Clip kosztuje 0,04 USD, a Pro 0,08 USD. Dziesięć prób Clip to 0,40 USD, natomiast dziesięć pełnych utworów Pro — 0,80 USD. W tym przypadku głównym źródłem kosztu będzie liczba iteracji, ponieważ edycja wieloturowa nie jest dostępna.

ScenariuszLiczba generacjiKoszt
5 prób Clip5 × 0,04 USD0,20 USD
10 prób Clip10 × 0,04 USD0,40 USD
5 utworów Pro5 × 0,08 USD0,40 USD
10 utworów Pro10 × 0,08 USD0,80 USD
Koszt obliczony na podstawie oficjalnego cennika Google obowiązującego 4 września 2026 r.; bez podatków i kosztów pozostałych usług użytych w aplikacji.

Dane przesyłane w płatnym poziomie nie są według tabeli Google używane do ulepszania produktów firmy. W Europejskim Obszarze Gospodarczym, Szwajcarii i Wielkiej Brytanii dodatkowe warunki Gemini API wymagają korzystania z płatnych usług, gdy klient API jest udostępniany użytkownikom. To ważne rozróżnienie między testem wewnętrznym a aplikacją oferowaną odbiorcom.

SynthID, prawa do wyniku i filtry

Każdy utwór Lyria 3.5 zawiera niewidoczny znak wodny SynthID. Ma on pomagać w identyfikacji treści wygenerowanej przez narzędzia Google, choć nie zastępuje informacji dla odbiorcy ani własnego rejestru pochodzenia materiału. Firma blokuje także prompty proszące o głos konkretnego artysty lub wygenerowanie chronionego tekstu piosenki.

Dodatkowe warunki Gemini API mówią, że Google nie rości sobie prawa własności do oryginalnej wygenerowanej treści. Nie jest to jednak gwarancja, że każdy plik automatycznie uzyska ochronę prawnoautorską albo nie będzie podobny do istniejącego utworu. Użytkownik odpowiada za sposób wykorzystania wyniku, prawa do własnych tekstów i obrazów wejściowych oraz ocenę ryzyka przed dystrybucją komercyjną.

Ta ostrożność dotyczy całego rynku generatywnego audio, nie tylko Lyria. Przed wdrożeniem warto ustalić, kto akceptuje utwór, gdzie jest przechowywany prompt i plik, jak dokumentowane jest pochodzenie oraz czy potrzebna jest zgoda na materiały wejściowe. Analogiczne pytania pojawiają się przy narzędziach zamieniających tekst na efekty dźwiękowe.

Ograniczenia public preview

Najbardziej dotkliwy brak to edycja wieloturowa. Nie można wskazać wcześniejszego pliku i poprosić w tej samej sesji o zmianę wyłącznie refrenu, głosu lub instrumentu. Każda generacja jest pojedynczym procesem, więc poprawa jednego elementu może zmienić pozostałe. Dla produkcji wymagającej precyzyjnych poprawek nadal potrzebne będzie tradycyjne oprogramowanie audio albo narzędzie obsługujące edycję warstwową.

Clip zawsze trwa 30 sekund, a Pro pozwala wpływać na długość, lecz nie obiecuje deterministycznej zgodności co do sekundy. Public preview może też oznaczać zmiany identyfikatorów, zachowania i limitów. Dokumentacja nie podaje osobnej listy krajów dla Lyria 3.5, dlatego dostępność trzeba sprawdzić na właściwym koncie Gemini API zamiast zakładać ją na podstawie samego komunikatu.

Czy Lyria 3.5 zmienia rynek muzyki AI

Najważniejszą zmianą nie jest jeszcze udowodniona przewaga jakościowa, lecz dostęp do modelu przez API i prosty cennik. Dwa warianty pozwalają rozdzielić tani etap poszukiwania kierunku od generowania pełnego utworu. Wejście obrazowe i sterowanie strukturą pomagają zbudować narzędzie wokół briefu, a nie pojedynczego pola tekstowego.

Na ocenę jakości trzeba poczekać do niezależnych testów. Dziś Lyria 3.5 najlepiej traktować jako nowe narzędzie do prototypowania muzyki, które warto sprawdzić na własnych gatunkach, językach i wymaganiach produkcyjnych. Public preview pokazuje kierunek: generowanie ma być bardziej sterowalne i osadzone w procesie twórczym, ale wciąż nie zastępuje odsłuchu, edycji ani kontroli prawnej.

Utwór wygenerowany przez Lyria 3.5

Częste pytania

Jakie są różnice między modelami Clip a Pro w Lyria 3.5?

Model Clip generuje zawsze 30-sekundowy fragment muzyki, kosztując 0,04 USD, podczas gdy Pro tworzy pełny utwór trwający kilka minut za 0,08 USD. Clip jest idealny do szybkich prób, a Pro do bardziej złożonych kompozycji.

Czy można używać obrazów jako inspiracji w Lyria 3.5?

Tak, Lyria 3.5 obsługuje do 10 obrazów, które mogą być użyte jako inspiracja do kompozycji. Obrazy mogą wpływać na nastrój, kolorystykę brzmienia lub dramaturgię utworu.

Jakie parametry można określić w promptach dla Lyria 3.5?

W promptach można określić gatunek, instrumentarium, tempo w BPM, tonację, nastrój oraz dynamikę. Można również używać znaczników takich jak [Intro], [Verse], [Chorus], [Bridge] i [Outro] do struktury utworu.

Jakie są koszty generowania muzyki w Lyria 3.5?

Koszt generowania muzyki w Lyria 3.5 wynosi 0,04 USD za 30-sekundowy utwór w modelu Clip oraz 0,08 USD za pełny utwór w modelu Pro. Koszt całkowity zależy od liczby prób lub utworów, które chcesz wygenerować.

Czy Lyria 3.5 ma darmowy poziom dostępu?

Nie, w Lyria 3.5 nie ma dostępnego darmowego poziomu API. Użytkownicy muszą płacić za generowane utwory, co oznacza, że każda próba wiąże się z określonym kosztem.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *