EchoWM ma zmienić generator wideo w świat, do którego można „wejść”: użytkownik wskazuje ruch kamery, a model tworzy dalszy ciąg sceny w rozdzielczości 720p wraz z dźwiękami otoczenia, muzyką i mową. W opublikowanym 24 sierpnia raporcie zespół JD Future Academy i ośmiu uczelni podaje średni wynik 81,7 w WBench Navigation – najwyższy w jego zestawieniu. To interesujący krok w stronę interaktywnych mediów, ale jeszcze nie gotowy produkt ani niezależnie sprawdzony przełom.
Najważniejsze zastrzeżenie pojawia się już w nazwie pracy: Open and Enterable Omnimodal World Models. Według stanu na 26 sierpnia 2026 r. publiczne były publikacja EchoWM, strona z demonstracjami i repozytorium szerszego projektu JoyAI-Echo. Kod oraz checkpoint wariantu world model nie zostały jednak jeszcze udostępnione. „Open” nie oznacza więc dziś otwartych wag, kodu i prawa do komercyjnego użycia.
EchoWM w skrócie
- Generuje wspólnie wideo 720p, dźwięki otoczenia, muzykę i mowę.
- Przyjmuje obraz lub sekwencję referencyjną, opis świata i kolejne polecenia ruchu.
- Sprowadza klawisze nawigacyjne i ciągłe pozy kamery do jednej trajektorii 6DoF, czyli ruchu w sześciu stopniach swobody.
- Obsługuje sceny pierwszoosobowe i trzecioosobowe bez osobnych kontrolerów dla każdego typu postaci lub pojazdu.
- Występuje w wersji wielokrokowej EchoWM oraz czterokrokowej, przyczynowej EchoWM-Flash.
- Nie ma jeszcze publicznego API, aplikacji, cennika ani gotowych do pobrania wag EchoWM.
Czym model świata różni się od generatora wideo?
Typowy generator wideo dostaje opis i tworzy klip, który oglądamy od początku do końca. Model świata ma reagować na kolejne decyzje użytkownika lub agenta. Nie chodzi tylko o ładny ruch kamery: po skręcie, cofnięciu i powrocie w to samo miejsce scena powinna zachować układ, obiekty oraz ich wygląd.
EchoWM organizuje to sterowanie wokół pojęcia camera intent — zamiaru kamery. Polecenie „idź naprzód”, ruch w bok albo obrót zostają przeliczone na względną trajektorię 6DoF. Trzy stopnie opisują przesunięcie w przestrzeni, a trzy kolejne obrót. Zespół używa wspólnej skali metrycznej dla danych z różnych źródeł, aby ten sam sygnał nie oznaczał w jednym materiale małego kroku, a w drugim gwałtownego skoku.
W perspektywie pierwszoosobowej trajektoria opisuje ruch obserwatora. W scenie trzecioosobowej sytuacja jest bardziej złożona: model ma sam wywnioskować z danych, jak powinny współgrać ruch widocznej postaci, pojazdu i podążającej za nimi kamery. Dzięki temu jeden interfejs może działać w scenach z człowiekiem, zwierzęciem czy robotem.
Ma to również ograniczenie. EchoWM nie dostaje precyzyjnego sterowania kończynami ani dowolnymi akcjami bohatera. Użytkownik kontroluje przede wszystkim zmianę punktu widzenia, a zachowanie obiektu jest przewidywane przez model. To „świat do nawigowania”, nie pełny silnik gry z deterministyczną mechaniką.
Dźwięk nie jest doklejany po wygenerowaniu obrazu
Najbardziej charakterystyczną cechą EchoWM jest wspólne tworzenie obrazu i dźwięku. Model ma generować szum fal, kroki, odgłosy pojazdu, muzykę i wypowiedzi równolegle ze zmianą sceny. Na oficjalnej stronie projektu można zobaczyć przykłady pierwszo- i trzecioosobowe z mową oraz dźwiękiem otoczenia.
To odróżnia EchoWM od modeli świata, które produkują tylko obraz, oraz od systemów, w których ścieżka audio powstaje w osobnym etapie. Kierunek jest zbieżny z rozwojem modeli generujących wideo ze zsynchronizowanym dźwiękiem — niedawno opisywaliśmy MiniMax H3 z dźwiękiem stereo. EchoWM dodaje jednak jeszcze pętlę nawigacji: kolejne sygnały sterujące mają zmieniać jednocześnie to, co użytkownik widzi i słyszy.
Jak szkolono EchoWM?
Autorzy połączyli cztery klasy danych. Pierwsza to wewnętrznie rejestrowana rozgrywka z dokładnymi sygnałami sterowania. Druga obejmuje internetowe nagrania gier, które oferują większą różnorodność, lecz nie mają surowych logów ruchu. Trzecia pochodzi z symulacji Unreal Engine, gdzie trajektorie kamery można kontrolować. Czwarta to ogólne filmy z internetu, używane głównie do poszerzania wiedzy o obrazie i dźwięku.
Nie każdy materiał nadaje się równie dobrze do każdego celu. Dlatego zespół stworzył mieszanki bogate w audio i wideo, materiały z czystym sygnałem sterującym oraz zbalansowany zbiór wysokiej jakości. Dla klipów bez znanej pozy kamery trajektorie były odzyskiwane z obrazu, filtrowane i kalibrowane do wspólnej skali.
Trening przebiegał w czterech etapach:
- AV-CPT rozwijał bazowe zdolności wspólnej generacji obrazu i dźwięku.
- Action-SFT uczył reakcji na trajektorię przy zamrożonym głównym modelu i trenowaniu lekkiej ścieżki sterowania.
- Joint-FT dostrajał oba elementy razem na zbalansowanych danych i z małym tempem uczenia.
- Autoregresyjny post-training wystawiał model na jego własne wcześniejsze klatki i dźwięk, aby ograniczyć degradację podczas długiej kontynuacji.
Publikacja nie podaje liczby parametrów EchoWM, całkowitego rozmiaru danych treningowych, kosztu obliczeń ani infrastruktury treningowej. Nie należy też przenosić na ten wariant wymagań sprzętowych udostępnionego wcześniej generatora długiego wideo JoyAI-Echo — to inne zastosowanie i inny pipeline.
EchoWM prowadzi w tabeli autorów na WBench
WBench Navigation jest publicznym benchmarkiem wieloturowych modeli świata, ale poniższe liczby pochodzą z ewaluacji przedstawionej przez twórców EchoWM, a nie z niezależnej replikacji. Zestaw obejmuje 158 przypadków i łączy oceny jakości, zgodności ze sceną, interakcji, spójności oraz fizyki.
| Model | Średnia WBench | Interaction | Consistency |
|---|---|---|---|
| EchoWM | 81,7 | 87,2 | 89,8 |
| EchoWM-Flash | 81,0 | 87,9 | 77,5 |
| HiDream-O1-World | 80,9 | 80,0 | 88,0 |
| Alaya-EVOKE | 80,8 | 78,6 | 86,9 |
| LingBot-World (fast v2) | 79,4 | 82,8 | 86,5 |
| HappyOyster | 76,8 | 84,9 | 84,3 |
| Genie 3 | 73,9 | 73,4 | 82,6 |
Różnica między pierwszym EchoWM a trzecim HiDream-O1-World wynosi tylko 0,8 punktu. Wynik nie uzasadnia więc szerokiego twierdzenia, że EchoWM jest bezdyskusyjnie najlepszym modelem świata. Pokazuje raczej, że według protokołu zastosowanego przez autorów mieści się w ścisłej czołówce, a przyspieszony EchoWM-Flash zachowuje większość jakości.
W badaniu preferencji obejmującym 200 przypadków uczestnicy częściej wskazywali EchoWM jako ogólnie lepszy od LingBot-World-v2 (46,50% wobec 21,57%) i HappyOyster (63,13% wobec 27,06%). Pozostałe odpowiedzi oznaczały remis jakościowy „oba dobre” albo „oba złe”. To nadal badanie przeprowadzone przez zespół projektu.
Porównywanie modeli generatywnych wymaga ostrożności — podobnie jak w przypadku opisywanego przez nas rankingu Seedance 2.0, pojedyncza średnia nie mówi wszystkiego o stabilności, sterowalności i jakości w konkretnym zastosowaniu.
Długi horyzont wciąż ujawnia dryf
Na SANA-WM-Bench pełny EchoWM uzyskał VBench Overall 83,91 na łatwych i 83,96 na trudnych trajektoriach przy 241 klatkach. W protokole 961 klatek EchoWM-Flash osiągnął odpowiednio 80,13 i 81,06, prowadząc wśród porównywanych modeli przyczynowych w tabeli autorów.
Jednocześnie publikacja pokazuje słaby punkt: błąd rotacji pełnego EchoWM wzrósł na łatwych trajektoriach z 0,523° przy 241 klatkach do 3,223° przy 961 klatkach. Na trudnym podziale długiego horyzontu sięgnął 12,05°. Model może więc zachowywać wysoką ogólną jakość obrazu, a mimo to stopniowo odchodzić od zadanej orientacji. To kluczowa różnica między efektowną demonstracją a symulatorem, któremu można zaufać przez wiele minut.
Dostępność: publikacja jest otwarta lecz model jeszcze nie
Repozytorium JoyAI-Echo zawiera kod i checkpoint wcześniejszego wariantu do długiego wideo. W sekcji aktualizacji twórcy piszą jednak, że kod Echo 1.5 zostanie wydany później, a opis bieżącego zakresu dotyczy generacji T2V i wieloujęciowego wideo. Nie ma osobnego checkpointu, instrukcji inferencji ani API dla EchoWM.
Obecny kod JoyAI-Echo jest przeznaczony do badań i zastosowań niekomercyjnych oraz podlega LTX-2 Community License. Nie można automatycznie zakładać, że przyszłe wagi EchoWM otrzymają identyczne warunki. Dopiero publikacja konkretnego checkpointu i jego licencji pozwoli ocenić, czy będzie to model z otwartymi wagami i jaki zakres użycia komercyjnego zostanie dopuszczony.
Co EchoWM może realnie zmienić?
Najbardziej obiecujące zastosowania leżą dziś w mediach generatywnych: szybkim prototypowaniu światów do gier, wirtualnych planach zdjęciowych, interaktywnych opowieściach i doświadczeniach VR. Jeden model łączący nawigację z obrazem, ambientem i mową może uprościć pipeline, który zwykle wymaga kilku niezależnych systemów.
W badaniach robotyki i symulacji pomysł jest równie interesujący, ale dowody są słabsze. Autorzy pokazują jakościową generalizację na sceny robotyczne, choć deklarują, że takie dane nie wchodziły do mieszanki treningowej. To nie wystarcza, by uznać EchoWM za wiarygodny model fizyczny. W tym obszarze bliższy praktycznym zadaniom jest choćby opisywany na naszym portalu RynnBrain dla robotów, zaprojektowany wokół orientacji w przestrzeni i działaniu maszyny.
EchoWM trafnie identyfikuje trzy problemy, które musi rozwiązać interaktywny model świata: jednolite sterowanie, pamięć przestrzenną i zsynchronizowaną odpowiedź wielu modalności. Raport pokazuje technicznie spójną drogę oraz mocne wyniki własne. Najważniejszy test dopiero jednak nadejdzie: wydanie kodu i wag, niezależne próby na tych samych benchmarkach oraz sprawdzenie, czy model działa wystarczająco szybko i stabilnie poza starannie wybranymi demonstracjami.
Częste pytania
Jakie są główne funkcje EchoWM?
EchoWM generuje wideo w rozdzielczości 720p, dźwięki otoczenia, muzykę i mowę, reagując na ruch kamery oraz polecenia użytkownika. Model obsługuje zarówno sceny pierwszoosobowe, jak i trzecioosobowe, co pozwala na interaktywną nawigację w stworzonych światach.
Dlaczego EchoWM jest uważane za nowatorskie w porównaniu do tradycyjnych modeli wideo?
EchoWM wyróżnia się tym, że generuje obraz i dźwięk równolegle, co pozwala na synchronizację wizji i dźwięków otoczenia w czasie rzeczywistym. To odróżnia go od innych modeli, które produkują tylko obraz lub dodają dźwięk w osobnym etapie.
Kiedy planowane jest udostępnienie kodu i modelu EchoWM?
Na chwilę obecną kod oraz checkpoint wariantu EchoWM nie zostały jeszcze udostępnione publicznie. Twórcy zapowiadają, że kod Echo 1.5 zostanie wydany później, ale nie ma jeszcze konkretnej daty.
Jak EchoWM radzi sobie z nawigacją w różnych scenach?
EchoWM wykorzystuje trajektorię 6DoF do przetwarzania poleceń nawigacyjnych, co pozwala na płynne poruszanie się w przestrzeni zarówno w scenach pierwszoosobowych, jak i trzecioosobowych. Model samodzielnie interpretuje, jak powinny współgrać ruchy kamery i postaci.
Jakie dane zostały użyte do szkolenia EchoWM?
EchoWM został wytrenowany na czterech klasach danych, w tym na wewnętrznie rejestrowanej rozgrywce, nagraniach gier z internetu oraz symulacjach Unreal Engine. Dodatkowo wykorzystano ogólne filmy z internetu do poszerzenia wiedzy o obrazie i dźwięku.







