Meta udostępniła Muse Glimmer 30B — model z otwartymi wagami, który ma obsługiwać lokalnych agentów AI na komputerze z pojedynczą konsumencką kartą graficzną. Wariant K-Quant-17GB został przygotowany z myślą o 24 GB VRAM, a model oferuje kontekst co najmniej 131 072 tokenów oraz rozumienie tekstu i obrazów. To wyraźny powrót Meta do strategii otwartych wag po premierze zamkniętego Muse Spark.
Najważniejsza zmiana nie polega jednak na samych parametrach. Muse Glimmer został zaprojektowany do długich zadań agentowych: wywoływania narzędzi, pracy z plikami, kodowania, interpretowania zrzutów ekranu i odzyskiwania działania po błędzie. Mark Zuckerberg zapowiedział też przyszłe otwarcie wag mocniejszego Muse Spark 1.2, choć nie podał jeszcze wiążącej daty.
Na tych kartach uruchomisz lokalny model Muse Glimmer
| Karta graficzna | VRAM | Cena orientacyjna | K-Quant-17GB | Ocena do lokalnego AI |
|---|---|---|---|---|
| GeForce RTX 5090 | 32 GB GDDR7 | od ok. 13 500 zł | ✅ Tak — duży zapas VRAM | ⭐⭐⭐⭐⭐ Najlepszy wybór |
| GeForce RTX 4090 | 24 GB GDDR6X | od ok. 8 800–9 500 zł | ✅ Tak — model mieści się w VRAM | ⭐⭐⭐⭐⭐ Bardzo szybka |
| GeForce RTX 3090 Ti | 24 GB GDDR6X | od ok. 5 400 zł | ✅ Tak | ⭐⭐⭐⭐ Dobra, ale wysoki pobór energii |
| GeForce RTX 3090 | 24 GB GDDR6X | od ok. 5 300–6 000 zł | ✅ Tak | ⭐⭐⭐⭐ Bardzo dobry stosunek VRAM/cena |
| Radeon RX 7900 XTX | 24 GB GDDR6 | od ok. 3 800–4 700 zł | ✅ Pamięciowo tak | ⭐⭐⭐ Dobra cena, ale CUDA/NVIDIA jest wygodniejsza |
| GeForce RTX 5080 | 16 GB GDDR7 | — | ⚠️ Za mało VRAM | ❌ Nie polecam do K-Quant-17GB |
| GeForce RTX 5070 Ti | 16 GB GDDR7 | — | ⚠️ Za mało VRAM | ❌ Nie polecam do K-Quant-17GB |
Wniosek: do wariantu K-Quant-17GB warto celować w minimum 24 GB VRAM. RTX 3090 jest ciekawą opcją budżetową, RTX 4090 zapewnia znacznie większą wydajność, a RTX 5090 dzięki 32 GB VRAM oferuje największy zapas pamięci na długi kontekst, KV cache i dodatkowe komponenty modelu.
Muse Glimmer 30B w skrócie
| Producent | Meta Superintelligence Labs |
|---|---|
| Premiera | 10 sierpnia 2026 r. |
| Architektura | Gęsty Transformer przyczynowy z osobnym enkoderem percepcji |
| Parametry | 29,6 mld łącznie z enkoderem obrazu |
| Kontekst | Co najmniej 131 072 tokeny |
| Modalności | Tekst i obrazy na wejściu, tekst na wyjściu; bez audio |
| Języki | Dane z ponad 100 języków |
| Licencja | Apache License 2.0 |
| Dostępność | Wagi na Hugging Face; wdrożenie lokalne i samodzielny hosting |
Otwarty model do agentów działających na urządzeniu
Meta opisuje Glimmera jako model do zadań wykonywanych stale i lokalnie. Praktyczny agent nie tylko odpowiada na pytanie, ale planuje kolejne kroki, wywołuje funkcje, korzysta z narzędzi i reaguje na nieoczekiwane rezultaty. Model ma obsługiwać między innymi lokalne programowanie, automatyzację pracy, ocenianie odpowiedzi innych modeli oraz scenariusze wykorzystujące OpenClaw i podobne środowiska agentowe.
Osobny enkoder percepcji przyjmuje obrazy przeplatane tekstem. Dzięki temu agent może analizować zrzuty ekranu, wykresy i dokumenty, a nie tylko treść rozmowy. Nie jest to jednak model generujący obrazy ani system głosowy: karta modelu wskazuje tekst jako format wyjściowy i wprost wyklucza obsługę audio.
W porównaniu z wcześniejszym Muse Spark nowy model jest mniejszy i słabszy, ale można pobrać jego wagi oraz uruchomić go bez wysyłania danych do chmury. To ważna różnica dla firm przetwarzających poufne dokumenty, twórców narzędzi działających offline i osób, które chcą samodzielnie kontrolować model oraz jego zabezpieczenia.
Jak Meta zmieściła 30 mld parametrów na jednej karcie
W pełnej precyzji model potrzebowałby ponad 55 GB pamięci tylko na wagi. Meta zastosowała kwantyzację do około 4 bitów, zmniejszając model językowy do mniej niż 20 GB. Wariant K-Quant-17GB pozostawia na karcie 24 GB miejsce na pamięć roboczą KV cache, enkoder obrazu i pomocniczy model przyspieszający generowanie.
| Wariant | Docelowa pamięć | Deklarowany spadek jakości |
|---|---|---|
| Pełna precyzja | 64 GB VRAM | Punkt odniesienia |
| K-Quant-Dynamic | 32 GB VRAM | 0,2% |
| K-Quant-17GB | 24 GB VRAM | 1,0% |
Drugą optymalizacją jest DFlash, niewielki model pomocniczy przewidujący całe bloki po 16 tokenów. Glimmer sprawdza propozycje równolegle i poprawia błędne fragmenty. Według Meta mechanizm przyspiesza dekodowanie 3,1 raza na RTX 5090, 1,8 raza na M5 Max i 1,5 raza na M4 Max. Są to wyniki producenta dla jego konfiguracji, a nie gwarantowana szybkość na każdym komputerze.
Określenie „działa na komputerze osobistym” również wymaga doprecyzowania. Karta z 24 GB VRAM nadal należy do drogiego segmentu, a długi kontekst zwiększa zużycie pamięci. Komputer z 16 GB RAM lub typowy laptop biurowy nie zapewni takich samych warunków. Dostępne kwantyzacje obniżają barierę, ale nie zmieniają Glimmera w mały model mobilny.
Destylacja z Muse Spark i trzy etapy treningu
Glimmer nie jest po prostu pomniejszoną kopią większego modelu. W pretrainingu Meta wykorzystała destylację logitów z wyjść Muse Spark oraz podobną mieszankę danych. Następnie przeprowadziła etap mid-trainingu z dłuższym kontekstem, większym udziałem danych agentowych i bogatszymi śladami rozumowania. Post-training połączył nadzorowane dostrajanie, destylację on-policy i uczenie ze wzmocnieniem w zadaniach ogólnych, rozumowaniu, kodowaniu oraz pracy agentowej.
Karta modelu opisuje dane szeroko: publicznie dostępne treści multimodalne, materiały od podmiotów trzecich oraz informacje pochodzące z produktów i usług Meta, selekcjonowane i wzbogacane przez dostawców oraz pracowników firmy. Nie podano objętości zbioru, pełnej listy źródeł, infrastruktury ani kosztu treningu. To istotna granica przejrzystości wydania.
Benchmarki: mocny w agentach, ale nie najlepszy we wszystkim
W tabeli premierowej Muse Glimmer wypada najlepiej z trzech porównywanych modeli w części testów agentowych. Osiąga 75,5 w MCP Atlas wobec 54,2 dla Gemma4-31B i 62,5 dla Qwen3.6-27B. W DeepSearch QA uzyskuje 74,6, a konkurenci odpowiednio 61,7 i 71,1. Na SWE-Bench Pro Glimmer zdobywa 51,2 i minimalnie wyprzedza Qwen3.6-27B z wynikiem 50,2.
| Benchmark | Muse Glimmer-30B | Gemma4-31B | Qwen3.6-27B |
|---|---|---|---|
| MCP Atlas | 75,5 | 54,2 | 62,5 |
| DeepSearch QA | 74,6 | 61,7 | 71,1 |
| OSWorld-Verified | 65,9 | 58,5 | 75,6 |
| SWE-Bench Pro | 51,2 | 36,9 | 50,2 |
| SWE-Bench Verified | 76,0 | 66,6 | 77,2 |
| AIME 2026 | 94,7 | 89,2 | 94,1 |
| Humanity’s Last Exam, tekst bez narzędzi | 22,0 | 23,6 | 23,1 |
| AA-LCR | 80,0 | 68,3 | 73,3 |
Model nie dominuje całego zestawienia. Qwen3.6-27B prowadzi w OSWorld-Verified, SWE-Bench Verified, TerminalBench 2.1, ScreenSpot Pro i OmniDocBench v1.5. Gemma4-31B ma lepszy wynik w GPQA Diamond oraz Humanity’s Last Exam. Najuczciwszy wniosek brzmi więc: Glimmer jest konkurencyjny w swojej klasie wielkości i szczególnie mocny w wybranych zadaniach agentowych, ale nie jest uniwersalnym liderem.
Trzeba też uważać na pochodzenie liczb. metodologia Meta mówi wprost, że zestawienie wybiera dla konkurentów korzystniejszy wynik z deklaracji producenta lub reprodukcji Meta, a tam, gdzie dla wszystkich modeli były dostępne liczby Artificial Analysis, korzysta z tego źródła. To bardziej rozbudowane porównanie premierowe niż całkowicie niezależny ranking. Na pełną ocenę warto poczekać, aż Glimmer pojawi się w szerszych testach społeczności i aktualizowanych zestawieniach, takich jak ranking czatów i modeli LLM AIOAI.pl.
Apache 2.0: szeroka licencja, ale nie pełne open source
Wagi oraz pozostałe opublikowane artefakty są dostępne na Apache License 2.0, która pozwala na zastosowania badawcze i komercyjne, modyfikowanie oraz redystrybucję z zachowaniem warunków licencji. To bardziej liberalne wydanie niż licencje wcześniejszych modeli Llama. Nie oznacza jednak pełnej otwartości całego procesu: Meta nie udostępniła danych treningowych ani kompletnego kodu i infrastruktury użytej do szkolenia.
Dlatego precyzyjniejsze jest określenie „model z otwartymi wagami”. Sam Zuckerberg od dawna przedstawia otwarte modele jako element strategii Meta, co opisywaliśmy szerzej w tekście o jego podejściu do Llamy i otwartej AI. Premiera Glimmera następuje też krótko po wspólnym apelu firm technologicznych w obronie otwartych wag.
Cena, dostępność i realne zastosowania
Wagi można pobrać z Hugging Face bez opłaty licencyjnej, ale lokalne uruchomienie nie jest darmowe: wymaga odpowiedniego GPU, energii, pamięci i utrzymania środowiska. Meta zapowiedziała wsparcie w llama.cpp, MLX i ExecuTorch oraz integracje z Ollama, LM Studio i Unsloth. Model ma być również obsługiwany przez vLLM i SGLang, a dostęp hostowany zapowiedzieli partnerzy tacy jak Together AI, Fireworks AI i OpenRouter. Ceny tych usług zależą od dostawcy; nie istnieje jeden oficjalny cennik API Muse Glimmer.
Najbardziej przekonujące zastosowania to lokalny asystent do pracy na dokumentach, agent programistyczny, automatyzacja komputera i firmowy system wywołujący narzędzia bez wysyłania wszystkich danych do zewnętrznej chmury. Sama lokalność nie gwarantuje jednak bezpieczeństwa. Agent z dostępem do poczty, plików lub systemu płatności powinien działać z minimalnymi uprawnieniami i wymagać potwierdzenia przed nieodwracalną operacją.
Ograniczenia i pytania bez odpowiedzi
Meta przyznaje, że model może generować informacje nieprawdziwe, stronnicze lub niepożądane, popełniać błędy w długich planach i działać słabiej w językach, które nie zostały dokładnie przetestowane. W karcie zaleca się dodatkowe zabezpieczenia systemowe i testy dopasowane do konkretnego wdrożenia. Szczególnie ważna jest odporność na prompt injection, ponieważ agent pobierający treści z internetu może potraktować złośliwą instrukcję jako polecenie użytkownika.
Nie znamy również niezależnej szybkości na szerokim zestawie kart graficznych, praktycznej jakości polszczyzny, zachowania przy kontekście zbliżonym do 131 tys. tokenów ani kosztu hostowania u partnerów. Pierwsze testy społeczności będą musiały sprawdzić, czy deklarowane niewielkie straty po kwantyzacji utrzymują się w realnych zadaniach.
Co naprawdę zmienia Muse Glimmer
Muse Glimmer 30B nie jest modelem frontierowym i nie próbuje zastąpić największych systemów chmurowych. Jego znaczenie polega na innym kompromisie: oferuje multimodalnego agenta z długim kontekstem, szeroką licencją i wymaganiami, które mieszczą się w jednej mocnej stacji roboczej. Dla deweloperów oznacza to większą kontrolę nad danymi, kosztami i sposobem wdrożenia.
Premiera jest też sygnałem strategicznym. Jak opisał Reuters, Zuckerberg łączy powrót do otwartych wag z szerszym sporem o to, czy kontrola nad zaawansowaną AI powinna koncentrować się w kilku firmach i instytucjach. Meta wraca do tej strategii po okresie, w którym Muse Spark był modelem zamkniętym, a Zuckerberg zapowiada następny krok w postaci Muse Spark 1.2. Dopiero publikacja tych wag pokaże, czy firma rzeczywiście chce otworzyć swój najmocniejszy model, czy Glimmer pozostanie dobrze dobranym, mniejszym wydaniem dla społeczności.
Częste pytania
Jakie są główne cechy modelu Muse Glimmer 30B?
Muse Glimmer 30B to model z otwartymi wagami, który obsługuje lokalnych agentów AI na komputerach z pojedynczą konsumencką kartą graficzną. Oferuje kontekst co najmniej 131 072 tokenów oraz rozumienie tekstu i obrazów.
Kiedy została zaprezentowana premiera modelu Muse Glimmer 30B?
Premiera Muse Glimmer 30B miała miejsce 10 sierpnia 2026 roku. Model ten jest wynikiem powrotu Meta do strategii otwartych wag.
Jakie karty graficzne są zalecane do uruchomienia modelu K-Quant-17GB?
Do wariantu K-Quant-17GB warto celować w karty graficzne z minimum 24 GB VRAM, takie jak GeForce RTX 4090 czy RTX 3090. Wybrane modele zapewniają odpowiednią wydajność dla lokalnego AI.
Jakie zastosowania ma model Muse Glimmer 30B?
Model Muse Glimmer 30B został zaprojektowany do długich zadań agentowych, takich jak wywoływanie narzędzi, praca z plikami, kodowanie oraz interpretowanie zrzutów ekranu. Może również obsługiwać automatyzację pracy.
Jak Meta zoptymalizowała model Glimmer, aby zmieścił się na jednej karcie graficznej?
Meta zastosowała kwantyzację do około 4 bitów, co pozwoliło zmniejszyć model językowy do mniej niż 20 GB. Dzięki temu możliwe jest uruchomienie modelu na kartach z 24 GB VRAM, pozostawiając miejsce na pamięć roboczą.







