Srpen 2026 přinesl vlnu nových modelů a Meta i xAI v posledních měsících posunuly své nabídky. Muse Spark 1.2 od Meta a Grok 4.5 od xAI patří mezi modely, které se často porovnávají kvůli podobné cenové kategorii i blízkým výsledkům v testech. Následující srovnání vychází z tabulky indexů inteligence a kódování, čtyř hloubkových benchmarků a ceny za milion tokenů.

Svislé sloupce: souhrnné indexy (inteligence, kódování) modelů Muse Spark 1.2 a Grok 4.5 Souhrnné indexy: inteligence, kódování.

Svislé sloupce: úspěšnost modelů Muse Spark 1.2 a Grok 4.5 v jednotlivých hloubkových benchmarcích Hloubkové benchmarky: HLE, GPQA Diamond, SciCode, LCR.

Bodový graf ceny proti inteligenci se zvýrazněnými modely Muse Spark 1.2 a Grok 4.5 Duel v kontextu celého pole: cena (log) vs. Intelligence Index.

Souhrnné indexy ukazují těsný souboj

V indexu inteligence dosahuje Muse Spark 1.2 hodnoty 56,8, zatímco Grok 4.5 má 55,8 · rozdíl mezi oběma modely činí podle předpočítaného údaje jeden bod. V kódování je pořadí obrácené, ale rozdíl je ještě menší: Grok 4.5 má 72,4, Muse Spark 1.2 72,2. Na úrovni souhrnných indexů tedy žádný z modelů nemá zřetelný náskok.

Zajímavější obrázek se ukáže u hloubkových benchmarků. V HLE, testu expertních otázek napříč obory, skóruje Muse Spark 1.2 na 45,5 proti 42,7 u Grok 4.5. V GPQA Diamond, testu vědeckých otázek doktorandské úrovně, se poměr obrací a vede Grok 4.5 s hodnotou 93,1 proti 90,4 u Muse Spark 1.2 · jde o největší náskok Grok 4.5 napříč sledovanými benchmarky, konkrétně 2,7 procentního bodu.

Překvapivý je rozdíl v LCR, testu porozumění dlouhému kontextu: Muse Spark 1.2 dosahuje 83,3, zatímco Grok 4.5 jen 74. Jde o největší náskok Muse Spark 1.2 v celém srovnání, 9,3 procentního bodu. V SciCode, testu programování vědeckých algoritmů, vede Muse Spark 1.2 s hodnotou 56,4 proti 54,1 u Grok 4.5 · rozdíl je menší, ale směr je konzistentní se zbytkem tabulky mimo GPQA Diamond.

Co která metrika znamená pro praxi

HLE testuje širokou expertní znalost napříč obory, takže vypovídá spíš o schopnosti modelu reagovat na neotřelé, obtížné dotazy než o výkonu v konkrétní firemní úloze. GPQA Diamond je naopak úzce zaměřený na vědecké otázky doktorandské úrovně · tady náskok Grok 4.5 naznačuje, že pro týmy pracující s odbornou vědeckou literaturou nebo výzkumem může být tento model relevantnější volbou, i přes vyšší cenu. SciCode měří schopnost psát vědecké algoritmy, což se blíží reálné práci datových vědců a vývojářů pracujících s výpočetním kódem · zde má navrch Muse Spark 1.2. LCR, test porozumění dlouhému kontextu, je klíčový pro každého, kdo pracuje s rozsáhlými dokumenty, smlouvami nebo dlouhými konverzacemi · a tady je náskok Muse Spark 1.2 nejvýraznější ze všech sledovaných metrik.

Cena dokresluje obrázek. Muse Spark 1.2 stojí 2 USD za milion tokenů, Grok 4.5 3 USD za milion tokenů, což podle předpočítaného poměru znamená, že Grok 4.5 je 1,5násobně dražší. Vzhledem k tomu, že rozdíly v indexu inteligence i kódování jsou minimální, tato cenová rozdíl váha spíše ve prospěch levnějšího modelu · pokud ovšem konkrétní úloha nespadá do oblasti, kde dražší model jasně vede, tedy do vědeckých otázek doktorandské úrovně měřených GPQA Diamond.

Který model zvolit pro jaké nasazení

Pro práci s dlouhými dokumenty, smlouvami nebo rozsáhlými datovými sadami dává podle LCR smysl sáhnout po Muse Spark 1.2, který je zároveň levnější. Stejně tak pro programování vědeckých algoritmů podle SciCode a pro širší expertní dotazy podle HLE vychází Muse Spark 1.2 lépe. Naopak organizace zaměřené na vědecký výzkum na doktorandské úrovni, kde je klíčový výsledek v GPQA Diamond, mají důvod zvážit Grok 4.5 i za cenu vyšších nákladů.

Kontext posledních týdnů dokresluje směr, kterým se Meta ubírá: podle mediálního monitoringu firma desátého srpna 2026 představila open-weight model Muse Glimmer s třiceti miliardami parametrů pod licencí Apache 2.0, což signalizuje návrat k otevřeným váhám po delší odmlce. Souběžně Mark Zuckerberg publikoval rozsáhlý text o vizi „osobní superinteligence“, který podle mediálního monitoringu vyvolal smíšené reakce. Pro výběr konkrétního modelu do produkčního nasazení to znamená, že vedle aktuálních benchmarků je vhodné sledovat i to, zda dodavatel model dlouhodobě podporuje a jak rychle uvolňuje navazující verze.

Časté dotazy

Je Muse Spark 1.2 levnější než Grok 4.5?

Ano. Muse Spark 1.2 stojí 2 USD za milion tokenů, zatímco Grok 4.5 stojí 3 USD za milion tokenů. Podle předpočítaného poměru je Grok 4.5 1,5násobně dražší. Vzhledem k tomu, že rozdíly v indexu inteligence i kódování jsou u obou modelů minimální, cenový rozdíl hraje při výběru významnou roli.

Který model je lepší ve vědeckých otázkách?

V GPQA Diamond, testu vědeckých otázek doktorandské úrovně, vede Grok 4.5 s hodnotou 93,1 proti 90,4 u Muse Spark 1.2. Jde o největší náskok Grok 4.5 napříč sledovanými benchmarky, 2,7 procentního bodu. Pro úzce vědecké nasazení tak data mírně favorizují Grok 4.5.

Který model zvládá lépe dlouhé dokumenty?

Podle LCR, testu porozumění dlouhému kontextu, dosahuje Muse Spark 1.2 hodnoty 83,3, zatímco Grok 4.5 jen 74. Jde o největší naměřený náskok v celém srovnání, 9,3 procentního bodu. Pro práci s rozsáhlými texty tak data jasně ukazují na Muse Spark 1.2.

ZDROJE DAT A METODIKA

Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 12. srpna 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.