V září 2026 se setkávají dva agentní modely určené pro autonomní práci: Muse Spark 1.3 od Meta a Grok 4.6 od xAI. Srovnání vychází z pěti souhrnných metrik a čtyř hloubkových benchmarků, které pokrývají expertní úvahu, vědecké otázky, programování algoritmů a dlouhé kontexty. Data ukazují, že žádný model nevládne ve všech disciplínách · volba závisí na tom, zda prioritou je rychlost a cena, nebo špičkový vědecký výpočet.

Svislé sloupce: souhrnné indexy (inteligence, kódování) modelů Muse Spark 1.3 a Grok 4.6 Souhrnné indexy: inteligence, kódování.

Svislé sloupce: úspěšnost modelů Muse Spark 1.3 a Grok 4.6 v jednotlivých hloubkových benchmarcích Hloubkové benchmarky: HLE, GPQA Diamond, SciCode, LCR.

Bodový graf ceny proti inteligenci se zvýrazněnými modely Muse Spark 1.3 a Grok 4.6 Duel v kontextu celého pole: cena (log) vs. Intelligence Index.

Co ukazují souhrnné indexy a benchmarky

V souhrném indexu inteligence Muse Spark 1.3 dosahuje 53 bodů, Grok 4.6 50,6 bodu, rozdíl je 2,4 bodu v prospěch Muse. V kódování je situace opačná: Grok 4.6 vede s 76,8 bodů oproti 76,3 bodům Muse Spark 1.3, tedy těsným odstupem. Cena za milion tokenů u Muse Spark 1.3 stojí 2 USD, u Grok 4.6 3 USD, což odpovídá poměru 1,5× v prospěch Muse. Rychlost generování tokenů je u Muse Spark 1.3 176,5 tokenů za sekundu, u Grok 4.6 56,9 tokenů za sekundu, tedy 3,1× rychlejší. Čas k prvnímu tokenu (TTFT) Muse Spark 1.3 měří 18,4 sekundy, Grok 4.6 35,31 sekundy.

Ve hloubkových benchmarcích Muse Spark 1.3 dominuje v HLE (expertní otázky napříč obory) s 49,1 % úspěšnosti proti 42,9 % Grok 4.6, největší náskok 6,2 procentních bodů. V GPQA Diamond (vědecké otázky doktorandské úrovně) vede Grok 4.6 s 94,9 % oproti 93,8 %, náskok 1,1 procentního bodu. SciCode (programování vědeckých algoritmů) ukazuje 58,3 % pro Muse Spark 1.3 a 56,5 % pro Grok 4.6. LCR (porozumění dlouhému kontextu) vykazuje 84,3 % u Muse Spark 1.3 a 80,3 % u Grok 4.6.

Kritická interpretace pro reálný provoz

Index inteligence je syntetická metrika a v praxi se projeví odlišně podle typu úlohy. Vyšší skóre Muse Spark 1.3 v HLE a LCR naznačuje lepší orientaci v heterogenních zadáních a udržování kontextu při dlouhých dialozích, což je klíčové pro autonomní agenty, které provádějí vícekrokové plány. Grok 4.6 s lehkým náskokem v GPQA Diamond a kódování může být přínosnější při specializovaných vědeckých výpočtech, kde záleží na přesném odvození než na šíři kontextu.

Rychlost 3,1× a nižší cena 1,5× u Muse Spark 1.3 se projeví u rozsáhlých agentních běhů, kde model volá nástroje v smyčkách a generuje velké objemy textu. Nižší TTFT (18,4 s vs 35,31 s) zkracuje odezvu v interaktivních scénářích. Na druhé straně těsné skóre v kódování (76,3 vs 76,8) znamená, že u čistého programování bez agentní vrstvy rozdíl nebývá rozhodující. Benchmarky neodrážejí latenci v produkci, dostupnost API ani stabilitu verzí.

Jak vybrat model pro nasazení

Pro české firmy nasazující autonomní agenty pro analýzu dokumentů, zákaznickou podporu nebo vývojářské nástroje s dlouhými kontexty je Muse Spark 1.3 přirozenou volbou: kombinace vyšší inteligence, rychlosti, ceny a silného LCR pokrývá typické agentní vzory. Pokud organizace řeší primárně vědecké modelování, simulace nebo specializované algoritmické výzvy, kde dominuje GPQA Diamond a kódování, Grok 4.6 nabízí těsnou výhodu. Univerzálního vítěze data nepodporují · rozhoduje profil úlohy.

Kontext z tisku dodává, že Meta spouští program slevy za sdílení dat o používání Muse Spark a model používá o 20 % méně nástrojových volání a 25 % méně tokenů než předchozí verze, podle mediálního monitoringu. xAI propaguje Grok Bot jako programovatelný na vyšší úrovni abstrakce, podle agenturních zpráv. Oba tvůrci tak signalizují směřování k agentním pracovním postupům, nikoliv k pouhému chatovému rozhraní.

Časté dotazy

Který model je levnější a rychlejší pro agentní úlohy?

Muse Spark 1.3 stojí 2 USD za milion tokenů, Grok 4.6 3 USD, poměr cen je 1,5× v prospěch Muse. Rychlost generování je 176,5 tokenů za sekundu u Muse Spark 1.3 proti 56,9 tokenů za sekundu u Grok 4.6, tedy 3,1× rychlejší. TTFT je 18,4 sekundy oproti 35,31 sekundám.

Který model lépe zvládá vědecké otázky a kódování algoritmů?

V GPQA Diamond (vědecké otázky doktorandské úrovně) vede Grok 4.6 s 94,9 % úspěšnosti nad Muse Spark 1.3 s 93,8 %, náskok 1,1 procentního bodu. V SciCode (programování vědeckých algoritmů) Muse Spark 1.3 dosahuje 58,3 %, Grok 4.6 56,5 %. Rozdíly jsou v obou případech těsné.

Jak se modely liší v práci s dlouhými dokumenty a expertními úkoly?

V LCR (porozumění dlouhému kontextu) Muse Spark 1.3 dosahuje 84,3 %, Grok 4.6 80,3 %. V HLE (expertní otázky napříč obory) Muse Spark 1.3 vede 49,1 % proti 42,9 %, největší náskok 6,2 procentních bodů. To naznačuje lepší udržování kontextu a orientaci v složitých zadáních u Muse Spark 1.3.

ZDROJE DAT A METODIKA

Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 7. září 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.