V září 2026 se setkávají dva agentní modely určené pro autonomní práci: Muse Spark 1.3 od Meta a Grok 4.6 od xAI. Srovnání vychází z pěti souhrnných metrik a čtyř hloubkových benchmarků, které pokrývají expertní úvahu, vědecké otázky, programování algoritmů a dlouhé kontexty. Data ukazují, že žádný model nevládne ve všech disciplínách · volba závisí na tom, zda prioritou je rychlost a cena, nebo špičkový vědecký výpočet.
Souhrnné indexy: inteligence, kódování.
Hloubkové benchmarky: HLE, GPQA Diamond, SciCode, LCR.
Duel v kontextu celého pole: cena (log) vs. Intelligence Index.
Co ukazují souhrnné indexy a benchmarky
V souhrném indexu inteligence Muse Spark 1.3 dosahuje 53 bodů, Grok 4.6 50,6 bodu, rozdíl je 2,4 bodu v prospěch Muse. V kódování je situace opačná: Grok 4.6 vede s 76,8 bodů oproti 76,3 bodům Muse Spark 1.3, tedy těsným odstupem. Cena za milion tokenů u Muse Spark 1.3 stojí 2 USD, u Grok 4.6 3 USD, což odpovídá poměru 1,5× v prospěch Muse. Rychlost generování tokenů je u Muse Spark 1.3 176,5 tokenů za sekundu, u Grok 4.6 56,9 tokenů za sekundu, tedy 3,1× rychlejší. Čas k prvnímu tokenu (TTFT) Muse Spark 1.3 měří 18,4 sekundy, Grok 4.6 35,31 sekundy.
Ve hloubkových benchmarcích Muse Spark 1.3 dominuje v HLE (expertní otázky napříč obory) s 49,1 % úspěšnosti proti 42,9 % Grok 4.6, největší náskok 6,2 procentních bodů. V GPQA Diamond (vědecké otázky doktorandské úrovně) vede Grok 4.6 s 94,9 % oproti 93,8 %, náskok 1,1 procentního bodu. SciCode (programování vědeckých algoritmů) ukazuje 58,3 % pro Muse Spark 1.3 a 56,5 % pro Grok 4.6. LCR (porozumění dlouhému kontextu) vykazuje 84,3 % u Muse Spark 1.3 a 80,3 % u Grok 4.6.
Kritická interpretace pro reálný provoz
Index inteligence je syntetická metrika a v praxi se projeví odlišně podle typu úlohy. Vyšší skóre Muse Spark 1.3 v HLE a LCR naznačuje lepší orientaci v heterogenních zadáních a udržování kontextu při dlouhých dialozích, což je klíčové pro autonomní agenty, které provádějí vícekrokové plány. Grok 4.6 s lehkým náskokem v GPQA Diamond a kódování může být přínosnější při specializovaných vědeckých výpočtech, kde záleží na přesném odvození než na šíři kontextu.
Rychlost 3,1× a nižší cena 1,5× u Muse Spark 1.3 se projeví u rozsáhlých agentních běhů, kde model volá nástroje v smyčkách a generuje velké objemy textu. Nižší TTFT (18,4 s vs 35,31 s) zkracuje odezvu v interaktivních scénářích. Na druhé straně těsné skóre v kódování (76,3 vs 76,8) znamená, že u čistého programování bez agentní vrstvy rozdíl nebývá rozhodující. Benchmarky neodrážejí latenci v produkci, dostupnost API ani stabilitu verzí.
Jak vybrat model pro nasazení
Pro české firmy nasazující autonomní agenty pro analýzu dokumentů, zákaznickou podporu nebo vývojářské nástroje s dlouhými kontexty je Muse Spark 1.3 přirozenou volbou: kombinace vyšší inteligence, rychlosti, ceny a silného LCR pokrývá typické agentní vzory. Pokud organizace řeší primárně vědecké modelování, simulace nebo specializované algoritmické výzvy, kde dominuje GPQA Diamond a kódování, Grok 4.6 nabízí těsnou výhodu. Univerzálního vítěze data nepodporují · rozhoduje profil úlohy.
Kontext z tisku dodává, že Meta spouští program slevy za sdílení dat o používání Muse Spark a model používá o 20 % méně nástrojových volání a 25 % méně tokenů než předchozí verze, podle mediálního monitoringu. xAI propaguje Grok Bot jako programovatelný na vyšší úrovni abstrakce, podle agenturních zpráv. Oba tvůrci tak signalizují směřování k agentním pracovním postupům, nikoliv k pouhému chatovému rozhraní.
Časté dotazy
Který model je levnější a rychlejší pro agentní úlohy?
Muse Spark 1.3 stojí 2 USD za milion tokenů, Grok 4.6 3 USD, poměr cen je 1,5× v prospěch Muse. Rychlost generování je 176,5 tokenů za sekundu u Muse Spark 1.3 proti 56,9 tokenů za sekundu u Grok 4.6, tedy 3,1× rychlejší. TTFT je 18,4 sekundy oproti 35,31 sekundám.
Který model lépe zvládá vědecké otázky a kódování algoritmů?
V GPQA Diamond (vědecké otázky doktorandské úrovně) vede Grok 4.6 s 94,9 % úspěšnosti nad Muse Spark 1.3 s 93,8 %, náskok 1,1 procentního bodu. V SciCode (programování vědeckých algoritmů) Muse Spark 1.3 dosahuje 58,3 %, Grok 4.6 56,5 %. Rozdíly jsou v obou případech těsné.
Jak se modely liší v práci s dlouhými dokumenty a expertními úkoly?
V LCR (porozumění dlouhému kontextu) Muse Spark 1.3 dosahuje 84,3 %, Grok 4.6 80,3 %. V HLE (expertní otázky napříč obory) Muse Spark 1.3 vede 49,1 % proti 42,9 %, největší náskok 6,2 procentních bodů. To naznačuje lepší udržování kontextu a orientaci v složitých zadáních u Muse Spark 1.3.
ZDROJE DAT A METODIKA
Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 7. září 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.