V srpnu 2026 čelí firmy volbě mezi dvěma přístupy k nasazení velkých jazykových modelů: prémiovým Claude Opus 5 od Anthropic a levnějším Muse Spark 1.2 od Meta. Srovnání vychází ze souhrnných indexů inteligence a kódování a ze čtyř hloubkových benchmarků HLE, GPQA Diamond, SciCode a LCR, doplněných o cenu za milion tokenů. Tato data ukazují, že rozhodnutí není jednoznačné a záleží na typu nasazení, od vědeckého výzkumu po zpracování dlouhých dokumentů.

Svislé sloupce: souhrnné indexy (inteligence, kódování) modelů Claude Opus 5 a Muse Spark 1.2 Souhrnné indexy: inteligence, kódování.

Svislé sloupce: úspěšnost modelů Claude Opus 5 a Muse Spark 1.2 v jednotlivých hloubkových benchmarcích Hloubkové benchmarky: HLE, GPQA Diamond, SciCode, LCR.

Bodový graf ceny proti inteligenci se zvýrazněnými modely Claude Opus 5 a Muse Spark 1.2 Duel v kontextu celého pole: cena (log) vs. Intelligence Index.

Kdo vede v souhrnných indexech a testech

Claude Opus 5 dosahuje indexu inteligence 63,1 bodu, Muse Spark 1.2 zaostává na hodnotě 56,8 bodu, rozdíl mezi oběma modely činí 6,3 bodu. V kódování je odstup podobný: Claude Opus 5 skóruje 78, Muse Spark 1.2 72,2. Ve všech souhrnných metrikách tedy vede model Anthropicu.

Rozdílný obraz nabízejí hloubkové testy. HLE, který prověřuje expertní otázky napříč obory a je relevantní pro vědu a výzkum, dopadl jasně ve prospěch Claude Opus 5 s výsledkem 54,9 procenta proti 45,5 procenta u Muse Spark 1.2, což představuje největší náskok Claude Opus 5 v celém srovnání, 9,4 procentního bodu. Podobně u GPQA Diamond, testu vědeckých otázek doktorandské úrovně relevantního opět pro výzkumné nasazení, vede Claude Opus 5 s 93,2 procenta oproti 90,4 procenta.

Obraz se ale otáčí u dvou zbývajících testů. SciCode, benchmark programování vědeckých algoritmů relevantní pro autonomní agenty a práci v terminálu, dopadl těsně ve prospěch Muse Spark 1.2 s výsledkem 56,4 procenta proti 55,7 procenta u Claude Opus 5. U LCR, testu porozumění dlouhému kontextu relevantního pro práci s dlouhými dokumenty a dodržování zadání, je náskok Muse Spark 1.2 už výraznější: 83,3 procenta proti 75,7 procenta u Claude Opus 5, což je největší náskok Muse Spark 1.2 v celém srovnání, 7,7 procentního bodu.

Co cena a čísla znamenají v praxi

Cenový rozdíl mezi oběma modely je řádový: Claude Opus 5 stojí 10 USD za milion tokenů, Muse Spark 1.2 pouze 2 USD, tedy pětinásobek. Náskok Claude Opus 5 v HLE i GPQA Diamond je přitom vyjádřen v jednotkách procentních bodů, zatímco cenový odstup je řádově vyšší, takže pro provoz s vysokým objemem dotazů musí dražší model svou přesnost obhájit konkrétním případem užití, nikoli automaticky.

Aktuální dění cenovou otázku ještě zostřuje. Podle agenturních zpráv vedou Anthropic i OpenAI cenovou válku s čínskými konkurenty a snižují ceny svých modelů, což může dále měnit poměr mezi 10 USD a 2 USD za milion tokenů. Podle mediálního monitoringu zároveň Meta vydala otevřený model Glimmer, zatímco Muse Spark zůstává uzavřený za vlastním rozhraním API, což je pro rozhodování o nasazení jiná otázka než čistý výkon v benchmarku.

Podle mediálního monitoringu Anthropic zároveň zveřejnil podrobnosti o vodoznacích, kterými bude neviditelně označovat text generovaný modely Claude, což může hrát roli při rozhodování o nasazení tam, kde je důležité ověřit původ vygenerovaného obsahu.

Který model pro jaké nasazení

Pro vědecký výzkum, práci s expertními otázkami a úlohy, kde je klíčové přesné dodržení zadání na úrovni doktorandské přípravy, ukazují data ve prospěch Claude Opus 5: vede v HLE s 54,9 procenta i v GPQA Diamond s 93,2 procenta a zároveň drží vyšší souhrnný index inteligence 63,1 bodu i kódování 78. Cena 10 USD za milion tokenů je pro tento typ nasazení, kde se cení přesnost před objemem, spíše vedlejší otázka.

Pro provoz s dlouhými dokumenty, kde rozhoduje benchmark LCR, a pro cenově citlivé nasazení agentů či hromadného zpracování textu vychází lépe Muse Spark 1.2: dosahuje 83,3 procenta v LCR i mírně vyššího výsledku 56,4 procenta v SciCode, a to za cenu 2 USD za milion tokenů. České firmy a organizace by tak měly volbu odvíjet od konkrétní úlohy, nikoli od souhrnného indexu inteligence samotného.

Časté dotazy

Je Claude Opus 5 ve všech ohledech lepší než Muse Spark 1.2?

Ne. Claude Opus 5 vede v souhrnném indexu inteligence 63,1 proti 56,8 bodu, v kódování i v benchmarcích HLE a GPQA Diamond. Muse Spark 1.2 ale dosahuje lepšího výsledku v LCR s 83,3 procenta proti 75,7 procenta a v SciCode s 56,4 procenta proti 55,7 procenta u Claude Opus 5.

Kolikrát je Claude Opus 5 dražší než Muse Spark 1.2?

Claude Opus 5 stojí 10 USD za milion tokenů, Muse Spark 1.2 pouze 2 USD, tedy pětinásobek. Tento cenový odstup je výrazně větší než rozdíly naměřené v jednotlivých benchmarcích, kde se výsledky obou modelů většinou pohybují v řádu jednotek procentních bodů.

Pro jaké nasazení se hodí Muse Spark 1.2 lépe než Claude Opus 5?

Muse Spark 1.2 je vhodnější tam, kde rozhoduje práce s dlouhými dokumenty a cena: v LCR dosahuje 83,3 procenta proti 75,7 procenta u Claude Opus 5 a stojí jen 2 USD za milion tokenů. Mírně vede i v SciCode, benchmarku programování vědeckých algoritmů, s výsledkem 56,4 procenta.

ZDROJE DAT A METODIKA

Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 16. srpna 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.