V srpnu 2026 se na trhu jazykových modelů střetávají Qwen3.8 Max od společnosti Alibaba a Muse Spark 1.2 od společnosti Meta. Oba modely dělí v souhrnném indexu inteligence rozdíl 1,3 bodu ve prospěch Qwen3.8 Max, cena za milion tokenů se ale liší v poměru 1,5×. Srovnání dále postupuje od souhrnných čísel přes čtyři hloubkové benchmarky, GPQA Diamond, HLE, SciCode a LCR, až po otázku, který model se vyplatí pro jaký typ nasazení, od vědecké práce po autonomní agenty.
Souhrnné indexy: inteligence, kódování.
Hloubkové benchmarky: HLE, GPQA Diamond, SciCode, LCR.
Duel v kontextu celého pole: cena (log) vs. Intelligence Index.
Souhrnné indexy ukazují těsný, ale jasný rozdíl
V souhrnném indexu inteligence dosahuje Qwen3.8 Max hodnoty 58,1, zatímco Muse Spark 1.2 skončil na 56,8. Předpočítaný rozdíl mezi oběma modely činí 1,3 bodu ve prospěch Alibaby. V indexu kódování se pořadí obrací, byť těsně: Muse Spark 1.2 dosahuje 72,2 proti 71,8 bodu u Qwen3.8 Max. Rozdíl je natolik malý, že jde spíše o vyrovnaný souboj než o jasnou převahu jedné strany.
Cenový rozdíl je výraznější než rozdíly v samotné kvalitě. Qwen3.8 Max stojí 3 dolary za milion tokenů, Muse Spark 1.2 pouze 2 dolary, což odpovídá předpočítanému poměru cen 1,5×. Model od Alibaby tak sice vede v inteligenci, ale za cenu, která je citelně vyšší.
Co ukazují čtyři hloubkové benchmarky
Benchmark HLE testuje expertní otázky napříč obory a je relevantní pro práci ve vědě a výzkumu, kde se očekává širokospektrální znalost. Zde má navrch Muse Spark 1.2 s výsledkem 45,5 procenta proti 43 procentům u Qwen3.8 Max. Opačně to vypadá u GPQA Diamond, který měří vědecké otázky doktorandské úrovně a je tak dalším ukazatelem pro nasazení ve výzkumu: tady Qwen3.8 Max dosahuje 92,7 procenta a Muse Spark 1.2 90,4 procenta. Předpočítaný největší náskok Qwen3.8 Max, 2,3 procentního bodu, padá právě na tento benchmark.
SciCode měří programování vědeckých algoritmů a je relevantní pro autonomní agenty i práci v terminálu, kde model sám píše a spouští kód. Muse Spark 1.2 zde dosahuje 56,4 procenta, Qwen3.8 Max 52,9 procenta. Nejvýraznější rozdíl mezi oběma modely ale přináší LCR, benchmark porozumění dlouhému kontextu, klíčový pro práci s dlouhými dokumenty a dodržování zadání napříč rozsáhlým textem. Muse Spark 1.2 tu dosahuje 83,3 procenta proti 74,3 procenta u Qwen3.8 Max, což odpovídá předpočítanému největšímu náskoku Muse Spark 1.2 v hodnotě 9 procentních bodů.
Který model zvolit pro jaké nasazení
Pro organizace, které pracují s dlouhými dokumenty, smlouvami nebo rozsáhlou dokumentací, vychází z dat lépe Muse Spark 1.2, a to jak díky výsledku 83,3 procenta na LCR, tak díky nižší ceně 2 dolary za milion tokenů. Naopak pro vědecký a výzkumný provoz, kde se sází na přesnost odpovědí doktorandské úrovně, mluví data ve prospěch Qwen3.8 Max s výsledkem 92,7 procenta na GPQA Diamond, byť za cenu 3 dolary za milion tokenů. Pro programování vědeckých algoritmů v rámci autonomních agentů je rozdíl mezi 56,4 a 52,9 procenta v neprospěch Qwen3.8 Max, což stojí za zvážením u týmů budujících agentní pipeline.
Podle mediálního monitoringu Meta v srpnu 2026 zveřejnila nástroj Shepherd, open-source substrát pro agenty, který umí větvit, přehrávat a vracet průběh jednotlivých běhů agenta, což je téma přímo související s nasazením modelů v autonomních agentních úlohách. Podle mediálního monitoringu zároveň soud v Novém Mexiku uložil společnosti Meta zaplatit 567 milionů dolarů v souvislosti s dopadem jejích platforem na duševní zdraví mladistvých, což je faktor, který firmy mohou zvažovat při výběru dodavatele nezávisle na výkonu samotného modelu. Volba mezi Qwen3.8 Max a Muse Spark 1.2 tak není otázkou jednoho vítěze, ale otázkou, která metrika a která cena odpovídá konkrétnímu nasazení.
Časté dotazy
Který model je při stejném objemu textu levnější, Qwen3.8 Max nebo Muse Spark 1.2?
Muse Spark 1.2 stojí 2 dolary za milion tokenů, zatímco Qwen3.8 Max 3 dolary za milion tokenů. Předpočítaný poměr cen mezi oběma modely činí 1,5×. Model od Alibaby je tak citelně dražší, i když vede v souhrnném indexu inteligence o 1,3 bodu.
Který model lépe rozumí dlouhým dokumentům?
V benchmarku LCR, který měří porozumění dlouhému kontextu, dosahuje Muse Spark 1.2 hodnoty 83,3 procenta, zatímco Qwen3.8 Max 74,3 procenta. Jde o předpočítaně největší náskok Muse Spark 1.2 v celém srovnání, konkrétně 9 procentních bodů, což je relevantní pro práci s rozsáhlými texty a dodržování zadání.
Který model je vhodnější pro vědecký a výzkumný provoz?
Na benchmarku GPQA Diamond, který testuje vědecké otázky doktorandské úrovně, dosahuje Qwen3.8 Max 92,7 procenta proti 90,4 procenta u Muse Spark 1.2. Jde o předpočítaně největší náskok Qwen3.8 Max, konkrétně 2,3 procentního bodu, a je to argument pro nasazení ve vědě a výzkumu.
ZDROJE DAT A METODIKA
Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 10. srpna 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.