Článek srovnává dva vrcholové modely září 2026: Claude Opus 5 od Anthropic a Qwen3.8 Max od Alibaby. Data pocházejí z jednotné sady metrik zahrnujících souhrnný index inteligence, benchmark kódování, cenu za milion tokenů, generovací rychlost a čas k prvnímu tokenu. Doplňují je čtyři hloubkové benchmarky zaměřené na expertní znalosti, vědecké úlohy, algoritmické programování a dlouhý kontext. Cílem je ukázat, který model se vyplatí pro konkrétní typ nasazení bez marketingu.
Souhrnné indexy: inteligence, kódování.
Hloubkové benchmarky: HLE, GPQA Diamond, SciCode, LCR.
Duel v kontextu celého pole: cena (log) vs. Intelligence Index.
Co ukazují souhrnné indexy a benchmarky
Claude Opus 5 dosahuje indexu inteligence 63,1 a skóre kódování 78, zatímco Qwen3.8 Max dosahuje 58,1 a 71,8. Rozdíl indexu inteligence činí pět bodů v prospěch Clauda. V hloubkových benchmarcích Claude vede ve všech čtyřech: HLE 54,9 proti 43, GPQA Diamond 93,2 proti 92,7, SciCode 55,7 proti 52,9 a LCR 75,7 proti 74,3. Největší náskok Claude Opus 5 je v HLE, kde převyšuje Qwen o 11,9 procentního bodu.
Překvapivě těsné jsou výsledky v GPQA Diamond a LCR, kde se modely liší jen o zlomky bodu. U SciCode je odstup o necelé tři body. HLE je jediný benchmark, kde se rozdíl projeví výrazněji, což naznačuje, že Claude lépe zvládá syntézu expertních znalostí napříč obory. Pro reálnou práci to znamená výhodu při vědeckém výzkumu a komplexních analytických úlohách.
Kritická interpretace rychlosti a cen
Claude Opus 5 generuje 53,8 tokenů za vteřinu s časem k prvnímu tokenu 34,57 sekundy, Qwen3.8 Max 29,9 tokenů za vteřinu s 1,76 vteřiny. Poměr rychlostí je 1,8× v prospěch Clauda při generování, ovšem Qwen má řádově nižší latenci startu. V praxi to znamená, že pro dávkové zpracování dlouhých výstupů je Claude rychlejší, pro interaktivní chat a agenty s rychlým cyklem Qwen odpovídá lépe.
Cena za milion tokenů je u Clauda 10 dolarů, u Qwenu 3 dolary, poměr cen je 3,3×. Laboratorní benchmarky neodrážejí náklady na infrastrukturu, kvóty ani limitů týdenních limitů, které podle mediálního monitoringu Anthropic mění. GPQA Diamond a LCR ukazují vysokou shodu, takže pro rutinné vědecké dotazy a dlouhé dokumenty může levnější model stačit. HLE a SciCode odhalují reálnější rozdíly v hloubce úvahy a algoritmické přesnosti.
Co z toho plyne pro firmy
Pro české firmy a organizace platí: pokud je prioritou maximální kvalita vědeckého výstupu, syntéza znalostí a přesné dodržování složitých instrukcí, Claude Opus 5 ospravedlňuje vyšší náklady. Jeho výhoda v HLE a SciCode se projeví při vývoji výzkumných algoritmů a analýze expertních dokumentů.
Pokud jde o nasazení agentů s nízkou latencí, masové zpracování textu, kde stačí dobrá ne nikoliv nejlepší kvalita, nebo omezený rozpočet, Qwen3.8 Max nabízí přiměřený výkon za zlomek ceny. Rychlý TTFT podporuje interaktivní aplikace, nízká cena umožňuje škálování bez neúměrných výdajů. Volba by měla reflektovat konkrétní úlohu, ne souhrnné skóre.
Časté dotazy
Který model je lepší pro vědecký výzkum?
Claude Opus 5 vede v GPQA Diamond se 93,2 proti 92,7 a v SciCode 55,7 proti 52,9, což signalizuje lepší zvládání vědeckých otázek a algoritmického programování. Rozdíly jsou však malé. Pro rutinné dotazy stačí Qwen3.8 Max, pro hraniční výzkum a přesné algoritmy je Claude výhodnější.
Jak velký je rozdíl v cenách a rychlosti?
Claude Opus 5 stojí 10 dolarů za milion tokenů, Qwen3.8 Max 3 dolary, poměr cen je 3,3×. Generovací rychlost Clauda je 53,8 tokenů za vteřinu, Qwenu 29,9, poměr rychlostí 1,8×. TTFT u Clauda 34,57 sekundy, u Qwenu 1,76 vteřiny. Pro dávkové úlohy je Claude rychlejší, pro interaktivní Qwen.
V kterém benchmarku je největší rozdíl?
Největší náskok Claude Opus 5 je v HLE, kde dosahuje 54,9 proti 43, rozdíl 11,9 procentního bodu. HLE měří expertní otázky napříč obory. Ostatní benchmarky GPQA Diamond, SciCode a LCR ukazují těsnější výsledky. HLE tedy nejlépe odlišuje hloubku syntézy znalostí.
ZDROJE DAT A METODIKA
Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 1. září 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.