Srpen 2026 přinesl přímé srovnání dvou vlajkových modelů: Claude Opus 5 od Anthropicu a Grok 4.6 od společnosti xAI. Oba modely spojuje důraz na hloubkové úlohy · expertní znalosti, vědecké uvažování, dlouhý kontext a programování. Srovnání vychází z indexu inteligence, kódování, ceny za milion tokenů, rychlosti generování a čtyř hloubkových benchmarků: HLE, GPQA Diamond, SciCode a LCR. Právě kombinace těchto čísel ukazuje, že vítězství v jedné metrice neznamená vítězství v provozu.

Svislé sloupce: souhrnné indexy (inteligence, kódování) modelů Claude Opus 5 a Grok 4.6 Souhrnné indexy: inteligence, kódování.

Svislé sloupce: úspěšnost modelů Claude Opus 5 a Grok 4.6 v jednotlivých hloubkových benchmarcích Hloubkové benchmarky: HLE, GPQA Diamond, SciCode, LCR.

Bodový graf ceny proti inteligenci se zvýrazněnými modely Claude Opus 5 a Grok 4.6 Duel v kontextu celého pole: cena (log) vs. Intelligence Index.

Kdo vede v indexech a hloubkových testech

Claude Opus 5 vede v obou souhrnných indexech: v indexu inteligence dosahuje 63,1 bodu proti 60,9 bodu u Groku 4.6, rozdíl je 2,2 bodu. V kódování je poměr obdobný · 78 bodů proti 76,8 bodu. Náskok je čitelný, ale těsný · o drtivém vítězství nelze mluvit.

Rozdíl se prohlubuje u testu HLE, tedy expertních otázek napříč obory typu Humanity’s Last Exam: Claude Opus 5 dosahuje 54,9 procenta, Grok 4.6 jen 42,9 procenta, což je největší náskok Claude Opus 5 v celém srovnání · 12 procentních bodů. Pro práci s expertními dotazy z různých oborů jde o zásadní rozdíl. U GPQA Diamond, tedy vědeckých otázek doktorandské úrovně, je naopak napřed Grok 4.6 s 94,9 procenta proti 93,2 procenta u Claude Opus 5, což je jeho největší náskok v celém srovnání · 1,7 procentního bodu. U SciCode, benchmarku pro programování vědeckých algoritmů relevantního pro autonomní agenty a práci v terminálu, vede znovu Claude Opus 5 s 55,7 procenta proti 53,6 procenta. V LCR, testu porozumění dlouhému kontextu důležitého pro práci s dlouhými dokumenty, jsou si oba modely nejblíže: Claude Opus 5 má 75,7 procenta, Grok 4.6 75 procent.

Souboj přichází v období intenzivního pohybu na trhu: Grok 4.6 vyšel podle mediálního monitoringu 12. srpna 2026 jako aktualizace předchozí verze Grok 4.5, nikoli jako zcela nový základní model. Anthropic ve stejném období podle agenturních zpráv chystá vstup na burzu s cílovou hodnotou kolem dvou bilionů dolarů a začal texty generované Claude označovat neviditelným vodoznakem.

Co čísla znamenají a co ne

Claude Opus 5 vede v indexu inteligence a v testu HLE, ale je to zároveň řádově dražší model: cena je 10 dolarů za milion tokenů proti 3 dolarům u Groku 4.6, poměr cen je 3,3×. Rozdíl 2,2 bodu v indexu inteligence je tak potřeba poměřovat s tím, že jde o podstatně dražší nasazení. Pro provoz s vysokým objemem dotazů se cenový rozdíl v rozpočtu projeví výrazněji než těsný náskok v souhrnném indexu.

Grok 4.6 generuje rychleji, 55,9 tokenu za sekundu proti 48,8 tokenu za sekundu u Claude Opus 5, poměr rychlostí je 1,1×, tedy těsný rozdíl. Čas do prvního tokenu je ale u Groku 4.6 47,28 sekundy, u Claude Opus 5 jen 30,8 sekundy · Grok tedy déle čeká, než začne odpovídat, i když pak text generuje rychleji. Pro interaktivní použití, kde uživatel čeká na první odpověď, tak může být zkušenost s Claude Opus 5 subjektivně plynulejší, přestože celková rychlost generování je u něj nižší.

Hloubkové benchmarky jako HLE nebo GPQA Diamond měří výkon na pevně definovaných otázkách v laboratorních podmínkách. Vysoké procento u GPQA Diamond neznamená, že model podá stejný výkon v delší interakci s uživatelem nebo ve spolupráci s dalšími agenty · benchmark testuje jednotlivou odpověď, ne dlouhodobou spolehlivost v provozu. Rozdíl 1,7 procentního bodu ve prospěch Groku 4.6 je navíc natolik těsný, že jej lze číst spíše jako vyrovnaný výsledek než jako jasnou převahu.

Který model zvolit pro jaké nasazení

Pro instituce, které potřebují expertní pokrytí napříč obory · výzkumné týmy, konzultační firmy, analytická oddělení · dává smysl sáhnout po Claude Opus 5. Náskok 12 procentních bodů u HLE a vyšší index inteligence (63,1 proti 60,9) jsou argumenty, které převáží i vyšší cenu 10 dolarů za milion tokenů. U čistě vědeckých otázek doktorandské úrovně, kde měří GPQA Diamond, je ale rozdíl v podstatě vyrovnaný a Grok 4.6 tam dokonce mírně vede.

Pro provozy s vysokým objemem dotazů, kde se každý dolar za milion tokenů násobí mnohokrát denně, je cena 3 dolary za milion tokenů u Groku 4.6 proti 10 dolarům u Claude Opus 5 argument, který nelze přehlížet · poměr cen 3,3× je citelný rozdíl v provozním rozpočtu. U aplikací citlivých na první odezvu ale stojí za zvážení kratší čas do prvního tokenu u Claude Opus 5, tedy 30,8 sekundy proti 47,28 sekundy u Groku 4.6, i za cenu vyšší útraty.

Časté dotazy

Který model je rychlejší, Claude Opus 5 nebo Grok 4.6?

Grok 4.6 generuje text rychleji, 55,9 tokenu za sekundu proti 48,8 tokenu za sekundu u Claude Opus 5, což je poměr rychlostí 1,1×. Claude Opus 5 má ale kratší čas do prvního tokenu, 30,8 sekundy proti 47,28 sekundy u Groku 4.6. Rychlost generování a rychlost první odpovědi tak u těchto modelů jdou proti sobě.

Je Claude Opus 5 dražší než Grok 4.6?

Ano. Claude Opus 5 stojí 10 dolarů za milion tokenů, Grok 4.6 jen 3 dolary za milion tokenů, poměr cen mezi modely je 3,3×. Grok 4.6 je tak výrazně levnější, zatímco Claude Opus 5 vede v indexu inteligence a v testu HLE o 12 procentních bodů.

V čem je Grok 4.6 lepší než Claude Opus 5?

Grok 4.6 mírně vede v testu GPQA Diamond, tedy u vědeckých otázek doktorandské úrovně, kde dosahuje 94,9 procenta proti 93,2 procenta u Claude Opus 5 · jde o náskok 1,7 procentního bodu. Grok 4.6 je také výrazně levnější a rychlejší v tokenech za sekundu.

ZDROJE DAT A METODIKA

Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 14. srpna 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.