V srpnu 2026 stojí proti sobě dva modely, které si nárokují místo na špici žebříčků: Grok 4.6 od xAI a Qwen3.8 Max od Alibaby. Srovnání vychází z indexu inteligence, kódování, ceny za milion tokenů, rychlosti generování a doby do prvního tokenu, doplněných o čtyři hloubkové benchmarky · HLE, GPQA Diamond, SciCode a LCR. Tato čísla ukazují, kde se modely reálně liší a kde je rozdíl jen kosmetický.

Svislé sloupce: souhrnné indexy (inteligence, kódování) modelů Grok 4.6 a Qwen3.8 Max Souhrnné indexy: inteligence, kódování.

Svislé sloupce: úspěšnost modelů Grok 4.6 a Qwen3.8 Max v jednotlivých hloubkových benchmarcích Hloubkové benchmarky: HLE, GPQA Diamond, SciCode, LCR.

Bodový graf ceny proti inteligenci se zvýrazněnými modely Grok 4.6 a Qwen3.8 Max Duel v kontextu celého pole: cena (log) vs. Intelligence Index.

Souhrnné indexy ukazují těsný náskok Groku

Grok 4.6 dosahuje indexu inteligence 60,9 bodu, Qwen3.8 Max 58,1 bodu · rozdíl činí 2,8 bodu ve prospěch Groku. Podobný odstup je v kódování: 76,8 u Groku proti 71,8 u Qwenu. Cena za milion tokenů je u obou modelů shodná, 3 USD za milion, poměr cen je tedy 1×. Žádný z modelů tedy není dražší ani levnější.

Rychlost generování mluví jednoznačně pro Groka · 70,3 tokenu za sekundu proti 47,1 u Qwenu, což odpovídá poměru rychlostí 1,5×. Překvapivý je ale opačný obrázek u doby do prvního tokenu: Grok potřebuje 40,24 sekundy, zatímco Qwen jen 1,82 sekundy. Kdo pracuje s krátkými dotazy a čeká na první odpověď, pocítí tento rozdíl citelněji než rychlost samotného generování textu.

Podle mediálního monitoringu vydala xAI Grok 4.6 dvanáctého srpna 2026 jako aktualizaci modelu Grok 4.5 s kontextovým oknem 500 tisíc tokenů, zaměřenou na dlouho běžící agenty, kódování a znalostní práci. Podle stejného zdroje krátce předtím uzavřela xAI akvizici nástroje Cursor v hodnotě šedesát miliard dolarů. Alibaba mezitím vydala menší model Qwen 3.8 27B určený pro běh na běžném notebooku a podle agenturních zpráv zvažuje prodej herního studia Lingxi Games za více než dvě miliardy dolarů.

Hloubkové benchmarky: věda, kód a kontext

HLE (Humanity’s Last Exam) testuje expertní otázky napříč obory a je relevantní tam, kde model řeší úzce specializované dotazy z vědy, práva či medicíny. Zde je výsledek nejtěsnější z celého srovnání · Qwen3.8 Max dosahuje 43 procenta, Grok 4.6 42,9 procenta, Qwen tedy vede o 0,1 procentního bodu. GPQA Diamond měří vědecké otázky doktorandské úrovně a je klíčový pro nasazení ve vědě a výzkumu · tady má Grok 4.6 nejvýraznější náskok z celého srovnání, 94,9 procenta proti 92,7 procenta u Qwenu, tedy 2,2 procentního bodu.

SciCode testuje programování vědeckých algoritmů a je relevantní pro autonomní agenty a práci v terminálu, kde model musí sám napsat a odladit funkční kód · Grok 4.6 dosahuje 53,6 procenta, Qwen3.8 Max 52,9 procenta, rozdíl je tedy těsný. LCR měří porozumění dlouhému kontextu a je důležité pro práci s dlouhými dokumenty, smlouvami nebo rozsáhlou dokumentací; Grok 4.6 zde dosahuje 75 procenta, Qwen3.8 Max 74,3 procenta.

Který model zvolit pro jaké nasazení

Protože cena za milion tokenů je u obou modelů stejná a poměr cen je 1×, rozhoduje o volbě výkon, ne rozpočet. Pro vědecké a výzkumné nasazení, kde je klíčový GPQA Diamond, dává smysl Grok 4.6 · jeho náskok 2,2 procentního bodu je v tomto srovnání největší. Pro autonomní agenty a práci v terminálu, kde SciCode ukazuje jen těsný rozdíl mezi 53,6 procenta a 52,9 procenta, není volba tak jednoznačná a může rozhodnout jiná vlastnost, například doba do prvního tokenu.

Právě tato metrika je faktor, který čísla z HLE ani GPQA nezachytí, ale pro provoz je zásadní: Qwen3.8 Max odpovídá za 1,82 sekundy, Grok 4.6 až za 40,24 sekundy. U interaktivních nasazení, chatbotů nebo nástrojů s krátkou odezvou to může znamenat citelně horší uživatelský dojem u Groku i přes vyšší rychlost generování a vyšší index inteligence. Firmy, které potřebují dlouhý kontext a přesnost ve vědeckých úlohách, sáhnou spíš po Grokovi; tam, kde je klíčová okamžitá reakce, je na místě Qwen3.8 Max.

Časté dotazy

Je Grok 4.6 rychlejší než Qwen3.8 Max?

Grok 4.6 generuje text rychlostí 70,3 tokenu za sekundu, Qwen3.8 Max 47,1 tokenu za sekundu, což odpovídá poměru rychlostí 1,5× ve prospěch Groku. Doba do prvního tokenu je ale opačná: Qwen3.8 Max odpovídá za 1,82 sekundy, Grok 4.6 až za 40,24 sekundy.

Který model je levnější, Grok 4.6 nebo Qwen3.8 Max?

Cena za milion tokenů je u obou modelů shodná · 3 USD u Groku 4.6 i u Qwen3.8 Max, poměr cen je tedy 1×. Rozhodnutí mezi modely tak nezávisí na nákladech, ale na tom, jaký typ výkonu firma potřebuje · rychlost generování, dobu do prvního tokenu nebo přesnost ve vědeckých testech.

Který model je lepší pro vědecké benchmarky?

Pro vědecké otázky doktorandské úrovně je relevantní benchmark GPQA Diamond, kde Grok 4.6 dosahuje 94,9 procenta a Qwen3.8 Max 92,7 procenta · jde o největší náskok Groku v celém srovnání, 2,2 procentního bodu. V testu HLE, který pokrývá expertní otázky napříč obory, je naopak nepatrně vpředu Qwen3.8 Max s 43 procenty proti 42,9 procenta u Groku.

ZDROJE DAT A METODIKA

Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 19. srpna 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.