Srpen 2026 přinesl dva nové modely téměř současně: xAI vydala Grok 4.6, Z AI o dva dny později GLM-5.3. Oba cílí na podobné publikum · vývojáře, výzkumníky a firmy nasazující autonomní agenty. Toto srovnání vychází z benchmarkových dat institutu CIAD: souhrnných indexů inteligence a kódování, provozních metrik ceny a rychlosti a čtyř hloubkových testů zaměřených na expertní znalosti, vědecké úlohy, programování algoritmů a práci s dlouhým kontextem.
Souhrnné indexy: inteligence, kódování.
Hloubkové benchmarky: HLE, GPQA Diamond, SciCode, LCR.
Duel v kontextu celého pole: cena (log) vs. Intelligence Index.
Souhrnné indexy ukazují těsný, ale jasný náskok
Podle souhrnného indexu inteligence dosahuje Grok 4.6 hodnoty 60,9 bodu, GLM-5.3 hodnoty 59,5 bodu · rozdíl činí 1,4 bodu ve prospěch Grok 4.6. Podobně v kódování vede Grok 4.6 s 76,8 proti 74,8 bodu u GLM-5.3. Na první pohled jde o těsný odstup, ale u obou souhrnných metrik drží navrch stejný model.
Obraz se ale otáčí u provozních čísel. GLM-5.3 zpracovává 80,4 tokenu za sekundu, Grok 4.6 jen 70,3 tokenu za sekundu · poměr rychlostí činí 1,1×, tedy nejde o dramatický rozdíl. Zásadně jiná je ale doba do prvního tokenu (TTFT): GLM-5.3 začíná odpovídat po 1,53 sekundy, zatímco Grok 4.6 potřebuje 40,24 sekundy. Jde o rozdíl řádově jiného charakteru než u samotné propustnosti a pro interaktivní použití má mnohem větší praktický dopad než rozdíl v tokenech za sekundu.
Cenově je GLM-5.3 levnější · 2,15 USD za milion tokenů proti 3 USD u Grok 4.6, poměr cen činí 1,4×. Kdo tedy „vede“, závisí na tom, zda firma poměřuje kvalitu odpovědí, nebo náklady a odezvu provozu.
Co hloubkové benchmarky znamenají pro praxi
HLE (Humanity’s Last Exam) testuje expertní otázky napříč obory a je relevantní pro vědeckou a znalostní práci, kde je potřeba přesná odpověď na úzce specializovaný dotaz. Zde je odstup minimální: Grok 4.6 dosahuje 42,9 procenta, GLM-5.3 42,3 procenta. GPQA Diamond měří vědecké otázky doktorandské úrovně a ukazuje jasnější rozdíl · Grok 4.6 skóruje 94,9 procenta proti 91,7 procenta u GLM-5.3, což je podle přepočtu institutu největší náskok Grok 4.6 napříč hloubkovými testy, 3,2 procentního bodu. Pro nasazení ve výzkumu a odborném poradenství je to relevantní signál.
SciCode testuje programování vědeckých algoritmů a je klíčové pro autonomní agenty a terminálovou práci. Zde se karta obrací · GLM-5.3 dosahuje 56,5 procenta proti 53,6 procenta u Grok 4.6, což je největší náskok GLM-5.3 v hloubkových testech, 2,9 procentního bodu. Podle mediálního monitoringu Z AI vydala GLM-5.3 čtrnáctého srpna 2026 jako model postavený na nezměněném základu GLM-5.2, přičemž veškeré zlepšení pochází z rozšířeného post-tréninku zaměřeného na dlouhodobé úlohy a terminálové prostředí · to koresponduje s tím, že model vede právě v disciplíně blízké skutečné programátorské práci, nikoli v souhrnném indexu kódování.
LCR měří porozumění dlouhému kontextu a je relevantní pro práci s rozsáhlými dokumenty a smlouvami. Zde je odstup těsný: GLM-5.3 dosahuje 76,3 procenta, Grok 4.6 75 procent. Podle mediálního monitoringu xAI uvádí u Grok 4.6 kontextové okno o rozsahu 500 tisíc tokenů a nový režim uvažování „xhigh“ · rozdíl v LCR ale tuto výbavu v číslech nepotvrzuje, jde spíše o vyrovnaný souboj.
Jaké nasazení dává smysl kde
Pro organizace, které potřebují expertní odpovědi ve vědě, výzkumu nebo odborném poradenství, mluví data ve prospěch Grok 4.6 · vede v GPQA Diamond i v souhrnném indexu inteligence a kódování. Cena 3 USD za milion tokenů a čekání 40,24 sekundy na první token jsou ale reálnou daní za tuto kvalitu a je třeba je zohlednit u úloh vyžadujících rychlou interakci.
Pro nasazení autonomních agentů, terminálových úloh a dlouhodobě běžících pracovních postupů dává smysl GLM-5.3: nižší cena 2,15 USD za milion tokenů, vyšší propustnost 80,4 tokenu za sekundu, dramaticky kratší čekání na první odpověď 1,53 sekundy a náskok v SciCode i LCR. Podle mediálního monitoringu se to shoduje i s tím, na co Z AI model cíleně trénovala · dlouhodobé úlohy a terminálové prostředí. Volba tak není otázkou obecně „lepšího“ modelu, ale shody mezi typem úlohy a tím, kde konkrétní model v datech skutečně vede.
Časté dotazy
Který model je levnější, Grok 4.6 nebo GLM-5.3?
Levnější je GLM-5.3 s cenou 2,15 USD za milion tokenů, zatímco Grok 4.6 stojí 3 USD za milion tokenů. Poměr cen mezi dražším a levnějším modelem činí 1,4×. Pro provoz s vysokým objemem dotazů je tak GLM-5.3 nákladově výhodnější volbou.
Který model odpovídá rychleji, Grok 4.6 nebo GLM-5.3?
Podle propustnosti je rychlejší GLM-5.3 s 80,4 tokenu za sekundu proti 70,3 tokenu u Grok 4.6, poměr rychlostí činí 1,1×. Ještě výraznější je rozdíl v čase do prvního tokenu: GLM-5.3 odpovídá po 1,53 sekundy, Grok 4.6 až po 40,24 sekundy.
Který model má vyšší inteligenci podle benchmarků?
Vyšší souhrnný index inteligence má Grok 4.6 s 60,9 bodu proti 59,5 bodu u GLM-5.3, rozdíl činí 1,4 bodu. Grok 4.6 vede i v kódování (76,8 proti 74,8) a v GPQA Diamond (94,9 procenta proti 91,7 procenta), zatímco GLM-5.3 má navrch v SciCode a LCR.
ZDROJE DAT A METODIKA
Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 19. srpna 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.