V září 2026 porovnáváme dva vlivné modely, Grok 4.6 od xAI a Kimi K3 od Kimi, na základě souhrných indexů, hloubkových benchmarků a provozních parametrů. Data pokrývají inteligenci, kódování, cenu za milion tokenů, rychlost generování v tocích za sekundu a latenci prvního tokenu, doplněné o čtyři specializované testy. Srovnání reaguje na nedávné nasazení Grok v pentagonním portálu a recenze autonomního agenta Grok Bot.

Svislé sloupce: souhrnné indexy (inteligence, kódování) modelů Grok 4.6 a Kimi K3 Souhrnné indexy: inteligence, kódování.

Svislé sloupce: úspěšnost modelů Grok 4.6 a Kimi K3 v jednotlivých hloubkových benchmarcích Hloubkové benchmarky: HLE, GPQA Diamond, SciCode, LCR.

Bodový graf ceny proti inteligenci se zvýrazněnými modely Grok 4.6 a Kimi K3 Duel v kontextu celého pole: cena (log) vs. Intelligence Index.

Co ukazují souhrná data a benchmarky

V souhrném indexu inteligence vede Grok 4.6 s hodnotou 44,4 bodů před Kimi K3 s 43,8 body, rozdíl činí 0,6 bodu podle předpočítané hodnoty. V indexu kódování Grok 4.6 dosahuje 76,8 bodů, Kimi K3 76,2 bodů. Cena za milion tokenů u Grok 4.6 je 3 USD, u Kimi K3 6 USD, podle předpočítaného poměru je Grok dvakrát levnější. Rychlost generování tokenů u Grok 4.6 činí 67,9 tokenů za sekundu, u Kimi K3 37 tokenů za sekundu, podle předpočítaného poměru je Grok 1,8× rychlejší. Latence prvního tokenu u Grok 4.6 dosahuje 37,39 sekundy, u Kimi K3 2,58 sekundy.

V hloubkových benchmarcích Kimi K3 vede ve třech z čtyř testů. V HLE měřícím expertní otázky napříč obory dosáhl Kimi K3 46,9 procenta, Grok 4.6 42,9 procenta. V GPQA Diamond zaměřeném na vědecké otázky doktorandské úrovně vede Grok 4.6 s 94,9 procenty před Kimi K3 s 93,5 procenty, největší náskok Grok 4.6 činí 1,4 procentního bodu podle předpočítané hodnoty. V SciCode testujícím programování vědeckých algoritmů dosáhl Kimi K3 59,5 procenta, Grok 4.6 56,5 procenta. V LCR měřícím porozumění dlouhému kontextu vede Kimi K3 s 88,7 procenty před Grok 4.6 s 80,3 procenty, největší náskok Kimi K3 činí 8,3 procentního bodu podle předpočítané hodnoty.

Překvapivé je, že Kimi K3 překonává Grok 4.6 ve většině specializovaných testů, i když má niżsí souhrný index inteligence. Grok 4.6 kompenzuje výhodou v ceně, propustnosti a vědeckých otázkách GPQA Diamond.

Kritická interpretace výsledků praxe

Rozdíl 0,6 bodu v indexu inteligence a 1,4 procentního bodu v GPQA Diamond jsou v laboratorních podmínkách těsné a v reálném provozu mohou zapadnout do šumu. Silnější náskok Kimi K3 v LCR o 8,3 procentního bodu signalizuje lepší schopnost pracovat s rozsáhlými dokumenty a dlouhými historiemi konverzace, což je klíčové pro výzkum a analýzu smluv. Vyhrání Kimi K3 v HLE a SciCode naznačuje výhodu při expertním úvahování napříč obory a implementaci vědeckých algoritmů.

Provozní metriky rozkládají karty jinak. Grok 4.6 nabízí dvakrát nižší náklady a téměř dvakrát vyšší propustnost, což ho predestinuje pro dávkové zpracování, generování kódu v CI/CD pipelinech a scenáře, kde na latenci nezáleží. Naopak latence prvního tokenu 37,39 sekundy u Grok 4.6 je pro interaktivní chat, asistence v reálném čase a autonomní agenti s rychlou smyčkou zpětné vazby prakticky nepoužitelná. Kimi K3 s 2,58 sekundy umožňuje plynulou interakci.

Podle mediálního monitoringu byl Grok 4.6 integrován do pentagonního portálu pro nástroje umělé inteligence, což naznačuje důvěru v bezpečnost a dodržování předpisů. Stejný zdroj uvádí, že Grok Bot nabízí programátorskou sílu srovnatelnou s OpenClaw na jiné úrovni abstrakce, což potvrzuje silnou stránku v kódování.

Doporučení pro české nasazení

Pro české firmy a organizace platí: volte Grok 4.6, když řešíte hromadné generování textu nebo kódu, vědecké dotazy typu GPQA Diamond, potřebujete minimalizovat náklady na tokeny a latence desítek sekund nejsou překážkou. Nasazení v pentagonním portálu podle agenturních zpráv podporuje předpoklad splňování přísných bezpečnostních standardů.

Volte Kimi K3 pro interaktivní aplikace, chatové roboty, autonomní agenti vyžadující okamžitou odezvu, práci s dlouhými dokumenty a expertní analýzu napříč obory. Dvakrát vyšší cena za milion tokenů se vrací formou použitelnosti v reálném čase a lepších výsledků v benchmarcích HLE, SciCode a LCR.

Časté dotazy

Který model je levnější na provoz?

Grok 4.6 nabízí cenu 3 USD za milion tokenů, Kimi K3 6 USD, podle předpočítaného poměru je Grok dvakrát levnější, což z něj dělá výhodnější volbu pro hromadné generování a dávkové úlohy.

Jaký model má nižší latenci prvního tokenu?

Kimi K3 dosahuje latenci prvního tokenu 2,58 sekundy, zatímco Grok 4.6 vyžaduje 37,39 sekundy, což Kimi činí vhodnějším pro interaktivní aplikace, chatová rozhraní a agenty v reálném čase.

Který model lépe porozumí dlouhým dokumentům?

V benchmarku LCR měřícím porozumění dlouhému kontextu dosáhl Kimi K3 88,7 procenta, Grok 4.6 80,3 procenta, Kimi vede o 8,3 procentního bodu podle předpočítaného největšího náskoku.

ZDROJE DAT A METODIKA

Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 11. září 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.