Srovnání dvanácti modelů z srpna 2026 mapuje rychlost generování tokenů a čas k prvnímu tokenu proti indexu inteligence. Data ukazují, jak se liší profily modelů od Google, OpenAI, Anthropic, Alibaby, Meta a dalších pro nasazení v chatbotech, agentech a dávkovém zpracování.
Medián tokenů za sekundu.
Co data ukazují o rychlosti modelů
V průtoku tokenů vede Gemini 3.5 Flash s hodnotou 267,8 tokenů/s, těsně následuje Gemini 3.6 Flash s 230,4 tokenů/s a třetí je Qwen3.7 Max s 204,1 tokenů/s. Naopak konec tabulky tvoří Kimi K3 s 34,5 tokenů/s, před ním Grok 4.5 s 55,6 tokenů/s a Claude Opus 5 s 59,1 tokenů/s. V latenci TTFT je nejlepší GLM-5.2 s 0,96 s, za ním MiniMax-M3 s 1,38 s a Qwen3.7 Max s 1,49 s. Nejhorší latenci mají GPT-5.6 Terra s 82,52 s a GPT-5.6 Sol s 60,18 s. Index inteligence vede Claude Opus 5 s 60,7, následuje Claude Fable 5 s 59,9 a GPT-5.6 Sol s 58,9. Překvapivě Muse Spark 1.1 dosahuje 50,6 při průtoku 172,2 tokenů/s a TTFT 2,46 s.
Kritická interpretace kompromisů
Čísla odhalují jasný trade-off: modely s nejvyšším indexem inteligence (Claude Opus 5, Claude Fable 5, GPT-5.6 Sol) nabízejí průtok řádově nižší a latenci řádově vyšší než rychlé modely Gemini Flash nebo GLM-5.2. Rozsah TTFT 0,96 až 82,52 s znamená, že u pomalých modelů čeká uživatel přes minutu na první token, což v interaktivním chatu ničí uživatelský zážitek. Pro dávkové zpracování je rozhodující průtok, kde Gemini 3.5 Flash překonává nejpomalejší model 7,8×. Laboratorní benchmarky neřeší variabilitu za reálného zatížení ani náklady na infrastrukturu.
Co z toho plyne pro praxi
Pro české firmy nasazující chatboty je klíčové TTFT: GLM-5.2, MiniMax-M3 a Qwen3.7 Max nabízejí odezvu pod dvě sekundy při přijatelné inteligenci. Agenti vyžadující dlouhé kontexty a rychlou generaci těží z průtoku Gemini 3.5 Flash nebo Muse Spark 1.1. Dávkové úlohy offline preferují maximální průtok bez ohledu na latenci. Volba modelu by měla respektovat, že vysoká inteligence (Claude Opus 5 60,7) stojí latencí 34,11 s a průtokem 59,1 tokenů/s.
Časté dotazy
Který model má nejnižší latenci TTFT?
Nejnižší latenci TTFT dosahuje GLM-5.2 s hodnotou 0,96 s, následovaný MiniMax-M3 s 1,38 s a Qwen3.7 Max s 1,49 s podle měření ze srpna 2026.
Jak velký je rozdíl v průtoku mezi nejrychlejším a nejpomalejším modelem?
Rozdíl v průtoku tokenů mezi nejrychlejším modelem Gemini 3.5 Flash a nejpomalejším Kimi K3 činí 7,8× podle předpočítaného poměru v datech.
Který model nabízí nejlepší rovnováhu mezi rychlostí a inteligencí?
Muse Spark 1.1 dosahuje indexu inteligence 50,6 při průtoku 172,2 tokenů/s a TTFT 2,46 s, což podle tabulky představuje silnou rovnováhu obou ukazatelů.
ZDROJE DAT A METODIKA
Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 3. srpna 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.