V září 2026 čelí firmy nasazující jazykové modely otázce, zda upřednostnit rychlost odezvy, nebo kvalitu výstupu. Tabulka srovnává dvanáct modelů od firem Google, OpenAI, Meta, Z AI, Anthropic, xAI, Alibaba a Kimi podle tří metrik: mediánu tokenů za sekundu, mediánu TTFT a indexu inteligence. Data ukazují širokou škálu hodnot, od modelu Gemini 3.7 Flash s 307,1 tokeny za sekundu po modely s podstatně nižším průtokem, a rozpětí latence TTFT od 1,41 do 244,37 sekundy.
Medián tokenů za sekundu.
Kdo v tabulce vede rychlostí, kdo zaostává
Podle mediánu tokenů za sekundu vede v tabulce Gemini 3.7 Flash s hodnotou 307,1, následuje GPT-5.6 Terra s 105,7 tokeny za sekundu a Muse Spark 1.2 se 77,3 tokeny za sekundu. Za nimi následují GPT-5.6 Sol s 76,7, GLM-5.3 s 73,4 a Claude Fable 5.1 s 67,6 tokeny za sekundu. Na opačném konci tabulky se pohybují Qwen3.8 2.4T A95B, Qwen3.8 Max a Kimi K3, každý s hodnotou 39,5 tokenu za sekundu.
Rozpětí TTFT v tabulce činí 1,41 až 244,37 sekundy. Nejnižší uvedenou hodnotu 1,41 sekundy má Qwen3.8 Max, naopak nejvyšší hodnotu 244,37 sekundy vykazuje Claude Fable 5.1. Tentýž model má zároveň index inteligence 65,7, tedy hodnotu uvedenou v tabulce vedle jeho výrazně vyšší latence prvního tokenu. GLM-5.3, GLM-5.3-Flash a Qwen3.8 Max mají naopak TTFT pod dvěma sekundami: 1,45, 1,43 a 1,41 sekundy.
Zajímavé je postavení modelu Gemini 3.7 Flash: model s nejvyšším průtokem tokenů má TTFT 7 sekund, tedy hodnotu ležící mezi krajními hodnotami uvedenými v tabulce. GPT-5.6 Terra a GPT-5.6 Sol mají naopak TTFT 94,25 a 101,03 sekundy, což ukazuje, že vysoký nebo střední průtok tokenů a nízká latence prvního tokenu se v tabulce nevyvíjejí souběžně.
Co rychlost neříká o kvalitě modelu
Metrika TTFT popisuje, jak dlouho uživatel čeká na první znak odpovědi, a pro konverzační nasazení, jako je chatbot v zákaznické podpoře, bývá klíčovější ukazatel než celkový průtok tokenů. Model Qwen3.8 Max s TTFT 1,41 sekundy dokáže začít odpovídat prakticky okamžitě, zatímco Claude Fable 5.1 s TTFT 244,37 sekundy představuje čekání, které by v interaktivním rozhraní bylo patrné. U dávkového zpracování velkého množství textu, kde uživatel nečeká na první znak, ale na dokončení celé úlohy, hraje naopak roli spíše medián tokenů za sekundu, tedy metrika, ve které vede Gemini 3.7 Flash s hodnotou 307,1.
Index inteligence uvedený v tabulce nabývá u jednotlivých modelů různých hodnot: Claude Opus 5 dosahuje 63,1 při 48,4 tokenech za sekundu, GPT-5.6 Sol dosahuje 60,9 při 76,7 tokenech za sekundu a Gemini 3.7 Flash má index inteligence 56 při 307,1 tokenech za sekundu. Tabulka tak nedává důvod spojovat vysokou rychlost s vysokou hodnotou indexu inteligence ani naopak.
Čísla v tabulce jsou mediánové hodnoty naměřené za definovaných podmínek a reálný provoz s vlastními prompty, délkou kontextu nebo zatížením infrastruktury API se od tohoto měření může lišit. Medián navíc popisuje typickou hodnotu, nikoli chování v každém jednotlivém dotazu, což je při interpretaci potřeba mít na paměti.
Jak vybrat model podle typu nasazení
Pro firmy budující chatbota nebo AI agenta s interaktivní odezvou je z tabulky relevantní zejména TTFT: modely jako GLM-5.3 s TTFT 1,45 sekundy, GLM-5.3-Flash s 1,43 sekundy nebo Qwen3.8 Max s 1,41 sekundy nabízejí prakticky okamžitou první odpověď, což se v rozhraní projeví jako plynulá konverzace i při nižším celkovém průtoku tokenů.
Pro dávkové zpracování, sumarizaci velkých dokumentů nebo hromadné generování obsahu je naopak důležitější medián tokenů za sekundu, kde v tabulce vede Gemini 3.7 Flash s hodnotou 307,1. Volba pouze podle indexu inteligence, jako je hodnota 65,7 u Claude Fable 5.1, může znamenat kompromis v podobě TTFT 244,37 sekundy, který se pro interaktivní nasazení nemusí vyplatit.
Časté dotazy
Který AI model je v tabulce nejrychlejší podle tokenů za sekundu?
Podle mediánu tokenů za sekundu vede v tabulce Gemini 3.7 Flash s hodnotou 307,1 tokenů za sekundu od firmy Google. Druhý v pořadí je GPT-5.6 Terra od OpenAI se 105,7 tokeny za sekundu. Poměr nejrychlejšího a nejpomalejšího modelu v tabulce činí přibližně 7,8×.
Co znamená TTFT a proč je tato metrika důležitá?
TTFT označuje medián doby do prvního tokenu odpovědi. V tabulce se tato hodnota pohybuje od 1,41 do 244,37 sekundy. Nejnižší TTFT 1,41 sekundy má Qwen3.8 Max, nejvyšší 244,37 sekundy Claude Fable 5.1. Pro chatboty a interaktivní aplikace jde o klíčový ukazatel plynulosti konverzace.
Souvisí rychlost modelu s jeho indexem inteligence?
Podle uvedených dat nikoli jednoznačně. Gemini 3.7 Flash má nejvyšší rychlost 307,1 tokenů za sekundu a index inteligence 56, zatímco Claude Fable 5.1 s nižší rychlostí 67,6 tokenů za sekundu dosahuje indexu inteligence 65,7. Rychlost a index inteligence se v tabulce vyvíjejí nezávisle na sobě.
ZDROJE DAT A METODIKA
Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 2. září 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.