V září dvašestadvacátého porovnáváme dva modely, které definují současnou hranici dostupné inteligence: GPT-6 Astra od OpenAI a Kimi K3 od Kimi. Data pocházejí z jednotné sady měření pokrývající celkový index inteligence, kódování, cenu za milion tokenů, rychlost generování v tokenech za sekundu a čas k prvnímu tokenu. Doplňují je čtyři hloubkové benchmarky zaměřené na expertní otázky, vědecké úlohy, programování algoritmů a dlouhý kontext. Kontext z tisku ukazuje, že OpenAI v týdnu vydání Astrý řešilo incidenty s autonomními agenty a soudní spory.
Souhrnné indexy: inteligence, kódování.
Hloubkové benchmarky: HLE, GPQA Diamond, SciCode, LCR.
Duel v kontextu celého pole: cena (log) vs. Intelligence Index.
Co ukazují souhrnné indexy a hloubkové benchmarky
GPT-6 Astra dosahuje indexu inteligence 54,7 bodů, Kimi K3 50,2 bodů, rozdíl činí 4,5 bodu podle předpočítané hodnoty. V kódování vede GPT-6 Astra se 76,9 bodů před Kimi K3 se 76,2 body. Cena za milion tokenů u GPT-6 Astra je 20 dolarů, u Kimi K3 6 dolarů, poměr cen dle předpočítané hodnoty 3,3×. Rychlost generování GPT-6 Astra 61,3 tokenů za sekundu, Kimi K3 38,9 tokenů za sekundu, poměr rychlostí 1,6×. TTFT GPT-6 Astra 184,63 sekundy, Kimi K3 2,99 sekundy.
V hloubkových benchmarcích GPT-6 Astra vede v HLE s 54,7 % úspěšnosti oproti 46,9 % Kimi K3, největší náskok 7,8 procentního bodu. V GPQA Diamond GPT-6 Astra 96,1 %, Kimi K3 93,5 %. Kimi K3 vede v SciCode s 59,5 % proti 56,5 % a v LCR s 88,7 % proti 80,7 %, největší náskok 8 procentních bodů. HLE měří expertní otázky napříč obory, relevantní pro vědu a výzkum. GPQA Diamond testuje vědecké otázky doktorandské úrovně, klíčové pro hlubokou analýzu. SciCode posuzuje programování vědeckých algoritmů, důležité pro práci v terminálu a vývoj. LCR testuje porozumění dlouhému kontextu, kritické pro zpracování rozsáhlých dokumentů a dodržování zadání.
Kritická interpretace čísel pro reálný provoz
Vysoký index inteligence GPT-6 Astra a vítězství v HLE a GPQA Diamond naznačují silnější úvahu při složitých vědeckých a analytických úlohách. Nicméně TTFT 184,63 sekundy znamená, že každý dotaz trvá minuty než model začne generovat, což vylučuje interaktivní práci, chatová rozhraní a autonomní agenty vyžadující rychlou odezvu. Kimi K3 s TTFT 2,99 sekundy a cenou 6 dolarů za milion tokenů nabízí pro tyto scénáře praktičtější poměr výkonu a nákladů.
Výhra Kimi K3 v LCR s 88,7 % ukazuje lepší schopnost udržet kontext při dlouhých dokumentech, což pro právní, regulační a výzkumné texty váží více než marginální náskok v GPQA Diamond. SciCode 59,5 % Kimi K3 proti 56,5 % GPT-6 Astra naznačuje, že pro programování vědeckých algoritmů a práci v terminálu není dražší model automaticky lepší. Laboratorní benchmarky neodrážejí bezpečnostní incidenty: podle mediálního monitoringu OpenAI v září dvašestadvacátého potvrdilo incident s agenty na německém wikiu a čelí soudním sporům s vydavateli novin.
Praktický závěr pro české organizace
Pro české firmy a organizace platí: pokud je prioritou maximální kvalita úvahy u expertních otázek a vědeckých úloh a cena i latence nejsou limitující, GPT-6 Astra s indexem 54,7 a GPQA Diamond 96,1 % dává smysl. Pokud je důležitá rychlá odezva, nízká cena, práce s dlouhými dokumenty a programování algoritmů, Kimi K3 s TTFT 2,99 sekundy, cenou 6 dolarů, LCR 88,7 % a SciCode 59,5 % je racionálnější volba. Univerzální vítěz data nepodporují.
Rozhodování by mělo zohlednit i bezpečnostní kontext: podle agenturních zpráv OpenAI v první týdnu září dvašestadvacátého neinformovalo o incidentu s agenty, což pro regulované sektory může být rozhodující argument proti nasazení Astrý do autonomních systémů bez dodatečných kontrol.
Časté dotazy
Který model je pro vědecký výzkum lepší?
GPT-6 Astra vede v GPQA Diamond s 96,1 % a v HLE s 54,7 %, což jsou benchmarky pro vědecké otázky doktorandské úrovně a expertní otázky napříč obory. Kimi K3 dosahuje 93,5 % v GPQA Diamond a 46,9 % v HLE. Pro hlubokou analytickou práci je GPT-6 Astra silnější.
Vyplatí se platit 3,3× více za GPT-6 Astra?
Záleží na úloze. GPT-6 Astra stojí 20 dolarů za milion tokenů, Kimi K3 6 dolarů. GPT-6 Astra nabízí vyšší index inteligence 54,7 proti 50,2 a rychlejší generování 61,3 tokenů za sekundu proti 38,9. Ale TTFT 184,63 sekundy proti 2,99 sekundám Kimi K3 znevýhodňuje Astrý v interaktivním nasazení.
Který model lépe zvládá dlouhé dokumenty a kódování?
Kimi K3 vede v LCR s 88,7 % proti 80,7 % GPT-6 Astra, tedy v porozumění dlouhému kontextu. V SciCode pro programování vědeckých algoritmů Kimi K3 dosahuje 59,5 %, GPT-6 Astra 56,5 %. V celkovém kódování GPT-6 Astra 76,9 bodů, Kimi K3 76,2 body, tedy těsný odstup.
ZDROJE DAT A METODIKA
Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 6. září 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.