V září dvašestadvacátého porovnáváme dva modely, které definují současnou hranici dostupné inteligence: GPT-6 Astra od OpenAI a Kimi K3 od Kimi. Data pocházejí z jednotné sady měření pokrývající celkový index inteligence, kódování, cenu za milion tokenů, rychlost generování v tokenech za sekundu a čas k prvnímu tokenu. Doplňují je čtyři hloubkové benchmarky zaměřené na expertní otázky, vědecké úlohy, programování algoritmů a dlouhý kontext. Kontext z tisku ukazuje, že OpenAI v týdnu vydání Astrý řešilo incidenty s autonomními agenty a soudní spory.

Svislé sloupce: souhrnné indexy (inteligence, kódování) modelů GPT-6 Astra a Kimi K3 Souhrnné indexy: inteligence, kódování.

Svislé sloupce: úspěšnost modelů GPT-6 Astra a Kimi K3 v jednotlivých hloubkových benchmarcích Hloubkové benchmarky: HLE, GPQA Diamond, SciCode, LCR.

Bodový graf ceny proti inteligenci se zvýrazněnými modely GPT-6 Astra a Kimi K3 Duel v kontextu celého pole: cena (log) vs. Intelligence Index.

Co ukazují souhrnné indexy a hloubkové benchmarky

GPT-6 Astra dosahuje indexu inteligence 54,7 bodů, Kimi K3 50,2 bodů, rozdíl činí 4,5 bodu podle předpočítané hodnoty. V kódování vede GPT-6 Astra se 76,9 bodů před Kimi K3 se 76,2 body. Cena za milion tokenů u GPT-6 Astra je 20 dolarů, u Kimi K3 6 dolarů, poměr cen dle předpočítané hodnoty 3,3×. Rychlost generování GPT-6 Astra 61,3 tokenů za sekundu, Kimi K3 38,9 tokenů za sekundu, poměr rychlostí 1,6×. TTFT GPT-6 Astra 184,63 sekundy, Kimi K3 2,99 sekundy.

V hloubkových benchmarcích GPT-6 Astra vede v HLE s 54,7 % úspěšnosti oproti 46,9 % Kimi K3, největší náskok 7,8 procentního bodu. V GPQA Diamond GPT-6 Astra 96,1 %, Kimi K3 93,5 %. Kimi K3 vede v SciCode s 59,5 % proti 56,5 % a v LCR s 88,7 % proti 80,7 %, největší náskok 8 procentních bodů. HLE měří expertní otázky napříč obory, relevantní pro vědu a výzkum. GPQA Diamond testuje vědecké otázky doktorandské úrovně, klíčové pro hlubokou analýzu. SciCode posuzuje programování vědeckých algoritmů, důležité pro práci v terminálu a vývoj. LCR testuje porozumění dlouhému kontextu, kritické pro zpracování rozsáhlých dokumentů a dodržování zadání.

Kritická interpretace čísel pro reálný provoz

Vysoký index inteligence GPT-6 Astra a vítězství v HLE a GPQA Diamond naznačují silnější úvahu při složitých vědeckých a analytických úlohách. Nicméně TTFT 184,63 sekundy znamená, že každý dotaz trvá minuty než model začne generovat, což vylučuje interaktivní práci, chatová rozhraní a autonomní agenty vyžadující rychlou odezvu. Kimi K3 s TTFT 2,99 sekundy a cenou 6 dolarů za milion tokenů nabízí pro tyto scénáře praktičtější poměr výkonu a nákladů.

Výhra Kimi K3 v LCR s 88,7 % ukazuje lepší schopnost udržet kontext při dlouhých dokumentech, což pro právní, regulační a výzkumné texty váží více než marginální náskok v GPQA Diamond. SciCode 59,5 % Kimi K3 proti 56,5 % GPT-6 Astra naznačuje, že pro programování vědeckých algoritmů a práci v terminálu není dražší model automaticky lepší. Laboratorní benchmarky neodrážejí bezpečnostní incidenty: podle mediálního monitoringu OpenAI v září dvašestadvacátého potvrdilo incident s agenty na německém wikiu a čelí soudním sporům s vydavateli novin.

Praktický závěr pro české organizace

Pro české firmy a organizace platí: pokud je prioritou maximální kvalita úvahy u expertních otázek a vědeckých úloh a cena i latence nejsou limitující, GPT-6 Astra s indexem 54,7 a GPQA Diamond 96,1 % dává smysl. Pokud je důležitá rychlá odezva, nízká cena, práce s dlouhými dokumenty a programování algoritmů, Kimi K3 s TTFT 2,99 sekundy, cenou 6 dolarů, LCR 88,7 % a SciCode 59,5 % je racionálnější volba. Univerzální vítěz data nepodporují.

Rozhodování by mělo zohlednit i bezpečnostní kontext: podle agenturních zpráv OpenAI v první týdnu září dvašestadvacátého neinformovalo o incidentu s agenty, což pro regulované sektory může být rozhodující argument proti nasazení Astrý do autonomních systémů bez dodatečných kontrol.

Časté dotazy

Který model je pro vědecký výzkum lepší?

GPT-6 Astra vede v GPQA Diamond s 96,1 % a v HLE s 54,7 %, což jsou benchmarky pro vědecké otázky doktorandské úrovně a expertní otázky napříč obory. Kimi K3 dosahuje 93,5 % v GPQA Diamond a 46,9 % v HLE. Pro hlubokou analytickou práci je GPT-6 Astra silnější.

Vyplatí se platit 3,3× více za GPT-6 Astra?

Záleží na úloze. GPT-6 Astra stojí 20 dolarů za milion tokenů, Kimi K3 6 dolarů. GPT-6 Astra nabízí vyšší index inteligence 54,7 proti 50,2 a rychlejší generování 61,3 tokenů za sekundu proti 38,9. Ale TTFT 184,63 sekundy proti 2,99 sekundám Kimi K3 znevýhodňuje Astrý v interaktivním nasazení.

Který model lépe zvládá dlouhé dokumenty a kódování?

Kimi K3 vede v LCR s 88,7 % proti 80,7 % GPT-6 Astra, tedy v porozumění dlouhému kontextu. V SciCode pro programování vědeckých algoritmů Kimi K3 dosahuje 59,5 %, GPT-6 Astra 56,5 %. V celkovém kódování GPT-6 Astra 76,9 bodů, Kimi K3 76,2 body, tedy těsný odstup.

ZDROJE DAT A METODIKA

Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 6. září 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.