Září 2026 přináší přímý duel dvou modelů, které reprezentují odlišné filozofie nasazení. Claude Fable 5.1 od Anthropic a Kimi K3 od Kimi se měří na shodných benchmarcích: souhrnný index inteligence, kódování, cena za milion tokenů, propustnost v tokenech za sekundu a čas k prvnímu tokenu. Doplňují je čtyři hloubkové testy zaměřené na expertní otázky, vědecké úlohy, algoritmické programování a dlouhý kontext. Data pocházejí z jednotné srovnávací tabulky, která umožňuje čisté porovnání bez marketingu.

Svislé sloupce: souhrnné indexy (inteligence, kódování) modelů Claude Fable 5.1 a Kimi K3 Souhrnné indexy: inteligence, kódování.

Svislé sloupce: úspěšnost modelů Claude Fable 5.1 a Kimi K3 v jednotlivých hloubkových benchmarcích Hloubkové benchmarky: HLE, GPQA Diamond, SciCode, LCR.

Bodový graf ceny proti inteligenci se zvýrazněnými modely Claude Fable 5.1 a Kimi K3 Duel v kontextu celého pole: cena (log) vs. Intelligence Index.

Co ukazují souhrnné indexy a hloubkové benchmarky

Claude Fable 5.1 dosahuje indexu inteligence 53,4 a skóre kódování 81,6, zatímco Kimi K3 dosahuje 43,8 a 76,2. Rozdíl indexu inteligence činí 9,6 bodu podle předpočítané hodnoty. Cena za milion tokenů se liší podstatně: 20 USD u Clauda proti 6 USD u Kimimu, což odpovídá poměru cen 3,3×. Propustnost tokenů za sekundu ukazuje 69,7 u Clauda a 37,1 u Kimimu, poměr rychlostí je 1,9×. Čas k prvnímu tokenu je u Clauda 130,97 sekundy, u Kimimu 3,46 sekundy.

Ve hloubkových benchmarcích Claude Fable 5.1 vede v HLE s 59,1 proti 46,9, což je největší náskok 12,2 procentního bodu. V GPQA Diamond jsou výsledky těsné: 93,7 proti 93,5. SciCode ukazuje 63,1 proti 59,5. Překvapivě Kimi K3 vede v LCR s 88,7 proti 85,3, největší náskok Kimimu 3,3 procentního bodu. To naznačuje, že levnější model lépe zvládá dlouhé dokumenty.

Kritická interpretace pro reálný provoz

Vysoký index inteligence a kódování Clauda Fable 5.1 odpovídá očekáváním u modelu pozicovaného jako prémiový. Nicméně TTFT 130,97 sekundy znamená, že interaktivní práce v terminálu nebo chatové rozhraní bude trpět výraznými zpožděními před prvním výstupem. Kimi K3 s TTFT 3,46 sekundy nabízí o řád rychlejší odezvu, což pro autonomní agenty a iterativní kódování hraje klíčovou roli. Propustnost 69,7 tokenů za sekundu Clauda je výhodná pro dávkové zpracování, kde se čas k prvnímu tokenu neprojeví.

Těsné skóre v GPQA Diamond 93,7 a 93,5 naznačuje, že pro vědecké otázky doktorandské úrovně oba modely dosahují podobné spolehlivosti. Rozdíl v HLE 59,1 proti 46,9 odráží schopnost syntetizovat znalosti napříč obory, relevantní pro výzkumné úlohy. Vedoucí pozice Kimimu v LCR 88,7 proti 85,3 je pro práci s dlouhými dokumenty a rozsáhlými codebazy rozhodující. Laboratorní benchmarky neukazují náklady na kontextové okno ani chování při reálném provozu s rušením.

Doporučení pro české organizace

Pro české firmy nasazující modely do produkce platí: pokud jde o vědecký výzkum, složité analýzy napříč obory a kvalitu kódu při menší citlivosti na latenci, Claude Fable 5.1 opodstatňuje svou cenu 20 USD za milion tokenů. Pokud dominují úlohy s dlouhými dokumenty, rychlá iterace v terminálu, autonomní agenti s nízkou latencí a omezený rozpočet, Kimi K3 za 6 USD za milion tokenů nabízí lepší poměr výkonu k nákladům. Hybridní strategie · Claude pro složité úkoly, Kimi pro objemové a latence-kritické · se jeví nejpragmatičtější.

Rozhodování by nemělo vycházet z jednoho indexu. Kombinace HLE, LCR a TTFT dává přesnější obraz než souhrnné skóre. Sledování aktualizací obou tvůrců v následujících týdnech může rovnováhu posunout, proto doporučujeme pilotní nasazení obou modelů na reprezentativních datech před plným zavedením.

Časté dotazy

Který model je pro vědecký výzkum vhodnější podle benchmarků?

Claude Fable 5.1 vede v HLE 59,1 proti 46,9 a v SciCode 63,1 proti 59,5, v GPQA Diamond jsou shodné 93,7 a 93,5. Pro syntézu napříč obory a algoritmické programování je Claude silnější, pro čistě vědecké otázky oba vyhovují.

Jak se liší náklady a rychlost odezvy při nasazení do produkce?

Claude Fable 5.1 stojí 20 USD za milion tokenů, Kimi K3 6 USD. Propustnost Clauda je 69,7 tokenů za sekundu, Kimimu 37,1. Čas k prvnímu tokenu u Clauda 130,97 sekundy, u Kimimu 3,46 sekundy. Pro dávky je Claude rychlejší, pro interakci Kimi.

Který model lépe zvládá dlouhé dokumenty a rozsáhlé codebazy?

Kimi K3 dosahuje v LCR 88,7, Claude Fable 5.1 85,3. Rozdíl 3,3 procentního bodu je největší náskok Kimimu. Pro úlohy vyžadující porozumění dlouhému kontextu je Kimi K3 podle tohoto benchmarku výhodnější.

ZDROJE DAT A METODIKA

Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 15. září 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.