Jak modely vidí text prostřednictvím tokenů

Umělé inteligence nerozumí celým slovům ani větám tak, jak je vnímáme my lidé, ale pracují s čísly reprezentujícími malé úseky textu nazývané tokeny. Před tím, než model text zpracuje, proběhne proces tokenizace, kdy se věta rozdělí na tyto základní stavební kameny, kterými mohou být celá slova, jejich kořeny, předpony nebo dokonce jednotlivé znaky. V angličtině, pro kterou byly většina modelů primárně trénována, tvoří běžné slovo často jeden jediný token, zatímco v češtině dochází k častějšímu štěpení kvůli složitější gramatice a skloňování.

Uživatelé služeb, jako jsou ChatGPT nebo další API rozhraní, platí za každý token, který model přečte ve vstupní zprávě a který sám vygeneruje v odpovědi. Cena AI API se tedy odvíjí od objemu dat, nikoliv od počtu otázek nebo času stráveného čekáním na výsledek. Pokud zadáte dlouhý dokument ke shrnutí, zaplatíte za tokeny obsažené v původním textu i za tokeny ve výsledném výtahu.

Rozdíly v ceně mezi češtinou a angličtinou

Čeština je pro velké jazykové modely výpočetně náročnější na reprezentaci než angličtina, což přímo ovlivňuje výslednou fakturu za použití AI. Díky bohaté morfologii, která umožňuje měnit koncovky slov podle pádů, rodů a čísel, musí tokenizátor česká slova často rozkládat na větší počet menších částí. Slovo jako „nezodpovědnost“ může být v angličtině zpracováno jako jeden či dva tokeny, zatímco v češtině se může rozpadnout na tři nebo čtyři samostatné jednotky (např. „ne“, „zodpově“, „dn“, „ost“).

Tento rozdíl znamená, že pro vyjádření stejného myšlenkového obsahu spotřebuje český text o 20 až 40 % více tokenů než ekvivalentní text anglický. V praxi to vypadá tak, že za stejnou informační hodnotu zaplatíte v češtině více, protože model musí zpracovat větší množství číselných vstupů. V auditech CIAD se ukazuje, že firmy působící na českém trhu by měly tento rozdíl zohledňovat při plánování rozpočtů pro nasazení AI asistentů, protože odhad ceny založený pouze na počtu slov může být nepřesný.

Praktický dopad na kontextové okno a náklady

Každý model má určené maximální kontextové okno, které udává, kolik tokenů si může pamatovat v rámci jedné konverzace. Protože čeština zabírá více tokenů, do stejného kontextového okna se vejde méně českého textu než anglického. Pokud máte model s kapacitou 128 000 tokenů, vložením rozsáhlé české právní směrnice rychleji naplníte jeho paměť než při práci s anglickým ekvivalentem, což může vést k tomu, že model dřívě začne zapomínat úvodní části konverzace.

Pro optimalizaci nákladů je vhodné formulovat dotazy stručně a vyhýbat se zbytečnému opakování informací, které model již zná. Při práci s dlouhými dokumenty v češtině se vyplatí nejprve text předzpracovat nebo rozdělit na menší části, aby se předešlo překročení limitů a zbytečnému nárůstu ceny za zpracování vstupních dat.

Co to znamená: Při používání AI v češtině počítejte s vyšší spotřebou tokenů než u angličtiny, což přímo zvyšuje cenu za API volání a zmenšuje efektivní velikost paměti modelu pro vaše dokumenty.

Časté dotazy

Kolik slov v češtině odpovídá jednomu tokenu?

V češtině připadá přibližně 1,5 až 2 tokeny na jedno průměrné slovo, což je více než v angličtině. Přesný poměr závisí na délce slov a jejich gramatické formě, ale obecně platí, že český text bude mít vyšší počet tokenů než stejný text přeložený do angličtiny.

Platí se i za tokeny v mé otázce nebo jen za odpověď AI?

Poplatek se vztahuje na všechny tokeny, které model zpracuje, tedy jak na vstupní text vaší otázky, tak na generovanou odpověď. Celková cena za jedno volání API je součtem nákladů za přečtení vašeho promptu a za vytvoření výstupu modelem.

Proč je čeština dražší na zpracování umělou inteligencí?

Čeština je dražší, protože její složitá gramatika nutí tokenizátor rozdělovat slova na více menších částí než u analytických jazyků, jako je angličtina. Vyšší počet tokenů znamená více výpočetních operací, které poskytovatelé služeb účtují podle objemu zpracovaných dat.