V září 2026 existuje dvanáct modelů pro generování obrázků od šesti tvůrců, jejichž pořadí určuje Elo skóre postavené na lidských preferencích. Srovnání zahrnuje modely OpenAI, Microsoft AI, Google, Reve, Alibaba a ByteDance Seed. Data ukazují, kdo aktuálně vede v tom, co se lidem při hlasování líbí víc · což je jiná otázka než to, který model nejpřesněji poslechne zadaný prompt.
Elo z lidských preferencí.
Kdo vede a kdo zaostává v Elo
Na špici žebříčku stojí GPT Image 2 od OpenAI s hodnotou Elo 1 371, následovaný MAI-Image-2.6-Preview od Microsoft AI s 1 349. Třetí místo patří modelu Reve 2.1 od firmy Reve s hodnotou 1 324, těsně před Nano Banana 2 od Googlu s 1 321. Odstup mezi prvním a druhým místem je poměrně malý, mezi druhým a třetím už je odstup výraznější.
Střed pole tvoří shluk modelů s Elo mezi 1 305 a 1 280 · GPT Image 1.5 od OpenAI (1 305), MAI-Image-2.5 od Microsoft AI (1 304), Nano Banana Pro od Googlu (1 296), MAI-Image-2.5-Pro od Microsoft AI (1 291), Nano Banana 2 Lite od Googlu (1 289), Qwen-Image-3.0-Pro od Alibaby (1 283) a Seedream 5.0 Pro od ByteDance Seed (1 280). Tento shluk je natěsnaný, hodnoty se liší jen v jednotkách bodů, což ukazuje na těsný odstup mezi konkurenty spíše než na jasnou hierarchii.
Překvapivé je, že Microsoft AI má hned tři modely v horní polovině žebříčku (MAI-Image-2.6-Preview, MAI-Image-2.5, MAI-Image-2.5-Pro), zatímco Google se třemi svými variantami Nano Banana obsazuje spíše střed pole. Na posledním místě žebříčku je Qwen-Image-3.0 od Alibaby s hodnotou 1 269, což je nejnižší zaznamenaná hodnota v celém srovnání.
Co Elo skóre neříká o kvalitě
Elo z lidských preferencí je v podstatě hlasování o tom, který obrázek se hodnotiteli líbí víc při srovnání dvou variant vedle sebe. Taková metrika je citlivá na estetiku, barevnost, kompozici a celkový „vizuální dojem“ · tedy na vlastnosti, které jsou snadno rozpoznatelné na první pohled. Nic to ale neříká o tom, zda model doslova splnil zadání promptu, správně umístil text do obrázku, dodržel počet objektů nebo respektoval složitější kompoziční instrukce.
Rozdíl mezi vedoucím GPT Image 2 s hodnotou 1 371 a modelem uprostřed žebříčku, například Nano Banana 2 Lite s 1 289, může v praxi znamenat jen to, že hodnotitelé preferovali jinou barevnou paletu nebo styl, nikoli že jeden model je objektivně přesnější nebo použitelnější pro konkrétní firemní zadání. Pro komerční nasazení, kde jde o přesné dodržení brandu, textu na obrázku nebo technických specifikací, může být vysoké Elo skóre zavádějící ukazatel.
Jak s daty pracovat při výběru
Pro české firmy, které řeší výběr modelu pro generování vizuálů, je Elo skóre užitečné jako orientační ukazatel obecné líbivosti výstupů, ale nemělo by být jediným kritériem. Model s nejvyšší hodnotou, GPT Image 2 od OpenAI s 1 371, je vhodným kandidátem pro úlohy, kde záleží především na estetickém dojmu · marketingové vizuály, sociální sítě, ilustrace. Naproti tomu u úloh vyžadujících přesné plnění instrukcí je vhodné otestovat i modely ze středu žebříčku, protože rozdíl v Elo mezi nimi a špičkou nemusí odpovídat rozdílu v praktické použitelnosti.
Vzhledem k tomu, že žebříček zahrnuje modely od šesti různých tvůrců napříč americkým i asijským trhem · OpenAI, Microsoft AI, Google, Reve, Alibaba a ByteDance Seed · doporučuje se firmám testovat konkrétní use case na vlastních promptech, nikoli spoléhat výhradně na pořadí v žebříčku postaveném na obecných lidských preferencích.
Časté dotazy
Který model generování obrázků má nejvyšší Elo skóre v září 2026?
Nejvyšší hodnotu Elo má GPT Image 2 od OpenAI s 1 371 bodů. Těsně za ním následuje MAI-Image-2.6-Preview od Microsoft AI s 1 349 body. Je třeba mít na paměti, že Elo měří lidské preference, tedy líbivost výstupů, nikoli přesnost splnění zadaného promptu.
Znamená vyšší Elo skóre, že model lépe plní zadání?
Ne nutně. Elo z lidských preferencí odráží, který obrázek se hodnotitelům líbí víc při přímém srovnání, což souvisí spíše s estetikou než s věrností promptu. Model s hodnotou 1 371 jako GPT Image 2 může být preferován pro vzhled, aniž by nutně přesněji dodržel zadané instrukce.
Jak velký je rozdíl mezi nejlepším a nejhorším modelem v žebříčku?
Nejvyšší hodnotu má GPT Image 2 s 1 371 body, nejnižší Qwen-Image-3.0 od Alibaby s 1 269 body. Mezi špičkou a spodní částí žebříčku je citelný odstup, zatímco modely uprostřed pole, například mezi 1 305 a 1 280 body, se od sebe liší jen minimálně.
ZDROJE DAT A METODIKA
Všechna čísla v tomto srovnání pocházejí z uvedených zdrojů k datu 3. září 2026. Grafy generuje institut CIAD přímo ze zdrojových dat; textová analýza čísla nikdy nedopočítává ani neodhaduje.