Souhrn

Pro vedení firmy: Předchozí studie CIAD se ptala, jestli AI crawlery jako GPTBot nebo ClaudeBot vůbec smí na český firemní web vstoupit (viz studie o robots.txt). Tahle studie se ptá na navazující otázku, která je stejně důležitá a odpovídá na ni jiná polovina dat: když crawler dovnitř smí, najde tam něco, co umí použít? Otevřenost webu pro roboty neznamená, že jim web dá něco použitelného. Roboti nečtou stránku jako člověk · hledají strojově čitelné značky, které říkají, co firma dělá, kde sídlí a co nabízí, a hledají soubor, který jim řekne, které stránky vůbec existují. CIAD tohle živě změřil u českých firemních webů 3. 8. 2026.

61,9 %webů (146 z 236) nemá žádná strukturovaná data
26,5 %existujících sitemap souborů (45 ze 170) není platné XML
2,4 %webů má typ LocalBusiness, který popisuje skutečnou firmu (z 253)

Vpuštěn dovnitř, a co dál

Robots.txt řeší jednu otázku: smí konkrétní robot na web vstoupit. Tahle studie měří, co je za touhle branou. Dvě věci rozhodují, jestli AI asistent umí o firmě z jejího webu něco říct:

  • Strukturovaná data (nejčastěji ve formátu JSON-LD, dál microdata a RDFa) jsou kousky textu vložené přímo do HTML stránky, které nejsou určené pro oko návštěvníka, ale pro stroj. Říkají výslovně: „tohle je firma, jmenuje se X, sídlí v Y, nabízí Z" · namísto toho, aby to robot musel odhadovat z prózy a fotek na homepage.
  • Sitemap.xml je veřejný soubor, obvykle na adrese vasedomena.cz/sitemap.xml, který je strojově čitelným seznamem stránek, jež web chce, aby byly nalezené. Bez něj musí robot všechny stránky objevit proklikáváním, a snadno něco přehlédne nebo nikdy nenajde stránku, na kterou nikde jinde nevede odkaz.

Web může být z hlediska robots.txt naprosto otevřený, a přesto mu neposkytnout nic použitelného · pokud popisuje firmu jen v próze uvnitř obrázků na homepage a nemá žádnou strojově čitelnou stopu ani mapu vlastních stránek, dostane se crawler dovnitř a odejde prakticky naprázdno. Přesně tenhle stav tato studie měří.

Vzorek a jeho meze

Vzorek je konvenienční, ne náhodný: stejný výzkumný korpus 299 českých komerčních domén, který CIAD používá napříč paralelními studiemi. Každé procento v tomto textu se vztahuje výhradně ke zkoumaným doménám, nikdy k českým firmám obecně.

Studie čerpá ze dvou samostatných živých skenů měřených týž den, každý s vlastní mírou dosažitelnosti · rozdíl mezi základy je dán běžnými přechodnými síťovými chybami při dvou oddělených bězích, ne rozdílnou definicí dosažitelnosti.

KategoriePočet
Domén celkem, sken zahájen299
Nedostupné pro sken strukturovaných dat (DNS 34, HTTP chyba 8, timeout 3, odmítnuté spojení 1)46
Dostupné, základ pro strukturovaná data236
Nedostupné pro sken sitemap.xml41
Dostupné, základ pro sitemap.xml241

Sken byl čistě pasivní: jeden veřejný GET požadavek na statické HTML stránky (bez spouštění JavaScriptu) a jeden GET na /sitemap.xml, přesně to, co udělá kterýkoli AI crawler. Bez pokusu o průnik, testování zranitelností nebo autentizace.

Hlavní zjištění: 61,9 % webů nemá žádná strukturovaná data

Z živého skenu 236 dosažitelných českých firemních webů (3. 8. 2026) CIAD zjistil, že 61,9 % (146 z 236) nemá na stránce žádná strukturovaná data v žádném ze tří běžných formátů (JSON-LD, microdata, RDFa). Zbylých 38,7 % (98 z 253) má alespoň jeden z těchto formátů přítomný. Zjištění popisují technický stav veřejně dostupné infrastruktury k datu měření.

Formát strukturovaných dat (z 236 dosažitelných)PočetPodíl
Žádná strukturovaná data v žádném formátu14661,9 %
JSON-LD přítomen9236,4 %
Microdata přítomna176,7 %
RDFa přítomna10,4 %

Jedna doména může mít víc formátů zároveň (typicky JSON-LD i microdata na téže stránce), takže součet řádků JSON-LD + microdata + RDFa přesahuje 98, počet domén s alespoň jedním formátem. RDFa se vyskytla jen u 1 z 253 domén · při tak malém počtu je to šumová hodnota vzorku, ne samostatné zjištění, a dál se s ní v textu nepracuje jako s trendem.

Jaká data tam jsou, a jaká chybí

Mezi 98 doménami, které nějaká strukturovaná data mají, převažují typy schema.org, které popisují technickou konstrukci stránky, ne samotnou firmu. Následující tabulka počítá výskyt jednotlivých typů ze všech 253 dosažitelných domén, protože jde o zjištění o celém vzorku, ne jen o podmnožině s daty. Jedna doména může mít víc typů zároveň, podíly se proto nesčítají na 100 %.

Typ schema.orgPodíl (z 253)Počet
WebSite28,9 %73
Organization26,5 %67
WebPage21,7 %55
BreadcrumbList15,0 %38
ImageObject9,1 %23
Person5,9 %15
Article5,5 %14
LocalBusiness2,4 %6
FAQPage1,2 %3

WebSite, Organization, WebPage a BreadcrumbList jsou typy, které nejčastěji popisují technickou konstrukci stránky, ne konkrétní firmu · říkají „tohle je web", „tohle je organizace", „tohle je stránka" · o samotné firmě, jejím sídle nebo nabídce nic konkrétního neříkají. Typy, které by asistentovi umožnily odpovědět na konkrétní otázku o firmě (kde sídlí, kdy má otevřeno, jaké má služby, jaké jsou časté dotazy) jsou LocalBusiness a FAQPage, a obě se ve vzorku vyskytují u jednotek domén (6, respektive 3 z 253). Při tak nízkém počtu nejde brát procenta jako přesné měření · směr zjištění ale je jasný a je to hlavní bod této sekce: markup, který na českých firemních webech existuje, je téměř výhradně ten druh, který o firmě samotné neříká nic konkrétního.

Mapa webu pro roboty: sitemap.xml

70,5 %dosažitelných webů (170 z 241) má /sitemap.xml
75,1 %z těch, co ji mají, je platné XML (z 181)
Stav /sitemap.xml (z 241 dosažitelných)PočetPodíl
Sitemap.xml existuje na konvenční cestě17070,5 %
Sitemap.xml na konvenční cestě neexistuje7729,8 %

Sitemapa nemusí ležet jen na konvenční adrese · může být deklarovaná v robots.txt na jiné cestě. Následující tabulka má jiný základ (299, všechny cílené domény, protože robots.txt lze zkusit přečíst i u domén, u kterých se sitemapu nepodařilo stáhnout z jiného důvodu) a měří jinou otázku: kde web říká, že sitemapa je, ne jestli na konvenční adrese odpovídá.

Deklarace sitemapy v robots.txt (z 299)PočetPodíl
Deklarována na konvenční cestě (/sitemap.xml)7625,4 %
Deklarována na jiné, nekonvenční cestě7725,8 %
Sitemapa v robots.txt nedeklarována8327,8 %
Žádný robots.txt nebo žádná deklarace k přečtení6321,1 %

Rozbitá sitemapa je horší než žádná

Ze 170 souborů sitemap.xml nalezených na konvenční cestě je 136 (75,1 %) platné XML, které robot umí zpracovat. Zbylých 45 (26,5 %) platné XML není · roboti je tiše ignorují, bez jakéhokoli chybového hlášení, které by se dostalo k majiteli webu.

To je jádro druhého zjištění: neexistující sitemapa a rozbitá sitemapa nejsou stejně špatné. Chybějící sitemapa často znamená, že se o ni nikdo nezajímal. Rozbitá sitemapa naopak často vypadá jako odškrtnutý úkol · soubor na adrese existuje, prohlížeč po zadání URL něco zobrazí, formulář byl vyplněný nebo plugin nainstalovaný. Jenže obsah souboru neprojde jako platné XML, a roboti (vyhledávače i AI crawlery stejně) ho v tom okamžiku bez jakéhokoli varování přeskočí, jako by tam nebyl. Rozdíl mezi „nemám sitemapu" a „mám sitemapu, která nefunguje" je z pohledu robota nulový, ale z pohledu majitele webu je to rozdíl mezi vědomím, že něco chybí, a dojmem, že je úkol hotový.

Doplňkově: mezi 181 nalezenými sitemapami jsou 3 (z 181), které jsou platné XML, ale neobsahují žádnou položku · formálně fungují, prakticky robotovi nedávají žádnou stránku k nalezení. Při 3 doménách je to příliš málo na samostatné promile v textu, ale patří do stejné kategorie jako výše: existuje soubor, který úkol plní jen navenek.

Stav sitemap.xml: chybí proti platnému XML proti neplatnému XMLSloupcový graf tří vzájemně se vylučujících kategorií stavu sitemap.xml z 258 dosažitelných webů: Chybí: 77/258, 29,8 %. Platné XML: 136/258, 52,7 %. Neplatné XML: 45/258, 17,4 %. Svislá přerušovaná čára odděluje první kategorii (bez sitemapy) od zbylých dvou (sitemapa existuje, dohromady 181/258, 70,2 %).Bez sitemapySitemapa existuje29,8 %77/258Chybí52,7 %136/258Platné XML17,4 %45/258Neplatné XMLPodíl webů (z 258)
Stav /sitemap.xml na konvenční cestě u 258 dosažitelných webů: 77 bez sitemapy (29,8 %), 136 s platným XML (52,7 % z 258), 45 s neplatným XML (17,4 % z 258). Sitemapa existuje celkem u 181/258 (70,2 %), z toho 75,1 % platných a 24,9 % neplatných (obě poslední dvě čísla vztažená k 181 nalezeným souborům, ne k celému vzorku 258).

Co s tím

Tahle studie není návod na implementaci strukturovaných dat ani na správu sitemapy · to je práce pro toho, kdo web spravuje, ne pro tenhle text. Tři věci ale jdou ověřit i bez technického zázemí:

  1. Má homepage vůbec strukturovaná data? V prohlížeči otevřete zdrojový kód stránky (zobrazit zdroj) a hledejte application/ld+json. Pokud tam nic není, web patří mezi 61,9 % ze vzorku, které crawler nechá bez jakékoli strojově čitelné stopy po firmě.
  2. Funguje sitemapa, nejen existuje? Otevřete vasefirma.cz/sitemap.xml v prohlížeči. Pokud se zobrazí čitelná struktura odkazů (ne chybová hláška, ani nic, co vypadá rozbitě), je pravděpodobně v pořádku · jistotu dá bezplatný online validátor XML, kam se URL vloží.
  3. Popisuje web firmu i textem, nebo jen obrázkem? Adresa, otevírací doba, nabízené služby nebo lokalita napsané jako čitelný HTML text dají crawleru něco k přečtení. Stejné informace vysázené jen uvnitř fotky nebo grafiky nepřečte ani AI crawler, ani vyhledávač · vidí jen obrázek, ne jeho obsah.

Zbytek, tedy který konkrétní typ schema.org zvolit, jak sitemapu udržovat v souladu se skutečnou strukturou webu a jak markup ověřit strojově, je práce pro vývojáře nebo správce webu · smysluplně ji nejde zestručnit na tři odrážky pro majitele firmy.

Metodika

Detail dostatečný k tomu, aby ho kdokoli zopakoval na stejném vzorku:

  • Zdroj vzorku: stejných 299 českých komerčních domén z výzkumného korpusu, který CIAD používá napříč paralelními studiemi.
  • Datum skenu: 3. 8. 2026, dva oddělené živé běhy téhož dne, žádná archivní data.
  • Sken strukturovaných dat: jeden GET požadavek na statické HTML domovské stránky, bez spouštění JavaScriptu. To je záměrné: měří se to, co skutečně nese HTML, které crawler dostane, protože ani vyhledávače, ani většina AI crawlerů JavaScript při prvním průchodu nespouští.
  • Detekce formátu: JSON-LD (<script type="application/ld+json">), microdata (atributy itemscope / itemprop) a RDFa (atributy typeof / property ve jmenném prostoru RDFa), parsováno a klasifikováno podle typu schema.org.
  • Sken sitemapy: jeden GET na veřejnou cestu /sitemap.xml, ověření, že odpověď parsuje jako platné XML, a samostatně kontrola řádku Sitemap: v robots.txt pro zjištění deklarované cesty.
  • Základ pro výpočet podílu: 236 pro všechny metriky strukturovaných dat (299 mínus 46 nedostupných, po vyloučení hloubkového shluku z dosažitelných), 241 pro dosažitelnost sitemapy na konvenční cestě (299 mínus 41 nedostupných, 299 pro deklaraci sitemapy v robots.txt. Nedostupná doména se nikdy nepočítá jako „bez dat" nebo „bez sitemapy".
  • Práh pro zveřejnění segmentu: žádná kategorie s méně než 10 doménami se nepublikuje jako samostatný křížený ukazatel. Přímé, nekřížené počty z agregátu (např. LocalBusiness, FAQPage, RDFa) jsou uvedené s explicitním upozorněním na nízký počet, ne jako přesné měření.
  • Rozsah skenu: výhradně statické HTML domovské stránky a /sitemap.xml. Žádná autentizace, žádné testování zranitelností, žádný zásah do funkčnosti webu.
  • Publikovaná data: pouze agregáty · žádná doména, žádné jméno firmy. Podrobná data z jednotlivého skenu nejsou veřejná.

Data ke stažení

Agregovaná data ke stažení pod licencí CC BY 4.0 · JSON i CSV, bez doménových jmen a bez jmen firem. Kdokoli může data ověřit, přepočítat nebo citovat s odkazem na tuto stránku.

Stáhnout JSON · Stáhnout CSV