Souhrn
Pro vedení firmy: Předchozí studie CIAD se ptala, jestli AI crawlery jako
GPTBot nebo ClaudeBot vůbec smí na český firemní web vstoupit
(viz studie o robots.txt). Tahle studie se ptá
na navazující otázku, která je stejně důležitá a odpovídá na ni jiná polovina dat: když
crawler dovnitř smí, najde tam něco, co umí použít? Otevřenost webu pro roboty neznamená, že jim web dá
něco použitelného. Roboti nečtou stránku jako člověk · hledají strojově čitelné značky, které
říkají, co firma dělá, kde sídlí a co nabízí, a hledají soubor, který jim řekne, které stránky
vůbec existují. CIAD tohle živě změřil u českých firemních webů 3. 8. 2026.
Vpuštěn dovnitř, a co dál
Robots.txt řeší jednu otázku: smí konkrétní robot na web vstoupit. Tahle studie měří, co je za touhle branou. Dvě věci rozhodují, jestli AI asistent umí o firmě z jejího webu něco říct:
- Strukturovaná data (nejčastěji ve formátu
JSON-LD, dálmicrodataaRDFa) jsou kousky textu vložené přímo do HTML stránky, které nejsou určené pro oko návštěvníka, ale pro stroj. Říkají výslovně: „tohle je firma, jmenuje se X, sídlí v Y, nabízí Z" · namísto toho, aby to robot musel odhadovat z prózy a fotek na homepage. - Sitemap.xml je veřejný soubor, obvykle na adrese
vasedomena.cz/sitemap.xml, který je strojově čitelným seznamem stránek, jež web chce, aby byly nalezené. Bez něj musí robot všechny stránky objevit proklikáváním, a snadno něco přehlédne nebo nikdy nenajde stránku, na kterou nikde jinde nevede odkaz.
Web může být z hlediska robots.txt naprosto otevřený, a přesto mu neposkytnout nic použitelného · pokud popisuje firmu jen v próze uvnitř obrázků na homepage a nemá žádnou strojově čitelnou stopu ani mapu vlastních stránek, dostane se crawler dovnitř a odejde prakticky naprázdno. Přesně tenhle stav tato studie měří.
Vzorek a jeho meze
Vzorek je konvenienční, ne náhodný: stejný výzkumný korpus 299 českých komerčních domén, který CIAD používá napříč paralelními studiemi. Každé procento v tomto textu se vztahuje výhradně ke zkoumaným doménám, nikdy k českým firmám obecně.
Studie čerpá ze dvou samostatných živých skenů měřených týž den, každý s vlastní mírou dosažitelnosti · rozdíl mezi základy je dán běžnými přechodnými síťovými chybami při dvou oddělených bězích, ne rozdílnou definicí dosažitelnosti.
| Kategorie | Počet |
|---|---|
| Domén celkem, sken zahájen | 299 |
| Nedostupné pro sken strukturovaných dat (DNS 34, HTTP chyba 8, timeout 3, odmítnuté spojení 1) | 46 |
| Dostupné, základ pro strukturovaná data | 236 |
| Nedostupné pro sken sitemap.xml | 41 |
| Dostupné, základ pro sitemap.xml | 241 |
Sken byl čistě pasivní: jeden veřejný GET požadavek na statické HTML stránky
(bez spouštění JavaScriptu) a jeden GET na /sitemap.xml, přesně to, co udělá
kterýkoli AI crawler. Bez pokusu o průnik, testování zranitelností nebo autentizace.
Hlavní zjištění: 61,9 % webů nemá žádná strukturovaná data
Z živého skenu 236 dosažitelných českých firemních webů (3. 8. 2026) CIAD zjistil, že 61,9 % (146 z 236) nemá na stránce žádná strukturovaná data v žádném ze tří běžných formátů (JSON-LD, microdata, RDFa). Zbylých 38,7 % (98 z 253) má alespoň jeden z těchto formátů přítomný. Zjištění popisují technický stav veřejně dostupné infrastruktury k datu měření.
| Formát strukturovaných dat (z 236 dosažitelných) | Počet | Podíl |
|---|---|---|
| Žádná strukturovaná data v žádném formátu | 146 | 61,9 % |
| JSON-LD přítomen | 92 | 36,4 % |
| Microdata přítomna | 17 | 6,7 % |
| RDFa přítomna | 1 | 0,4 % |
Jedna doména může mít víc formátů zároveň (typicky JSON-LD i microdata na téže stránce), takže součet řádků JSON-LD + microdata + RDFa přesahuje 98, počet domén s alespoň jedním formátem. RDFa se vyskytla jen u 1 z 253 domén · při tak malém počtu je to šumová hodnota vzorku, ne samostatné zjištění, a dál se s ní v textu nepracuje jako s trendem.
Jaká data tam jsou, a jaká chybí
Mezi 98 doménami, které nějaká strukturovaná data mají, převažují typy schema.org, které popisují technickou konstrukci stránky, ne samotnou firmu. Následující tabulka počítá výskyt jednotlivých typů ze všech 253 dosažitelných domén, protože jde o zjištění o celém vzorku, ne jen o podmnožině s daty. Jedna doména může mít víc typů zároveň, podíly se proto nesčítají na 100 %.
| Typ schema.org | Podíl (z 253) | Počet |
|---|---|---|
| WebSite | 28,9 % | 73 |
| Organization | 26,5 % | 67 |
| WebPage | 21,7 % | 55 |
| BreadcrumbList | 15,0 % | 38 |
| ImageObject | 9,1 % | 23 |
| Person | 5,9 % | 15 |
| Article | 5,5 % | 14 |
| LocalBusiness | 2,4 % | 6 |
| FAQPage | 1,2 % | 3 |
WebSite, Organization, WebPage a
BreadcrumbList jsou typy, které nejčastěji popisují technickou
konstrukci stránky, ne konkrétní firmu · říkají „tohle je web", „tohle je organizace",
„tohle je stránka" · o samotné firmě, jejím sídle nebo nabídce nic konkrétního neříkají. Typy,
které by asistentovi umožnily odpovědět na konkrétní otázku o firmě (kde sídlí, kdy má
otevřeno, jaké má služby, jaké jsou časté dotazy) jsou LocalBusiness a
FAQPage, a obě se ve vzorku vyskytují u jednotek domén (6, respektive 3 z 253).
Při tak nízkém počtu nejde brát procenta jako přesné měření · směr zjištění ale je jasný a je
to hlavní bod této sekce: markup, který na českých firemních webech existuje, je téměř výhradně
ten druh, který o firmě samotné neříká nic konkrétního.
Mapa webu pro roboty: sitemap.xml
| Stav /sitemap.xml (z 241 dosažitelných) | Počet | Podíl |
|---|---|---|
| Sitemap.xml existuje na konvenční cestě | 170 | 70,5 % |
| Sitemap.xml na konvenční cestě neexistuje | 77 | 29,8 % |
Sitemapa nemusí ležet jen na konvenční adrese · může být deklarovaná v robots.txt
na jiné cestě. Následující tabulka má jiný základ (299, všechny cílené domény, protože
robots.txt lze zkusit přečíst i u domén, u kterých se sitemapu nepodařilo stáhnout z jiného důvodu) a měří
jinou otázku: kde web říká, že sitemapa je, ne jestli na konvenční adrese odpovídá.
| Deklarace sitemapy v robots.txt (z 299) | Počet | Podíl |
|---|---|---|
| Deklarována na konvenční cestě (/sitemap.xml) | 76 | 25,4 % |
| Deklarována na jiné, nekonvenční cestě | 77 | 25,8 % |
| Sitemapa v robots.txt nedeklarována | 83 | 27,8 % |
| Žádný robots.txt nebo žádná deklarace k přečtení | 63 | 21,1 % |
Rozbitá sitemapa je horší než žádná
Ze 170 souborů sitemap.xml nalezených na konvenční cestě je 136 (75,1 %) platné XML, které robot umí zpracovat. Zbylých 45 (26,5 %) platné XML není · roboti je tiše ignorují, bez jakéhokoli chybového hlášení, které by se dostalo k majiteli webu.
To je jádro druhého zjištění: neexistující sitemapa a rozbitá sitemapa nejsou stejně špatné. Chybějící sitemapa často znamená, že se o ni nikdo nezajímal. Rozbitá sitemapa naopak často vypadá jako odškrtnutý úkol · soubor na adrese existuje, prohlížeč po zadání URL něco zobrazí, formulář byl vyplněný nebo plugin nainstalovaný. Jenže obsah souboru neprojde jako platné XML, a roboti (vyhledávače i AI crawlery stejně) ho v tom okamžiku bez jakéhokoli varování přeskočí, jako by tam nebyl. Rozdíl mezi „nemám sitemapu" a „mám sitemapu, která nefunguje" je z pohledu robota nulový, ale z pohledu majitele webu je to rozdíl mezi vědomím, že něco chybí, a dojmem, že je úkol hotový.
Doplňkově: mezi 181 nalezenými sitemapami jsou 3 (z 181), které jsou platné XML, ale neobsahují žádnou položku · formálně fungují, prakticky robotovi nedávají žádnou stránku k nalezení. Při 3 doménách je to příliš málo na samostatné promile v textu, ale patří do stejné kategorie jako výše: existuje soubor, který úkol plní jen navenek.
Co s tím
Tahle studie není návod na implementaci strukturovaných dat ani na správu sitemapy · to je práce pro toho, kdo web spravuje, ne pro tenhle text. Tři věci ale jdou ověřit i bez technického zázemí:
- Má homepage vůbec strukturovaná data? V prohlížeči otevřete zdrojový
kód stránky (zobrazit zdroj) a hledejte
application/ld+json. Pokud tam nic není, web patří mezi 61,9 % ze vzorku, které crawler nechá bez jakékoli strojově čitelné stopy po firmě. - Funguje sitemapa, nejen existuje? Otevřete
vasefirma.cz/sitemap.xmlv prohlížeči. Pokud se zobrazí čitelná struktura odkazů (ne chybová hláška, ani nic, co vypadá rozbitě), je pravděpodobně v pořádku · jistotu dá bezplatný online validátor XML, kam se URL vloží. - Popisuje web firmu i textem, nebo jen obrázkem? Adresa, otevírací doba, nabízené služby nebo lokalita napsané jako čitelný HTML text dají crawleru něco k přečtení. Stejné informace vysázené jen uvnitř fotky nebo grafiky nepřečte ani AI crawler, ani vyhledávač · vidí jen obrázek, ne jeho obsah.
Zbytek, tedy který konkrétní typ schema.org zvolit, jak sitemapu udržovat v souladu se skutečnou strukturou webu a jak markup ověřit strojově, je práce pro vývojáře nebo správce webu · smysluplně ji nejde zestručnit na tři odrážky pro majitele firmy.
Metodika
Detail dostatečný k tomu, aby ho kdokoli zopakoval na stejném vzorku:
- Zdroj vzorku: stejných 299 českých komerčních domén z výzkumného korpusu, který CIAD používá napříč paralelními studiemi.
- Datum skenu: 3. 8. 2026, dva oddělené živé běhy téhož dne, žádná archivní data.
- Sken strukturovaných dat: jeden GET požadavek na statické HTML domovské stránky, bez spouštění JavaScriptu. To je záměrné: měří se to, co skutečně nese HTML, které crawler dostane, protože ani vyhledávače, ani většina AI crawlerů JavaScript při prvním průchodu nespouští.
- Detekce formátu: JSON-LD (
<script type="application/ld+json">), microdata (atributyitemscope/itemprop) a RDFa (atributytypeof/propertyve jmenném prostoru RDFa), parsováno a klasifikováno podle typuschema.org. - Sken sitemapy: jeden GET na veřejnou cestu
/sitemap.xml, ověření, že odpověď parsuje jako platné XML, a samostatně kontrola řádkuSitemap:vrobots.txtpro zjištění deklarované cesty. - Základ pro výpočet podílu: 236 pro všechny metriky strukturovaných dat (299 mínus 46 nedostupných, po vyloučení hloubkového shluku z dosažitelných), 241 pro dosažitelnost sitemapy na konvenční cestě (299 mínus 41 nedostupných, 299 pro deklaraci sitemapy v robots.txt. Nedostupná doména se nikdy nepočítá jako „bez dat" nebo „bez sitemapy".
- Práh pro zveřejnění segmentu: žádná kategorie s méně než 10 doménami se nepublikuje jako samostatný křížený ukazatel. Přímé, nekřížené počty z agregátu (např. LocalBusiness, FAQPage, RDFa) jsou uvedené s explicitním upozorněním na nízký počet, ne jako přesné měření.
- Rozsah skenu: výhradně statické HTML domovské stránky a
/sitemap.xml. Žádná autentizace, žádné testování zranitelností, žádný zásah do funkčnosti webu. - Publikovaná data: pouze agregáty · žádná doména, žádné jméno firmy. Podrobná data z jednotlivého skenu nejsou veřejná.
Data ke stažení
Agregovaná data ke stažení pod licencí CC BY 4.0 · JSON i CSV, bez doménových jmen a bez jmen firem. Kdokoli může data ověřit, přepočítat nebo citovat s odkazem na tuto stránku.