Souhrn

U 197 z 235 vyhodnotitelných webů nebylo v získaném robots.txt zaznamenáno zvláštní pravidlo pro sledované AI crawlery. U dalších 23 soubor chyběl. Společně jde o 220 z 235, tedy 93,6 %. Zbývajících 15 případů obsahuje pojmenovaná pravidla nebo obecnou blokaci robotů.

Toto je výsledek čtení veřejných pravidel dne 3. srpna 2026. Nejde o měření pozice ve vyhledávači, citací v odpovědích AI nebo skutečného stahování obsahu. Studie také nemůže ze souboru odvodit záměr majitele webu.

93,6 %bez zvláštních pravidel pro sledované AI crawlery nebo bez robots.txt (220/235)
15případů s pojmenovanými pravidly nebo obecnou blokací z 235
235vyhodnotitelných politik robots.txt

Co robots.txt znamená a co z něj neplyne

Robots.txt sděluje spolupracujícím robotům pravidla pro procházení cest webu. Pojmenovaná pravidla mohou určit chování konkrétního user-agentu; obecná skupina s hvězdičkou může ovlivnit robota i bez jeho výslovného jména. „Bez pojmenovaného pravidla" proto samo o sobě neznamená „bez omezení".

Podle specifikace Robots Exclusion Protocol tato pravidla nenahrazují řízení přístupu. Uvedená cesta se nestává tajnou a pravidlo není technická záruka, že všechny automaty zastaví. Chybějící soubor nebo zvláštní pravidlo mohou být záměrným nastavením, výchozím stavem, výsledkem jiné kontroly nebo stavem, jehož důvod ze samotné odpovědi nezjistíme.

Různí roboti mohou sloužit různým účelům. Tato studie zjišťuje přítomnost pravidel ve zvoleném seznamu user-agentů. Netestuje jejich dodržování, následné použití obsahu, kvalitu odpovědí AI ani změnu návštěvnosti.

Vzorek a oddělení neznámého stavu

Výzkumný korpus není reprezentativním náhodným výběrem českých firem. Před agregací byla uplatněna vylučovací pravidla. Nedostupné odpovědi a HTML stránky ochrany proti automatům byly vyřazeny z výkladu politiky: taková stránka není robots.txt a nesmí se počítat jako web bez pravidel.

Robots.txt má základ 235 a TLS 236 úspěšných handshake. Tyto základy se neslévají. Platná odpověď s HTTP hlavičkami navíc nemusí být vhodná pro výklad robots.txt. Přesný základ samostatných hlavičkových metrik nezveřejňujeme, protože by ve spojení s dalšími údaji umožnil odvodit malou podskupinu.

Tři zveřejněné kategorie pravidel

Pozorovaný stavPočet z 235Podíl
Robots.txt bez zvláštních pravidel pro sledované AI crawlery19783,8 %
Robots.txt nezaznamenán239,8 %
Pojmenovaná pravidla nebo obecná blokace156,4 %

Poslední skupina spojuje povolení, blokaci a jejich kombinace. Tyto podskupiny nejsou zveřejněné jednotlivě, aby malé buňky neumožňovaly identifikaci. Z celkové četnosti 15 nelze určit četnost blokace konkrétního robota. Pro první dvě skupiny používáme popis pozorovaného stavu, nikoli tvrzení, že firma „neudělala rozhodnutí".

Rozdělení stavu robots.txt vůči AI crawlerům: bez jmenovitého pravidla proti explicitnímu pravidluSloupcový graf tří kategorií stavu robots.txt vůči AI crawlerům z 235 dostupných domén, Bez jmenovitého pravidla: 197/235, 83,8 %; Soubor nezaznamenán: 23/235, 9,8 %; Explicitní pravidlo: 15/235, 6,4 %. Svislá přerušovaná čára odděluje první dvě kategorie (bez jmenovitého pravidla pro AI, dohromady 220/235, 93,6 %) od třetí kategorie (alespoň nějaké explicitní pravidlo, dohromady 15/235, 6,4 %).Bez jmenovitého pravidla pro AIExplicitní pravidlo83,8 %197/235Bez jmenovitého pravidla9,8 %23/235Soubor nezaznamenán6,4 %15/235Explicitní pravidloPodíl domén (z 235)
Rozdělení stavu robots.txt vůči AI crawlerům u 235 dostupných domén. Bez jmenovitého pravidla pro AI (mlčí nebo robots.txt nebyl zaznamenán): 220/235 (93,6 %). Alespoň nějaké explicitní pravidlo (blokace, povolení, smíšený stav nebo blanketní blokace všech robotů; detailní malé skupiny jsou sloučeny): 15/235 (6,4 %).

TLS: vyjednaný protokol, nikoli celý bezpečnostní profil

Vyjednaný protokolPočet z 236Podíl
TLSv1.320687,3 %
TLSv1.23012,7 %

Při handshake byl vyjednán TLS 1.3 u 206 z 236 odpovědí. Výsledek popisuje protokol vybraný pro tuto konkrétní konfiguraci klienta. Neznamená, že server nepodporuje další protokoly. Pokus o starší TLS mohl narazit na omezení použitého klienta; tato studie proto nedokládá jejich úplné odmítání na serveru.

Medián zaznamenané zbývající platnosti certifikátu byl 64 dnů. Jde o historický údaj, nikoli dnešní dobu do expirace. Malé četnosti jednotlivých závad certifikátů a jejich doplňky nejsou v této veřejné verzi zveřejněny. Ze samotného úspěšného handshake nelze odvodit správnost celého řetězce nebo shodu názvu hostitele.

HTTP/2 a meze měření HTTP/3

HTTP/2 byl při vyjednávání ALPN zaznamenán u 205 z 236 úspěšných TLS handshake, tedy 86,9 %. Tato vlastnost se nezapočítává do pravidel robots.txt a není měřením rychlosti načtení stránky.

Měření HTTP/3 pracovalo pouze s oznámením alternativní služby v hlavičce Alt-Svc. Neproběhlo navázání QUIC spojení, které by ověřilo dosažitelnost. Nepřítomnost Alt-Svc také nevylučuje možnost zjistit HTTP/3 jinou cestou. Přesnou četnost ani jmenovatel této metriky nezveřejňujeme kvůli ochraně rekonstruovatelných malých podskupin.

Hlavička Server není inventář aplikace

Rozpoznaná softwarová verze v hlavičce Server by popisovala veřejnou odpověď, nikoli celý systém. Hlavičku může vytvářet proxy nebo ochranná vrstva. Neuvádění verze samo o sobě nedokazuje bezpečnost a její zveřejnění neprokazuje konkrétní zranitelnost.

Přesná četnost této vlastnosti ani její jmenovatel nejsou součástí veřejné agregace. Jejich kombinace s ostatními ukazateli by umožnila odvodit malé podskupiny, které samostatně nedosahují publikačního prahu.

Metodika a oprava agregací

Sběr zaznamenával veřejnou odpověď na robots.txt, TLS handshake a dostupné HTTP hlavičky. Nebylo nutné přihlášení, nebyly testovány zranitelnosti ani obcházeny ochrany. Politika byla tříděna podle zaznamenaných pravidel pro sledované user-agenty a obecné blokace.

Přepočet 2. října 2026 používá uložené měření z 3. srpna 2026 po uplatnění vylučovacích pravidel a oddělení anti-bot HTML. Není to nový sken. Změna klasifikace opravuje soubor použitelných odpovědí; neprokazuje, že se nastavení webů mezitím změnilo. Výsledky neověřených archivních směsí nejsou součástí této agregace.

Data a zdroje

Agregace pod licencí CC BY 4.0 obsahuje počty, jmenovatele a zveřejnitelné kategorie bez domén a jmen subjektů. Výklad pravidel a jejich mezí vychází ze specifikace Robots Exclusion Protocol, RFC 9309.

Stáhnout JSON · Stáhnout CSV