Zatímco se v článcích o AI vyhledávání opakuje, že „firmy musí být připravené", nikdo neuvádí, jak na tom český trh reálně je. Tak jsem to změřil: 22. srpna 2026 jsem u třiceti českých e-shopů zkontroloval, jak mají nastavený robots.txt vůči AI crawlerům, jestli mají llms.txt a jaká strukturovaná data nabízejí na homepage. Metodika i agregovaná data jsou níž ke stažení.
Rychlá odpověď: co měření ukázalo
- Jen 5 z 25 e-shopů s čitelným
robots.txtv něm vůbec zmiňuje nějakého AI crawlera. Zbylých 80 % žádné rozhodnutí o AI neudělalo — ani „ano", ani „ne". - Úplně blokují aspoň jednoho AI crawlera jen 2 z 25. Obava z AI se v praxi do nastavení skoro nepromítá.
llms.txtvrátil status 200 u 8 z 30 domén, ale jen u 4 jde o skutečný textový soubor. Zbytek servíruje HTML stránku aplikace — soubor tedy fakticky neexistuje.- 7 z 23 čitelných homepage nemá žádné JSON-LD. Typ
Productjsem našel u 3,FAQPageu jediného e-shopu. - Základy nejsou samozřejmost: právě jeden
H1má 61 %, canonical 48 %, hreflang 48 %. - 6 z 30 domén odmítlo běžného HTTP klienta chybou 403. Ochrana proti botům se ale nechová jinak k AI crawlerům než ke mně.
Metodika a veřejná data
- Výběr: 30 známých českých e-shopových domén napříč obory a velikostmi. Jde o účelový, nikoli náhodný ani reprezentativní vzorek — čísla popisují tenhle vzorek, ne celý trh.
- Kdy a čím: 22. srpna 2026, jeden HTTP požadavek na soubor a doménu, běžný prohlížečový User-Agent, pauza mezi doménami.
- Co se měřilo:
robots.txt(pravidla pro 11 AI agentů),llms.txt(status a skutečný typ obsahu), homepage HTML (typy JSON-LD, počet H1, meta description, canonical, Open Graph, hreflang). - Omezení: statické načtení HTML bez spuštění JavaScriptu, takže JSON-LD vkládané až skriptem se nemuselo započítat. Domény, které vrátily 403, jsou z příslušných agregací vyloučené. Měření je jednorázový snímek, ne dlouhodobé sledování.
- Sledovaní agenti: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended, CCBot, Bytespider, Applebot-Extended, meta-externalagent, Amazonbot.
Stáhnout anonymizovaný agregovaný dataset v CSV. Soubor obsahuje 30 metrik s čitatelem, jmenovatelem a metodickou poznámkou; neobsahuje názvy jednotlivých e-shopů ani přiřazení hodnot ke konkrétní doméně.
Zjištění 1: rozhodnutí o AI zatím neudělal skoro nikdo
Nejčastěji zmiňovaným agentem byl GPTBot (3 z 25 domén mají pro něj nějaké pravidlo), následovaný ClaudeBot (4 zmínky včetně částečných omezení) a CCBot (2 blokace). U ostatních agentů je zmínka výjimkou.
Zajímavější než blokace je opak: část e-shopů má pro AI crawlery výslovné povolení. To dává smysl u obchodu, který chce být v AI odpovědích vidět — jen o tom zatím rozhoduje minimum firem vědomě.
Zjištění 2: polovina nalezených llms.txt nejsou soubory
Soubor llms.txt (textový přehled webu určený jazykovým modelům) vrátil status 200 u osmi domén. Když jsem se ale podíval na typ obsahu, jen čtyři z nich skutečně vracely text. Zbylé čtyři poslaly HTML stránku aplikace — server odpověděl „v pořádku", ale obsahem byl web, ne soubor.
Tuhle chybu znám důvěrně: měl jsem ji na vlastním webu a našel jsem ji ten samý den. Vzniká tím, že směrovací vrstva frameworku zachytí i požadavek na statický soubor a vrátí místo něj stránku. Kontrola HTTP statusu ji neodhalí — musí se ověřit Content-Type.
| Kontrola | Kolik domén |
|---|---|
llms.txt vrací 200 |
8 z 30 |
| z toho skutečný textový soubor | 4 z 30 |
| z toho HTML místo souboru | 4 z 30 |
Dodejme k tomu poctivý kontext: veřejné analýzy zatím nenašly souvislost mezi existencí llms.txt a citovaností v AI výsledcích a Google jeho podporu odmítl. Soubor tedy není vstupenka nikam. Chyba tu není v tom, že ho někdo nemá — ale v tom, že ho někdo má a nefunguje.
Zjištění 3: strukturovaná data chybí tam, kde by AI nejvíc pomohla
Z 23 homepage, které šlo přečíst:
| Typ JSON-LD | Počet e-shopů |
|---|---|
| Organization | 11 |
| WebSite | 10 |
| Product | 3 |
| BreadcrumbList | 1 |
| FAQPage | 1 |
| Žádné JSON-LD | 7 |
Sedm e-shopů nemá na homepage strukturovaná data vůbec. To není katastrofa pro klasické vyhledávání — Google si poradí i bez toho. Je to ale problém ve chvíli, kdy odpověď skládá jazykový model: strukturovaná data jsou nejspolehlivější způsob, jak mu říct cenu, dostupnost, hodnocení a identitu firmy tak, aby si je nemusel domýšlet z textu.
Zjištění 4: základy webu nejsou samozřejmost ani u velkých
| Prvek | Podíl (z 23) |
|---|---|
| Meta description | 91 % |
| Open Graph title | 78 % |
| Právě jeden H1 | 61 % |
| Canonical | 48 % |
| hreflang | 48 % |
Chybějící canonical u poloviny vzorku je nejpřekvapivější číslo celého měření. U e-shopu, kde se stejný produkt objevuje pod filtrem, řazením i stránkováním, je to přímá cesta k duplicitám v indexu.
Zjištění 5: ochrana proti botům platí i na AI
Šest z třiceti domén odmítlo běžný HTTP požadavek chybou 403. Z pohledu provozu je to pochopitelné — ochrana proti scrapingu má svůj důvod. Stojí ale za to vědět, co to znamená: stejná ochrana se aplikuje i na AI crawlery, které by jinak obsah použily jako podklad pro odpověď zákazníkovi.
Není to argument pro vypnutí ochrany. Je to argument pro vědomé rozhodnutí: buď chci být v AI odpovědích vidět a nastavím výjimky, nebo tam být nechci a beru to jako cenu za bezpečnost. Nejhorší varianta je nevědět, která z nich platí.
Co z toho plyne pro provozovatele e-shopu
- Otevřete si
robots.txta rozhodněte se. Ne kvůli technikálii, ale proto, že výchozí stav je rozhodnutí taky — jen ho za vás udělal někdo jiný. - Zkontrolujte
Content-Type, ne jen status. Když soubor vrací HTML, je pro stroje neviditelný, i když v prohlížeči „funguje". - Doplňte JSON-LD pro produkt a organizaci. Cena, dostupnost a identita jsou přesně to, co si model jinak domýšlí.
- Opravte canonical a H1 dřív než cokoliv okolo AI. Bez základů se nic dalšího nechytí.
- Vědomě rozhodněte o ochraně proti botům. Ochrana i viditelnost jsou legitimní volby; nevědomost není.
Pokud tohle chcete mít zkontrolované a nastavené na svém webu, přesně to řeším v SEO péči a auditech a u e-shopů v rámci e-shopu na míru.
Nejčastější otázky
Kolik českých e-shopů blokuje AI crawlery?
Ve vzorku 30 domén (25 s čitelným robots.txt) blokují aspoň jednoho AI crawlera úplně dva e-shopy. Nějaké pravidlo pro AI agenty má v robots.txt pět z nich. Zbylých dvacet je nezmiňuje vůbec, což v praxi znamená přístup povolen.
Má smysl mít llms.txt?
Zatím spíš jako pořádek než jako výnos. Veřejné analýzy nenašly souvislost mezi jeho existencí a citovaností v AI výsledcích a Google jeho podporu odmítl. Pokud ho ale máte, musí to být skutečný textový soubor — v tomhle měření byla polovina nalezených llms.txt ve skutečnosti HTML stránka.
Jak poznám, že můj llms.txt nebo robots.txt vrací HTML?
Otevřete soubor a podívejte se na Content-Type v odpovědi serveru — má být text/plain. Rychlá kontrola z příkazové řádky: curl -sI https://vasedomena.cz/llms.txt. Status 200 sám o sobě nic nedokazuje; stránka aplikace ho vrátí taky.
Které JSON-LD typy má e-shop mít?
Minimálně Organization (identita firmy), WebSite (web jako celek), Product s cenou a dostupností na produktových stránkách a BreadcrumbList pro navigační cestu. FAQPage tam, kde reálně odpovídáte na otázky. V měřeném vzorku mělo Product na homepage jen 3 z 23 e-shopů.
Je vzorek 30 e-shopů reprezentativní?
Není a netvrdím to. Jde o účelový výběr známých českých e-shopů napříč obory. Čísla popisují tenhle vzorek — jsou dobrým vodítkem o stavu trhu, ale ne statistickým odhadem pro všechny české e-shopy. Proto zveřejňuju metodiku i agregovaný dataset — čísla si lze ověřit a měření zopakovat stejným postupem na vlastním vzorku (dataset záměrně neobsahuje názvy domén).
Zdroje a odkazy
- Anonymizovaný agregovaný dataset (CSV) — 30 metrik z tohoto měření
- Předchozí měření 21 českých e-shopů — obsah, rychlost a soubory webu, srpen 2026
- Google Search Central: robots.txt — jak fungují pravidla pro roboty
- Google-Extended v nápovědě Googlu — přehled Google crawlerů včetně AI
