Přeskočit na obsah
Zpět na všechny články
E-commerce|9 min čtení

Změřil jsem 30 českých e-shopů: 80 % AI crawlery neřeší

Měření 30 českých e-shopů: jen 5 z 25 robots.txt zmiňuje AI crawlery, jen 4 z 8 llms.txt jsou skutečné a 7 z 23 homepage nemá JSON-LD. Dataset je veřejný.

Marek Frňka
Web developer na volné noze za značkou Le Artist, Ostrava

Zatímco se v článcích o AI vyhledávání opakuje, že „firmy musí být připravené", nikdo neuvádí, jak na tom český trh reálně je. Tak jsem to změřil: 22. srpna 2026 jsem u třiceti českých e-shopů zkontroloval, jak mají nastavený robots.txt vůči AI crawlerům, jestli mají llms.txt a jaká strukturovaná data nabízejí na homepage. Metodika i agregovaná data jsou níž ke stažení.

Rychlá odpověď: co měření ukázalo

  • Jen 5 z 25 e-shopů s čitelným robots.txt v něm vůbec zmiňuje nějakého AI crawlera. Zbylých 80 % žádné rozhodnutí o AI neudělalo, ani „ano", ani „ne".
  • Úplně blokují aspoň jednoho AI crawlera jen 2 z 25. Obava z AI se v praxi do nastavení skoro nepromítá.
  • llms.txt vrátil status 200 u 8 z 30 domén, ale jen u 4 jde o skutečný textový soubor. Zbytek servíruje HTML stránku aplikace, soubor tedy fakticky neexistuje.
  • 7 z 23 čitelných homepage nemá žádné JSON-LD. Typ Product jsem našel u 3, FAQPage u jediného e-shopu.
  • Základy nejsou samozřejmost: právě jeden H1 má 61 %, canonical 48 %, hreflang 48 %.
  • 6 z 30 domén odmítlo běžného HTTP klienta chybou 403. Ochrana proti botům se ale nechová jinak k AI crawlerům než ke mně.

Metodika a veřejná data

  • Výběr: 30 známých českých e-shopových domén napříč obory a velikostmi. Jde o účelový, nikoli náhodný ani reprezentativní vzorek, čísla popisují tenhle vzorek, ne celý trh.
  • Kdy a čím: 22. srpna 2026, jeden HTTP požadavek na soubor a doménu, běžný prohlížečový User-Agent, pauza mezi doménami.
  • Co se měřilo: robots.txt (pravidla pro 11 AI agentů), llms.txt (status a skutečný typ obsahu), homepage HTML (typy JSON-LD, počet H1, meta description, canonical, Open Graph, hreflang).
  • Omezení: statické načtení HTML bez spuštění JavaScriptu, takže JSON-LD vkládané až skriptem se nemuselo započítat. Domény, které vrátily 403, jsou z příslušných agregací vyloučené. Měření je jednorázový snímek, ne dlouhodobé sledování.
  • Sledovaní agenti: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended, CCBot, Bytespider, Applebot-Extended, meta-externalagent, Amazonbot.

Stáhnout anonymizovaný agregovaný dataset v CSV. Soubor obsahuje 30 metrik s čitatelem, jmenovatelem a metodickou poznámkou; neobsahuje názvy jednotlivých e-shopů ani přiřazení hodnot ke konkrétní doméně.

Zjištění 1: rozhodnutí o AI zatím neudělal skoro nikdo

Podíl e-shopů, které v robots.txt řeší AI crawlery 25 e-shopů s čitelným robots.txt 5 zmiňuje AI crawlery 20 je vůbec neřeší Z těch pěti blokují aspoň jednoho crawlera úplně dva e-shopy. Zbytek má pravidla částečná nebo výslovně povolující. Měřeno 22. 8. 2026, účelový vzorek 30 domén.
Nejde o to, že by se český trh AI bránil. Jde o to, že se k ní zatím nevyjádřil, a výchozí stav znamená „ber si, co chceš".

Nejčastěji zmiňovaným agentem byl GPTBot (3 z 25 domén mají pro něj nějaké pravidlo), následovaný ClaudeBot (4 zmínky včetně částečných omezení) a CCBot (2 blokace). U ostatních agentů je zmínka výjimkou.

Zajímavější než blokace je opak: část e-shopů má pro AI crawlery výslovné povolení. To dává smysl u obchodu, který chce být v AI odpovědích vidět, jen o tom zatím rozhoduje minimum firem vědomě.

Zjištění 2: polovina nalezených llms.txt nejsou soubory

Soubor llms.txt (textový přehled webu určený jazykovým modelům) vrátil status 200 u osmi domén. Když jsem se ale podíval na typ obsahu, jen čtyři z nich skutečně vracely text. Zbylé čtyři poslaly HTML stránku aplikace, server odpověděl „v pořádku", ale obsahem byl web, ne soubor.

Tuhle chybu znám důvěrně: měl jsem ji na vlastním webu a našel jsem ji ten samý den. Vzniká tím, že směrovací vrstva frameworku zachytí i požadavek na statický soubor a vrátí místo něj stránku. Kontrola HTTP statusu ji neodhalí, musí se ověřit Content-Type.

Kontrola Kolik domén
llms.txt vrací 200 8 z 30
z toho skutečný textový soubor 4 z 30
z toho HTML místo souboru 4 z 30

Dodejme k tomu poctivý kontext: veřejné analýzy zatím nenašly souvislost mezi existencí llms.txt a citovaností v AI výsledcích a Google jeho podporu odmítl. Soubor tedy není vstupenka nikam. Chyba tu není v tom, že ho někdo nemá, ale v tom, že ho někdo má a nefunguje.

Zjištění 3: strukturovaná data chybí tam, kde by AI nejvíc pomohla

Z 23 homepage, které šlo přečíst:

Typ JSON-LD Počet e-shopů
Organization 11
WebSite 10
Product 3
BreadcrumbList 1
FAQPage 1
Žádné JSON-LD 7

Sedm e-shopů nemá na homepage strukturovaná data vůbec. To není katastrofa pro klasické vyhledávání, Google si poradí i bez toho. Je to ale problém ve chvíli, kdy odpověď skládá jazykový model: strukturovaná data jsou strojově čitelný způsob, jak cenu, dostupnost, hodnocení a identitu firmy uvést jednoznačně, bez domýšlení z textu. Že je AI systémy upřednostňují, ale doložené není.

Zjištění 4: základy webu nejsou samozřejmost ani u velkých

Prvek Podíl (z 23)
Meta description 91 %
Open Graph title 78 %
Právě jeden H1 61 %
Canonical 48 %
hreflang 48 %

Chybějící canonical u poloviny vzorku je nejpřekvapivější číslo celého měření. U e-shopu, kde se stejný produkt objevuje pod filtrem, řazením i stránkováním, je to přímá cesta k duplicitám v indexu.

Zjištění 5: ochrana proti botům platí i na AI

Šest z třiceti domén odmítlo běžný HTTP požadavek chybou 403. Z pohledu provozu je to pochopitelné, ochrana proti scrapingu má svůj důvod. Stojí ale za to vědět, co to znamená: stejná ochrana se aplikuje i na AI crawlery, které by jinak obsah použily jako podklad pro odpověď zákazníkovi.

Není to argument pro vypnutí ochrany. Je to argument pro vědomé rozhodnutí: buď chci být v AI odpovědích vidět a nastavím výjimky, nebo tam být nechci a beru to jako cenu za bezpečnost. Nejhorší varianta je nevědět, která z nich platí.

Co z toho plyne pro provozovatele e-shopu

  1. Otevřete si robots.txt a rozhodněte se. Ne kvůli technikálii, ale proto, že výchozí stav je rozhodnutí taky, jen ho za vás udělal někdo jiný.
  2. Zkontrolujte Content-Type, ne jen status. Když soubor vrací HTML, je pro stroje neviditelný, i když v prohlížeči „funguje".
  3. Doplňte JSON-LD pro produkt a organizaci. Cena, dostupnost a identita jsou přesně to, co si model jinak domýšlí.
  4. Opravte canonical a H1 dřív než cokoliv okolo AI. Bez základů se nic dalšího nechytí.
  5. Vědomě rozhodněte o ochraně proti botům. Ochrana i viditelnost jsou legitimní volby; nevědomost není.

Pokud tohle chcete mít zkontrolované a nastavené na svém webu, přesně to řeším v SEO péči a auditech a u e-shopů v rámci e-shopu na míru.

Nejčastější otázky

Kolik českých e-shopů blokuje AI crawlery?

Ve vzorku 30 domén (25 s čitelným robots.txt) blokují aspoň jednoho AI crawlera úplně dva e-shopy. Nějaké pravidlo pro AI agenty má v robots.txt pět z nich. Zbylých dvacet je nezmiňuje vůbec, což v praxi znamená přístup povolen.

Má smysl mít llms.txt?

Zatím spíš jako pořádek než jako výnos. Veřejné analýzy nenašly souvislost mezi jeho existencí a citovaností v AI výsledcích a Google jeho podporu odmítl. Pokud ho ale máte, musí to být skutečný textový soubor, v tomhle měření byla polovina nalezených llms.txt ve skutečnosti HTML stránka.

Jak poznám, že můj llms.txt nebo robots.txt vrací HTML?

Otevřete soubor a podívejte se na Content-Type v odpovědi serveru, má být text/plain. Rychlá kontrola z příkazové řádky: curl -sI https://vasedomena.cz/llms.txt. Status 200 sám o sobě nic nedokazuje; stránka aplikace ho vrátí taky.

Které JSON-LD typy má e-shop mít?

Minimálně Organization (identita firmy), WebSite (web jako celek), Product s cenou a dostupností na produktových stránkách a BreadcrumbList pro navigační cestu. FAQPage tam, kde reálně odpovídáte na otázky. V měřeném vzorku mělo Product na homepage jen 3 z 23 e-shopů.

Je vzorek 30 e-shopů reprezentativní?

Není a netvrdím to. Jde o účelový výběr známých českých e-shopů napříč obory. Čísla popisují tenhle vzorek, jsou dobrým vodítkem o stavu trhu, ale ne statistickým odhadem pro všechny české e-shopy. Proto zveřejňuju metodiku i agregovaný dataset, čísla si lze ověřit a měření zopakovat stejným postupem na vlastním vzorku (dataset záměrně neobsahuje názvy domén).

Zdroje a odkazy

Další krok

Líbil se vám tento článek?

Pokud hledáte kvalitní web nebo e-shop, který skutečně funguje, pojďme si promluvit.

Bez závazkuOdhad do 24 h