Ve vzorku 33 českých médií nevede GPTBot, ale Bytespider
Stáhl jsem robots.txt třiatřiceti českých zpravodajských a oborových webů a spočítal, pro které AI roboty tam mají pravidla. Čekal jsem, že povede GPTBot. Nevede.
Nejčastěji je v souborech Bytespider — crawler ByteDance, firmy za TikTokem. A na rozdíl od OpenAI, Anthropicu, Perplexity, Googlu a Applu jsem u jeho provozovatele nenašel veřejný oficiální seznam IP rozsahů, proti kterému by šlo adresu z logu porovnat.
Co v těch souborech je
Soubory jsem stáhl 9. srpna 2026 (33 ze 33); 10. srpna jsem k tomu doověřoval jen dostupnost dokumentace provozovatelů.
| Robot | Na kolika webech z 33 |
|---|---|
| Bytespider | 13 |
| GPTBot | 11 |
| Amazonbot | 11 |
| ClaudeBot | 10 |
| Google-Extended | 9 |
| PerplexityBot | 8 |
| anthropic-ai | 6 |
| CCBot | 6 |
| Claude-Web | 6 |
| Applebot-Extended | 5 |
Vedle toho: 17 webů ze 33 nemá pravidlo pro žádného ze sledovaných AI robotů, zatímco devět jich ošetřuje šest a víc naráz. Rozdělení je tedy dost vyhraněné — buď se tím někdo zabýval pořádně, nebo vůbec.
V praxi se přitom mluví hlavně o GPTBotu. V mém vzorku ho o dva weby předstihl robot, o kterém je slyšet podstatně míň.
Proč je to zvláštní
U většiny robotů z té tabulky víte, co za nimi stojí a k čemu slouží. PerplexityBot obsluhuje vyhledávání Perplexity, kde vás odpověď může citovat a poslat vám návštěvníka. GPTBot a ClaudeBot sbírají data pro trénink modelů. O citacích ve vyhledávání ChatGPT a v Claude rozhodují jiní roboti (OAI-SearchBot, Claude-SearchBot a Claude-User, který stránku načte na dotaz uživatele), kteří v tabulce nejsou. Google-Extended řídí trénink Gemini a podkládání odpovědí v aplikacích Gemini, ne Vyhledávání Google; Applebot-Extended odhlašuje obsah z tréninku modelů Apple.
U Bytespidera jsem veřejně nenašel ani stejně přímé podklady k ověření identity, ani zjevnou plochu, kde by vás na oplátku citoval a odkázal — což neznamená, že neexistují.
Jedna možná interpretace toho pořadí je, že u něj část provozovatelů nevidí zjevnou protihodnotu v podobě citací nebo přivedené návštěvnosti. Netestoval jsem to a netvrdím, že je Bytespider škodlivější než ostatní — jen že v tomhle srovnání u něj nevidím stejnou ověřitelnost identity.
Zajímavější než motivace je stejně otázka, co to pravidlo vlastně dokáže.
Ověřitelnost: pět provozovatelů ano, ByteDance jsem nenašel
Když jsem v srpnovém měření procházel oficiální seznamy IP rozsahů, našel jsem deset souborů u pěti provozovatelů. Přeověřil jsem je 10. 8. a všechny pořád odpovídají:
| Provozovatel | Kde je seznam |
|---|---|
| OpenAI | openai.com/gptbot.json |
| Anthropic | claude.com/crawling/bots.json |
| Perplexity | perplexity.ai/perplexitybot.json |
| soubor v dokumentaci pro vývojáře | |
| Apple | search.developer.apple.com/applebot.json |
U ByteDance jsem obdobný soubor nenašel. Zkusil jsem bytedance.com/en/bots.json, bytedance.com/bytespider.json, developer.bytedance.com/bytespider, tiktok.com/bots.json i bytespider.bytedance.com. Nenašel jsem ani oficiální stránku ByteDance k tomuhle robotovi — všechno, co k němu veřejně je, pochází od třetích stran: databází botů, bezpečnostních dodavatelů a blogů.
Drobnost, na které jsem se skoro spálil
https://www.bytedance.com/en/bots.json vrací HTTP 200. Kdybych se spolehl na stavový kód, napsal bych, že soubor existuje.
V hlavičkách je ale Content-Type: text/html a v těle běžná HTML stránka. Web vrací 200 na libovolnou cestu, takže stavový kód sám o sobě není doklad, že soubor existuje. Platí to i pro llms.txt, ověřovací soubory a sitemapy — kontrolujte typ obsahu a to, co v souboru doopravdy je.
Co se o Bytespiderovi říká a co jsem netestoval
Napříč zdroji třetích stran se opakují dvě tvrzení:
- že Bytespider nerespektuje
Disallow, s odkazem na rozbory přístupových logů z roku 2023, - že jeho podíl na provozu AI crawlerů v poslední době výrazně vzrostl.
Ani jedno jsem neověřoval a nepodávám to jako fakt. Uvádím to, protože to je kontext, ve kterém se čtenář rozhoduje — ale mezi „opakuje se to“ a „změřil jsem to“ je rozdíl, který se v tomhle oboru ztrácí až moc často. Ověřit první tvrzení by šlo jedině na vlastním serveru s přístupem k logům, což je na samostatné měření.
Co z toho plyne prakticky
Pravidlo v robots.txt na jméno robota je srozumitelně vyjádřené přání. U robotů s publikovanými rozsahy si navíc můžete v logu ověřit, jestli návštěva odpovídá tomu, za koho se vydává. U Bytespidera tuhle druhou půlku nemáte.
Připomínám k tomu vlastní test: v měření na 47 e-shopech jsem z běžné IP poslal požadavky pod jmény pěti AI robotů a odpověď 200 mi vrátilo 47 webů ze 47. Jméno v hlavičce si nastaví kdokoli.
Když Bytespider řešíte
- Vězte, co to pravidlo je vyjádřené přání a doklad, že jste ho vyjádřili — ne technické vynucení.
- Nezaměňujte s odhlášením z citací u robotů, které vás citují, znamená zákaz i ztrátu odkazů. Tady jsem plochu, kde by citoval, nenašel.
- Skupinu pište samostatně skupina pro konkrétního robota nahrazuje skupinu User-agent: *, nesčítá se s ní.
- Chcete-li jistotu, řešte to o patro níž vynucení je věc serveru nebo firewallu, ne textového souboru. To už je ale práce pro správce.
- Zapište si datum a důvod za rok nikdo nebude vědět, proč tam ten řádek je.
Zápis vypadá takhle:
User-agent: Bytespider
Disallow: /
Jak se skupiny v robots.txt chovají a proč se nesčítají, rozebírá návod na robots.txt pro AI roboty.
Limity tohohle měření
Oprava k 12. 8. 2026: v tabulce výš stálo u Claude-Web číslo 5, správně je 6 — chyba vznikla u mě při přepisu z naměřených dat, samotné měření bylo v pořádku. Ostatních devět hodnot jsem přeověřil a sedí.
Jeden odečet robots.txt proběhl 9. srpna 2026; 10. srpna jsem už jen doověřoval dokumentaci provozovatelů. Vzorek 33 médií není náhodný výběr, je to ruční seznam známých českých zpravodajských a oborových webů; jednotlivé weby nejmenuju.
Měřím konfiguraci v robots.txt, ne chování robotů. Netestoval jsem, jestli je kdokoli z nich dodržuje — ani Bytespider, ani ostatní.
A ověřoval jsem dostupnost seznamů IP jen u šesti provozovatelů. O Amazonbotu, CCBotu a dalších z tabulky tenhle článek neříká nic.
Tři chyby, které se u toho nabízejí
Brát pravidlo v robots.txt jako zámek
Je to žádost. U robota, u kterého nemáte veřejný seznam rozsahů, je to navíc žádost bez zpětné kontroly.
Usoudit z HTTP 200, že soubor existuje
Web může vracet 200 s HTML na libovolnou cestu. Kontrolujte Content-Type a obsah.
Přebírat „robot ignoruje robots.txt“ jako fakt
Je to opakované tvrzení třetích stran s kořeny v roce 2023. Já ho neověřoval a neopakuju jako svoje.
Shrnutí
V robots.txt třiatřiceti českých médií je nejčastěji Bytespider — na třinácti webech, o dva víc než GPTBot. Zároveň jsem ze šesti prověřovaných provozovatelů jen u ByteDance nenašel veřejný oficiální seznam IP rozsahů, tedy to, proti čemu si adresu z logu porovnávám u ostatních.
Rozhodnutí je pak celkem přímočaré: pokud vám jde o deklaraci vůle, pravidlo pro Bytespider smysl má. Pokud vám jde o vynucení nebo auditovatelnou identitu návštěv, samotné robots.txt na to nestačí u nikoho — a u něj chybí i to zpětné ověření.
Jak se identita robota ověřuje u těch ostatních, rozebírá ověřování AI robotů. Českou vrstvu odhlášení z AI popisuje Seznam-Extended.