Kdy robots.txt nestačí: roboti vyvolaní uživatelem
U části AI robotů nemusí robots.txt zabrat. Nejsou to crawlery, které si procházejí web — je to požadavek, který vznikl z konkrétní otázky konkrétního člověka v konverzaci. A tři velcí provozovatelé to mají takhle popsané ve své dokumentaci.
| Provozovatel | Robot | Co dokumentace říká | Co z toho plyne |
|---|---|---|---|
| OpenAI | ChatGPT-User | akci vyvolal uživatel, proto pravidla robots.txt nemusí platit | pravidlo v robots.txt tenhle provoz nezastaví jistě |
| devět fetcherů | o stažení požádal uživatel, proto obvykle ignorují robots.txt | totéž, o něco silněji řečeno | |
| Perplexity | Perplexity-User | o stažení požádal uživatel, proto obvykle ignoruje robots.txt | totéž |
Citace jsou z oficiální dokumentace, čteno 12. srpna 2026, v mém překladu. OpenAI to píše slaběji („nemusí platit“) než Google a Perplexity („obvykle ignorují“), ale pro provoz webu z toho plyne totéž: na tuhle vrstvu se nedá spolehnout. Anthropic to má jinak: u Claude-User uvádí, že robots.txt respektuje (dokumentace aktualizovaná 7. 4. 2026, čteno 13. 9. 2026).
Co s tím na svém webu udělat
Rozhodovat se dá ve třech krocích. Bez prvního nemá smysl dělat druhý.
- Zjistěte, jestli ten provoz vůbec máte. V logu serveru si vyfiltrujte
ChatGPT-User,Perplexity-UseraGoogle-Agent. U hodně webů to budou jednotky požadavků měsíčně a je hotovo. - Rozhodněte, co je pro vás horší. Přes tyhle roboty chodí obsah k člověku, který se na vás zrovna ptá. Blokace ušetří obsah, ale může znamenat i konec těch návštěv. Odhad hodnoty takové návštěvy má samostatný článek.
- Teprve pak zasáhněte — a na serveru. V robots.txt to podle dokumentace nedořešíte.
Když se rozhodnete omezovat
- Nespoléhat na samotný user agent jde podvrhnout — Google to u téhle kategorie sám píše. Spolehlivější je ověření podle IP a reverzního DNS tam, kde provozovatel rozsahy publikuje.
- Blokovat úzce, ne plošně špatně napsané pravidlo odřízne i běžné návštěvníky. Pište pravidlo na konkrétní user agent, ne na vzor, který sedne na půlku internetu.
- Po nasazení se podívat do logů za týden zkontrolujte, koho jste vlastně zablokovali. Tohle je jediný způsob, jak poznat, že pravidlo bere víc, než mělo.
- Nechat robots.txt tak jak je pravidlo pro fetcher tam neškodí, jen na něj nespoléhejte jako na jistotu.
- Zapsat si datum a důvod seznamy user agentů se mění a za rok už nikdo nebude vědět, proč to pravidlo vzniklo.
Jak ověřit robota podle IP a reverzního DNS, rozebírá ověřování AI robotů; kdo rozsahy vůbec publikuje a kdo ne, samostatný článek.
Kterých robotů se to týká
U OpenAI je to ChatGPT-User, u Perplexity Perplexity-User. Google jich do téhle kategorie řadí devět:
Google-CWS · FeedFetcher-Google · Google-GeminiNotebook · Google-Agent · GoogleMessages · Google-Pinpoint · GoogleProducer · Google-Read-Aloud · Google-Site-Verification
Důležité je, že sem patří i Google-Agent a Google-GeminiNotebook. Když se tedy bavíme o agentech, kteří chodí na weby za uživatele, bavíme se o provozu, u kterého robots.txt podle dokumentace neplatí spolehlivě.
Kolik českých webů to řeší
Ze stejného měření 80 domén z 12. srpna 2026:
| Robot | Pravidlo má |
|---|---|
| GPTBot (automatický) | 12 z 80 |
| Google-Extended (automatický) | 10 z 80 |
| PerplexityBot (automatický) | 9 z 80 |
| ChatGPT-User (vyvolaný uživatelem) | 5 z 80 |
| OAI-SearchBot (automatický) | 4 z 80 |
| Perplexity-User (vyvolaný uživatelem) | 3 z 80 |
| kterýkoli z devíti fetcherů Googlu | 0 z 80 |
Věta, kterou si z toho odnést: pokud máte v robots.txt jen GPTBota nebo Google-Extended, roboty vyvolané uživatelem tím neřešíte. Všech pět webů s pravidlem pro ChatGPT-User ho má jako přídavek k blokaci tréninku, ne samostatně.
Tři chyby, které se u toho dělají
Považovat robots.txt za hranici, kterou nikdo nepřekročí
U celé jedné kategorie robotů podle dokumentace nejde o spolehlivou řídicí vrstvu.
Mluvit o porušování pravidel
Provozovatelé to popisují předem. Kdo tvrdí, že roboti robots.txt porušují, míchá dvě různé věci.
Blokovat jako první krok
Chodí přes ně lidé, které k vám poslala AI odpověď. Blokace je legitimní volba, ale má cenu.
Limity
- Je to čtení dokumentace k 12. srpnu 2026 (údaj o Anthropicu k 13. září 2026), ne měření chování. Netestoval jsem, jestli se roboti podle svých pravidel řídí — ani jedním směrem.
- Vlastní čísla jsou z jednoho odečtu robots.txt na nenáhodném vzorku 80 domén (33 médií, 47 e-shopů z jedné platformy).
- Seznamy user agentů se mění. I během přípravy tohohle článku přibyl v dokumentaci OpenAI čtvrtý agent —
OAI-AdsBot, který ověřuje bezpečnost stránek nabízených jako reklama v ChatGPT. Doplnil jsem ho do tabulky v článku o opt-outech, kde jsem do té doby psal, že roboti OpenAI jsou tři.
Shrnutí
OpenAI, Google i Perplexity popisují kategorii robotů vyvolaných uživatelem, u které robots.txt podle jejich dokumentace není spolehlivá řídicí vrstva. Google do ní řadí i agentní použití.
Ve vzorku 80 českých webů má pravidlo pro ChatGPT-User pět z nich a pro fetchery Googlu nikdo. Kdo po zvážení dopadů chce tenhle provoz omezovat, musí to řešit na serveru — a nejdřív se podívat do logu, jestli ho vůbec má.