AI roboti a robots.txt: kdo chodí na web a jak ho řídit
Přístup slušných veřejných AI robotů řídíte hlavně přes soubor robots.txt — veřejný textový soubor v kořeni webu, kterým robotům dáváte pravidla pro procházení. Tento návod ukazuje, jak nastavit robots.txt pro AI roboty: kteří roboti se k 13. 9. 2026 v robots.txt běžně řeší, jak je povolit kvůli citacím, jak omezit jejich využití k tréninku a kde robots.txt přestává stačit.
Pozor na záměnu: tohle není o vypínání Google AI Overviews ve výsledcích (to řeší samostatný návod). Tady jde o přístup robotů k webu napříč AI službami.
Které AI crawlery povolit v robots.txt
Krátká odpověď: pokud chcete být citovaní, neblokujte vyhledávací roboty; u tréninkových se rozhodněte podle sebe. Tam, kde provozovatel odděluje tréninkového a vyhledávacího robota (typicky OpenAI a Anthropic), by blokace tréninkového neměla přímo omezit citace. Blokace vyhledávacích robotů naopak tuhle cestu k citacím zavírá: OpenAI píše, že se web pak ve vyhledávání v ChatGPT nezobrazí (zůstat můžou jen navigační odkazy), Anthropic opatrněji, že se viditelnost ve vyhledávání v Claude může snížit.
Není to ale zákon: role robotů jsou takové, jak je popisuje dokumentace jednotlivých provozovatelů, a ti je mohou změnit.
| Kategorie | Konkrétně | Doporučení, pokud chcete být citovaní |
|---|---|---|
| Vyhledávací | OAI-SearchBot, Claude-SearchBot, PerplexityBot (dle deklarace provozovatele) | Povolit. Tohle je obvyklá cesta k novým citacím v AI odpovědích. |
| Na vyžádání | ChatGPT-User, Claude-User | Povolit. Načítají stránku na přímý podnět uživatele. U ChatGPT-User se podle OpenAI robots.txt uplatnit nemusí; Claude-User ho podle Anthropicu respektuje, takže jeho zákaz načítání v Claude opravdu vypne. |
| Tréninkové | GPTBot, ClaudeBot, CCBot | Podle vás. GPTBot a ClaudeBot podle deklarovaných rolí o citacích ve vyhledávání nerozhodují. CCBot plní veřejný archiv Common Crawlu, který může použít kdokoli, i k tréninku; o citacích přímo nerozhoduje. |
| Řídicí tokeny | Google-Extended, Applebot-Extended | Podle vás, u Google-Extended s rozmyslem. Neřídí indexaci ani pozice v běžném vyhledávání. Zákaz Google-Extended ale vyřadí obsah i z použití pro podkládání odpovědí v aplikacích Gemini. |
| Sběrači s nejasným přínosem pro citace | Bytespider, Amazonbot, Meta-ExternalAgent, Diffbot | Zvážit omezení, zvlášť když zatěžují server. Pro některé weby přínos mít můžou — posuďte podle logů. |
Pokud citovatelnost naopak nechcete, platí tabulka obráceně — a pak si přečtěte i část o tom, proč robots.txt sám o sobě nestačí. Zbytek článku vysvětluje, proč to takhle je, jak to zapsat a kde robots.txt přestává stačit. Základní pojmy najdete i ve slovníku — AI crawler a robots.txt.
Kteří AI roboti a řídicí tokeny se v robots.txt řeší
Velcí hráči mají víc robotů s různým účelem — jiný pro trénink, jiný pro vyhledávání, jiný pro načtení stránky, když se na ni uživatel zeptá:
| Robot | Provozovatel | Kategorie | Účel |
|---|---|---|---|
| GPTBot | OpenAI | tréninkový | trénink modelů |
| OAI-SearchBot | OpenAI | vyhledávací | vyhledávání a citace v ChatGPT |
| ChatGPT-User | OpenAI | na vyžádání | načtení stránky na vyžádání uživatele |
| OAI-AdsBot | OpenAI | kontrolní | ověření bezpečnosti stránky nabízené jako reklama v ChatGPT |
| ClaudeBot | Anthropic | tréninkový | trénink modelů |
| Claude-SearchBot | Anthropic | vyhledávací | vyhledávání |
| Claude-User | Anthropic | na vyžádání | načtení na vyžádání; robots.txt podle Anthropicu respektuje |
| PerplexityBot | Perplexity | vyhledávací | procházení pro indexaci a odpovědi (dle dokumentace provozovatele) |
| Perplexity-User | Perplexity | na vyžádání | načtení na dotaz uživatele; robots.txt podle Perplexity obvykle ignoruje |
| Google-Extended | řídicí token | trénink budoucích modelů Gemini a podkládání odpovědí v aplikacích Gemini a ve službě Grounding with Google Search na Vertex AI (ne klasická indexace) | |
| Applebot-Extended | Apple | řídicí token | odhlášení z tréninku generativních modelů Apple; obsah zůstává dohledatelný přes Spotlight, Siri a Safari |
| CCBot | Common Crawl | tréninkový | tvorba veřejného datasetu webu; data mohou být využita i pro trénink modelů |
| Bytespider | ByteDance | sběrač | sběr dat; opakovaně hlášeno nerespektování robots.txt |
| Amazonbot | Amazon | sběrač | procházení pro služby Amazonu; data mohou sloužit i k tréninku AI modelů Amazonu |
| Amzn-SearchBot | Amazon | vyhledávací | procházení pro vyhledávání; podle Amazonu ne pro trénink modelů |
| Amzn-User | Amazon | na vyžádání | akce vyvolané uživatelem; podle Amazonu nemusí dodržet všechna pravidla robots.txt |
| Meta-ExternalAgent | Meta | sběrač | procházení pro trénink AI modelů a zlepšování produktů Meta |
| Seznam-Extended | Seznam | řídicí token | odhlášení ze služby Seznam AI; uvedený v partnerské nápovědě, ne v dokumentaci procházení |
Starší tokeny anthropic-ai a Claude-Web, které se dodnes objevují v šablonách robots.txt, v aktuální dokumentaci Anthropicu nejsou — ta vyjmenovává jen ClaudeBot, Claude-SearchBot a Claude-User. Pravidlo pro starý token tedy nemusí dělat to, co od něj čekáte.
Kategorie i účel v tabulce jsou podle aktuální dokumentace jednotlivých provozovatelů — ti je můžou změnit a názvy přibývají (Diffbot, cohere-ai, YouBot). Počty i názvy se mění, proto aktuální stav vždy ověřte v dokumentaci provozovatele.
Chci zvýšit šanci na citace: pusťte vyhledávací roboty
Pokud chcete zvýšit šanci, že vás AI nástroje najdou a ocitují, nechte projít hlavně vyhledávací roboty. V robots.txt v kořeni webu:
# Vyhledávací roboti: rozhodují o zobrazení ve vyhledávacích odpovědích
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Načtení stránky na přímý dotaz uživatele
# ChatGPT-User podle OpenAI o zobrazení ve vyhledávání nerozhoduje
# a robots.txt se na něj nemusí vztahovat
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
Pokud nemáte jiné blokující pravidlo, Allow: / obvykle nic nemění — robota, kterého nic nezakazuje, pustí i tak. Povolení robotů samo o sobě citace nezajistí; jen odstraňuje technickou překážku, aby se obsah mohl dostat do vyhledávacích a odpovědních vrstev.
⚠️ Pozor, pokud máte v User-agent: * nějaké zákazy. Podle dokumentace Googlu platí pro každého robota jen jedna skupina pravidel — ta s nejspecifičtějším odpovídajícím user-agentem. Vlastní skupina přepíše User-agent: *. Nezdědí ji, nahradí ji. Když tedy robotovi dáte vlastní skupinu jen s Allow: /, můžete mu omylem otevřít i to, co obecná skupina zakazovala — třeba košík nebo interní vyhledávání. Skupina, ve které stojí jen Allow: /, mu tím pádem zruší i zákazy, které pro něj do té doby platily — typicky vyhledávání, košík, přihlášení a filtrované adresy. Pokud vlastní skupinu chcete, zopakujte v ní zákazy, na kterých vám záleží:
User-agent: OAI-SearchBot
Allow: /
Disallow: /vyhledavani/
Disallow: /kosik/
Disallow: /*?order
Tahle vrstva navazuje na SEO pro ChatGPT a patří do širšího AI SEO auditu.
Nechci obsah do tréninku: omezte tréninkové roboty
Pokud chcete dát najevo, že si nepřejete využití obsahu k tréninku modelů, omezte tréninkové roboty (jde o signál pro slušné provozovatele, ne o vynutitelnou záruku):
# Omezit roboty pro trénink modelů
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Pozor na zápis Google-Extended: není to crawler, ale řídicí token — Google ho ale nastavuje právě přes User-agent v robots.txt. A pozor i na dopad: podle Googlu jeho zákaz nevyřadí obsah jen z tréninku, ale i z použití pro podkládání odpovědí v aplikacích Gemini. Ve stejném tvaru funguje i Applebot-Extended (podle dokumentace Applu). Neberte to jako univerzální pravidlo: že má nějaký provozovatel token s příponou „Extended“, neznamená, že ho tak má každý.
Rozlišujte přitom roboty pro trénink a pro vyhledávání: můžete zakázat trénink (GPTBot) a přitom nechat projít vyhledávání (OAI-SearchBot), abyste zůstali citovatelní. Blokace všeho najednou citovatelnost obětuje.
Nejběžnější nastavení celé najednou
Časté výchozí nastavení pro web, který chce zůstat citovatelný a zároveň nedávat obsah do tréninku, vypadá takhle. Nekopírujte ho naslepo: pokud máte v User-agent: * zákazy pro košík, interní vyhledávání nebo filtry, zopakujte je v každé vlastní skupině — jinak je robotům otevřete (viz výš).
# Chci citace, nechci trénink
# vyhledávací a on-demand roboty pustit
# (máte-li obecné zákazy, zopakujte je v každé skupině, např. Disallow: /kosik/)
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
# tréninkové roboty a řídicí tokeny omezit
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
# pozor: zákaz Google-Extended vyřadí obsah i z podkládání odpovědí v aplikacích Gemini
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Tohle je výchozí bod, ne dogma. Chcete-li obsah nechat v podkládání odpovědí v aplikacích Gemini, blok Google-Extended vynechte. Když vám na tréninku nezáleží, spodní blok vynechte — méně pravidel znamená méně věcí, které se rozbijí.
Google-Extended řešte zvlášť
Google-Extended je častý zdroj nedorozumění. Není to klasický indexovací robot, ale řídicí token, kterým podle dokumentace Googlu (aktualizované 14. 7. 2026) řídíte dvě věci: jestli se obsah webu použije k tréninku budoucích modelů Gemini a jestli se použije k podkládání odpovědí (grounding) v aplikacích Gemini a ve službě Grounding with Google Search na Vertex AI. Podle dokumentace jeho blokace neovlivní zařazení do Google Search ani pozice — běžné procházení zajišťuje klasický Googlebot.
Prakticky: Google-Extended můžete zakázat, aniž tím měníte viditelnost ve Vyhledávání Google. Počítejte ale s tím, že tím obsah vyřadíte i z podkládání odpovědí v aplikacích Gemini. A nepleťte si to s Přehledem od AI a s režimem AI: ty patří k Vyhledávání Google, Google-Extended jejich zobrazení neřídí a Google na ně má samostatné nastavení v Search Console.
robots.txt je žádost, ne zámek
Tohle je nejdůležitější věc, kterou si odnést: robots.txt je dobrovolná žádost, ne technická zábrana. Slušní roboti pravidla respektují, ale není to vynutitelné:
- U většiny robotů vyvolaných uživatelem robots.txt podle dokumentace spolehlivě nezabere — ale ne u všech. Když si obsah vyžádá uživatel v konverzaci, nejde o automatické procházení — OpenAI u
ChatGPT-Userpíše, že pravidla „nemusí platit“, Google u devíti svých fetcherů a Perplexity uPerplexity-User, že je „obvykle ignorují“, a Amazon uAmzn-User, že nemusí dodržet všechna pravidla. Není to obcházení pravidla, ale popsané chování: jde o stažení vyvolané konkrétním člověkem, ne o plošné procházení webu, na které robots.txt míří. Prakticky to znamená, že pravidlo proChatGPT-Usertenhle provoz nezastaví jistě — rozebírá to samostatný článek. Anthropic to má opačně: podle jeho dokumentace robots.txt respektují všichni tři jeho roboti včetněClaude-User, takže zákaz mu načítání stránky na dotaz uživatele opravdu vypne. - Někteří roboti pravidla ignorují — u Bytespideru se například opakovaně objevují veřejná hlášení a spory o nerespektování robots.txt. Shodou okolností je to ve vzorku českých médií nejčastěji blokovaný robot.
- Pro tvrdší blokování řešte zásah na serveru, firewallu nebo CDN — jak to vypadá v praxi, rozebíráme u blokování AI robotů přes Cloudflare. Samotný user-agent jde podvrhnout, proto ho kombinujte s ověřením podle IP rozsahů tam, kde je provozovatel publikuje — u části AI robotů to zdokumentované není. K tomu omezení frekvence a sledování logů.
- Nedávejte do robots.txt citlivé nebo neveřejné URL jako náhradu zabezpečení — soubor je veřejný a
Disallownebrání přímému přístupu na stránku.
robots.txt berte jako první vrstvu pro slušné roboty, ne jako záruku.
Co se chystá: robots.txt dostává slovník pro AI
Dnešní stav je provizorium. Každý provozovatel si roboty pojmenoval po svém, vy je musíte vypisovat jménem a při každém novém robotovi soubor dopisovat. Na tom se pracuje.
V IETF běží pracovní skupina AIPREF, která navrhuje slovník pro vyjádření preferencí k využití obsahu AI systémy. Místo výčtu jmen robotů byste vyjádřili záměr. V současném znění draftu se počítá se dvěma kategoriemi (train-ai a search) a hodnotami y nebo n:
Content-Usage: train-ai=n
Draft počítá s tím, že se preference připojí buď HTTP hlavičkou, nebo pravidlem přímo v robots.txt.
Nečeká se na hotový standard. Cloudflare mezitím rozšířil robots.txt o Content Signals — tentýž princip „vyjádři účel, ne jméno robota“ (oddělené preference pro trénink, vyhledávání a AI odpovědi). Podle oznámení Cloudflare ze září 2025 ho ve spravovaném robots.txt mělo zapnutý přes 3,8 milionu domén a firma ho posílá ke standardizaci právě do AIPREF; novější číslo jsme k 13. 9. 2026 nenašli. Pro vás to znamená dvě věci: pokud jste za Cloudflare, možná už signály posíláte, aniž byste o tom věděli. A formát, který se dnes učíte, se může promítnout do výsledku AIPREF; jestli a jak, zatím nevíme. Jména robotů v robots.txt tím ale zatím nenahradíte; funguje to jako doplněk, ne náhrada (stav k září 2026). Na rozdíl od AIPREF to není draft — je to hotová politika Cloudflare s pevnou syntaxí, kterou lze zapsat už dnes; jak přesně, s čím ji zkombinovat a proč se na ni zatím nedá spoléhat, rozebírá samostatný návod o řízení AI robotů přes Content Signals. Souběžně vzniká Web Bot Auth — návrh, aby robot každý požadavek kryptograficky podepisoval. Míří přesně na díru popsanou výš: dnes si do user-agentu může kdokoli napsat cokoli.
Nad tím se rýsuje ještě třetí vrstva: licencování a placený přístup (iniciativy typu RSL nebo pay-per-crawl u Cloudflare). Pro malou a střední českou firmu to zatím nejsou nástroje k použití, spíš signál, kam se to celé posouvá — od „zakaž jménem“ k „vyjádři podmínky“.
Jak ověřit nastavení
Po úpravě robots.txt zkontrolujte:
Kontrola nastavení robots.txt
- Soubor je dostupný otevřete https://vasedomena.cz/robots.txt — musí vracet HTTP 200 a obsahovat vaše pravidla.
- Správná skupina pravidel konkrétní User-agent má u běžných parserů přednost před obecným User-agent: *; chování otestujte.
- Sledujte logy serveru po nasazení ověřte, že se roboti chovají podle očekávání.
- Hlídejte tvrdou blokaci u blokování sledujte odpovědi 403/429 a falešně zablokované roboty.
- Ověřte, že pravidlo pokrývá to, co chcete u OpenAI zkontrolujte pravidla zvlášť pro trénink (GPTBot) a zvlášť pro zobrazení ve vyhledávání v ChatGPT (OAI-SearchBot); u Anthropicu zvlášť ClaudeBot (trénink), Claude-SearchBot (vyhledávání) a Claude-User (načtení na dotaz). Starší tokeny anthropic-ai a Claude-Web v aktuální dokumentaci Anthropicu nejsou.
- Připište si k pravidlům datum a důvod seznamy user-agentů se mění a za rok už nikdo nebude vědět, proč tam ten řádek je.
A co llms.txt? Přístup neřídí
Často se zmiňuje soubor llms.txt. Berte ho s rezervou: je to návrh formátu, který popisuje obsah webu pro AI, ne nástroj na řízení přístupu. Podle dostupných informací ho velcí roboti k roku 2026 spolehlivě nepoužívají. Pro řízení přístupu se proto spoléhejte na robots.txt a server, ne na llms.txt.
Jak je rozšířený, se navíc špatně měří: ve vzorku 80 českých domén vrátí /llms.txt kód 200 u 52 z nich, ale neprázdný textový obsah mají tři. Zbytek jsou HTML stránky vrácené omylem a prázdné soubory od platformy. Je to orientační kontrola adresy, ne audit implementace.
Časté chyby — a jak je opravit
Zablokovat všechny AI roboty
Plošná blokace obětuje i roboty pro vyhledávání, takže si tím výrazně snížíte šanci na nové citace přes tuhle cestu.
Řešení: Pusťte aspoň vyhledávací roboty.
Blokovat Google-Extended kvůli pozicím
Google-Extended řídí trénink modelů Gemini a podkládání odpovědí v aplikacích Gemini, ne běžné vyhledávání.
Řešení: Na pozice v Google Search nemá vliv.
Spoléhat na robots.txt jako na zámek
Neslušné roboty robots.txt nezastaví.
Řešení: Tvrdé blokování řešte na serveru nebo firewallu.
Brát llms.txt jako řízení přístupu
llms.txt není nástroj na blokování.
Řešení: Na blokování použijte robots.txt a server.
Kam dál podle toho, co řešíte
| Váš úkol | Kde je odpověď |
|---|---|
| Chci pochopit, co které nastavení podle dokumentace vypne | Co vypne který opt-out |
| Zajímá mě, co si nastavují ostatní české weby | Měření 80 domén |
| Řeším roboty, na které robots.txt neplatí | Roboti vyvolaní uživatelem |
| Chci ověřit, že robot je opravdu ten pravý | Ověřování AI robotů · kdo publikuje IP rozsahy |
| Chci roboty opravdu zastavit | Blokování přes Cloudflare |
| Řeším český opt-out | Seznam-Extended |
| Zajímá mě zátěž od robotů | Zátěž webu od AI robotů |
Co dál: nastavte to v rámci celého webu
Přístup robotů je jen jedna vrstva AI viditelnosti. Jak na ni navázat strukturou, strukturovanými daty a citovatelným obsahem, shrnuje praktický checklist SEO pro AI.
Když to chcete převést na konkrétní šablony pro celý web, pomůže AI SEO Wireframe Pack za 1 490 Kč. Pokud chcete přístup robotů i zbytek webu prověřit na míru, dává smysl AI SEO audit za 3 600 Kč.
Zdroje k rolím robotů: Anthropic — Does Anthropic crawl data from the web (aktualizováno 7. 4. 2026) · OpenAI — Overview of OpenAI crawlers · Google — Google’s common crawlers (aktualizováno 14. 7. 2026) a user-triggered fetchers (aktualizováno 19. 8. 2026) · Perplexity — crawlers · Apple — About Applebot · Amazon — About Amazonbot · Meta — Web crawlers · Common Crawl — CCBot. Ověřeno 13. 9. 2026.