Přeskočit na obsah

Blokujete AI robota podle jména? Ověřil jsem, že to nestačí

Z běžné IP jsem poslal požadavky pod jmény pěti AI robotů a 47 ze 47 webů odpovědělo. Ověřit jde podle IP rozsahů, u Googlu i reverzním DNS.

~1 200 slov 6 častých otázek ~6 minut čtení Aktualizováno: 13. 9. 2026
Blokujete AI robota podle jména? Ověřil jsem, že to nestačí
Stručná odpověď

User-agent si nastaví kdokoli, takže blokovat AI robota podle jména je děravé. Sám jsem z běžné IP, která nepatří do žádného oficiálního rozsahu, poslal požadavky pod jmény pěti AI robotů a všech 47 měřených webů odpovědělo. Ověření se u většiny provozovatelů opírá o seznam jejich IP rozsahů; u Googlu je dokumentovaný i postup přes reverzní a zpětný DNS.

V měření Shoptetu jsem stáhl homepage 47 e-shopů pod jmény pěti AI robotů. Všech 47 vrátilo odpověď 200 — přestože moje veřejná IP nepatří do žádného oficiálního rozsahu těch provozovatelů. Ověřil jsem si to.

Šlo přitom o jeden běžný požadavek na homepage, bez obcházení ochran a bez zátěže; testoval jsem jen to, jestli web identitu robota vůbec nějak kontroluje. Nekontroloval ji nikdo.

Tady na to navazuju praktickou otázkou: jak se identita AI robota ověřuje doopravdy. Porovnal jsem oficiální seznamy IP rozsahů pěti provozovatelů, kteří je publikují — OpenAI, Anthropic, Perplexity, Google a Apple.

Jmenovka není průkaz

User-agent je textový řetězec, který si v požadavku nastaví kdokoli. Napsat do něj „GPTBot“ zabere vteřinu. Blokace podle jména proto zastaví jen toho, kdo se nesnaží — a naopak nezastaví nikoho, kdo se snaží.

Samotný user-agent nestačí. V běžně zdokumentované praxi se ověření opírá hlavně o zdrojovou IP adresu, u Googlu navíc o DNS. Jméno robota berte jako nápovědu, který seznam otevřít — ne jako důkaz.

Provozovatelé kvůli tomu zveřejňují seznamy svých rozsahů. Vzal jsem všechny oficiální soubory těch pěti, které v článku srovnávám, a změřil, co v nich je.

Co jsem naměřil

Odečet z 8. srpna 2026, deset oficiálních souborů. Pro praxi jsou z toho podstatné tři věci: kdo publikuje IPv6, jak staré ty soubory jsou a jak široký prostor mají roboti vyvolaní uživatelem.

Robot / zdrojPrefixůz toho IPv6Datum v souboru
GPTBot (OpenAI)21030. 10. 2025
OAI-SearchBot (OpenAI)3502. 1. 2026
ChatGPT-User (OpenAI)25807. 8. 2026
ClaudeBot a spol. (Anthropic)2001. 5. 2026
PerplexityBot807. 2. 2025
Perplexity-User4017. 10. 2025
Googlebot3151467. 8. 2026
Google special-crawlers2701357. 8. 2026
Google user-triggered-fetchers1 0565287. 8. 2026
Applebot12027. 10. 2023

Tři věci na téhle tabulce stojí za pozornost.

IPv6 má z téhle pětice jen Google. Ostatní čtyři mají seznamy čistě IPv4. Pokud vám robot přijde přes IPv6, proti těmhle souborům ho nejspíš neověříte. Neznamená to, že přes IPv6 nechodí — znamená to, že v seznamu ho nenajdete.

(V širším měření z 11. srpna se objevil ještě jeden IPv6 prefix u CCBotu. Formulace „IPv6 zveřejňuje jen Google“, kterou tu bylo napsaná dřív, tedy neplatila.)

Stáří se liší od dne měření po bezmála tři roky. Google i ChatGPT-User měly datum z téhož dne, kdy jsem měřil. Soubor PerplexityBota nesl únor 2025 a Applebota říjen 2023. Nedělám z toho závěr o kvalitě provozovatele — starý soubor může znamenat i stabilní rozsahy.

Rozdíl mezi procházením a načtením na žádost uživatele je obrovský. GPTBot má 21 prefixů, ChatGPT-User 258. U Googlu 315 proti 1 056. V publikovaných seznamech mají tedy roboti vyvolaní uživatelem výrazně širší adresní prostor — reálný provoz z těch rozsahů jsem ale netestoval.

Pětice provozovatelů v tabulce není totožná s pěticí user-agentů z předchozího testu: Common Crawl jsem tehdy do srovnání nezařadil a Apple naopak v testu user-agentů nebyl, ale rozsahy publikuje.

Jak ověření probíhá

Máte IP adresu z logu. Postup je pět kroků:

  1. podle user-agentu si vytipujete provozovatele (jméno je nápověda, ne důkaz),
  2. v jeho dokumentaci najdete oficiální seznam rozsahů,
  3. ověříte, jestli adresa patří do některého prefixu,
  4. zkontrolujete datum v souboru,
  5. u Googlu můžete výsledek potvrdit ještě reverzním a zpětným DNS.

Kroky ale neplatí pro všechny stejně: se seznamem rozsahů pracujete u všech pěti, s DNS podle dokumentace u Googlu.

Porovnání se seznamem rozsahů. Vezmete soubor provozovatele a zjistíte, jestli adresa do některého prefixu patří. Funguje u všech pěti, jen si musíte pohlídat, že máte aktuální soubor a že vám adresa nepřišla přes IPv6.

Reverzní a zpětný DNS. Google to dokumentuje jako ruční metodu: reverzní dotaz na IP musí vrátit doménu googlebot.com, google.com nebo googleusercontent.com, a zpětný dotaz na tu doménu musí vrátit tutéž IP. Dvoukrokové ověření je důležité — samotný reverzní záznam si může nastavit majitel adresy.

Ověřování a blokování nejsou totéž

Tady je rozdíl, který se často slévá. Ověřit při čtení logu, jestli adresa spadá do zveřejněného rozsahu, dává smysl — bez toho čísla v logu nic neznamenají. Neplyne z toho ale, že podle téže adresy máte i blokovat.

Blokovat podle IP je jiné rozhodnutí. Anthropic v nápovědě upozorňuje, že blokování podle adresy nemusí fungovat spolehlivě, protože robotovi zabrání i v načtení robots.txt — tedy vašeho vlastního pokynu, kterým mu chcete něco sdělit. Zablokovaná adresa neuslyší ani „nechoď sem“.

Blokovat podle jména v user-agentu

Zastaví jen toho, kdo se nesnaží. Sám jsem z běžné IP poslal požadavky pod jmény pěti AI robotů a odpověď 200 dostal od 47 webů ze 47.

Považovat IP mimo seznam za důkaz podvrhu

Seznam může být neúplný nebo starý. Ve vzorku byl soubor z října 2023 i soubor aktualizovaný týž den. Je to důvod k opatrnosti, ne verdikt.

Zaměnit ověření za blokaci

Ověřovat má smysl vždy. Blokovat podle IP je rozhodnutí s vedlejším účinkem — robot pak nepřečte ani váš robots.txt.

Postup, když v logu uvidíte AI robota

  • Pro ověření berte IP, ne samotné jméno User-agent je jen řetězec. Pro ověření rozhoduje adresa, ze které požadavek přišel.
  • Najděte oficiální seznam v dokumentaci provozovatele Adresu nehádejte podle domény — u Anthropiku je soubor na claude.com, ne na anthropic.com.
  • Porovnejte adresu s prefixy v souboru A zkontrolujte datum v souboru. Ve vzorku byly rozdíly v řádu let.
  • U Googlu můžete použít reverzní a zpětný DNS Reverzní dotaz musí vrátit googlebot.com, google.com nebo googleusercontent.com a zpětný tutéž IP.
  • U adresy IPv6 počítejte s tím, že ji nejspíš nedohledáte IPv6 prefixy měly v tomhle měření jen soubory Googlu; v širším vzorku k nim přibyl jediný prefix u CCBotu.

Kam to zapadá

Závěr je prostý: jméno robota berte jako tvrzení, IP adresu jako první ověřitelnou stopu.

Tenhle článek uzavírá limit, který jsem si sám přiznal v měření robots.txt na Shoptetu. Jména robotů, jejich účely a co který znamená, rozebírá návod na robots.txt pro AI. Řízení přístupu na úrovni CDN řeší Cloudflare a AI bot blocking a zátěž, kterou roboti dělají, AI roboti a zátěž webu.

Sniper Design
Pomoc s implementací

Nechcete to řešit interně? Postavíme to za vás.

V Sniper Design děláme kompletní AI SEO — strategii, audit, implementaci i obsah. Zlatý partner Upgates i Shoptetu, přes 600 e‑shopů na CZ trhu. Na AI vyhledávání připravujeme návrhy homepage, obsahovou strukturu i audity klientských webů.

  • 600+ e‑shopů
  • Vlastní e‑shop MEGA DETAIL
FAQČasté otázky

Časté otázky, které k tématu nejčastěji padají

Proč nestačí blokovat podle user-agenta?
Protože je to jen textový řetězec, který si v požadavku nastaví kdokoli. Ověřil jsem si to na sobě: moje veřejná IP nepatří do žádného oficiálního rozsahu žádného z provozovatelů, a přesto jsem pod jmény pěti AI robotů dostal odpověď od všech 47 webů, které jsem měřil. Blokace podle jména zastaví jen toho, kdo se nesnaží.
Kde najdu oficiální seznamy IP rozsahů?
V měření z 8. srpna 2026 jsem pracoval se třemi soubory OpenAI na openai.com: pro GPTBot, OAI-SearchBot a ChatGPT-User. Dokumentace OpenAI k 13. září 2026 uvádí čtyři: vedle těchto tří i soubor pro OAI-AdsBot, který kontroluje bezpečnost stránek, na které vedou reklamy v ChatGPT. V témže měření z 8. srpna měl Anthropic jeden soubor na claude.com, ne na anthropic.com — hledal jsem ho nejdřív podle domény a dostal 404. Perplexity měla dva soubory, Google tři na developers.google.com a Apple jeden. Adresu se nevyplatí hádat; hledejte ji v dokumentaci provozovatele.
Jak ověření prakticky proběhne?
Vezmete IP adresu z logu a porovnáte ji se seznamem rozsahů daného provozovatele; tuhle cestu má všech pět. U Googlu jde navíc ruční postup přes DNS: reverzní dotaz na IP musí vrátit doménu googlebot.com, google.com nebo googleusercontent.com a zpětný dotaz na tu doménu musí vrátit tutéž IP. Anthropic reverzní DNS jako metodu ve své nápovědě neuvádí a odkazuje na seznam IP.
Co když robot přijde přes IPv6?
Většinou ne. V měření z 8. srpna 2026 měly IPv6 prefixy jen soubory Googlu — Googlebot 146, special-crawlers 135 a user-triggered-fetchers 528; OpenAI, Anthropic, Perplexity i Apple měly seznamy čistě IPv4. V širším měření z 11. srpna se ale našel ještě jeden IPv6 prefix u CCBotu, takže „jen Google“ neplatí úplně. Neznamená to, že roboti přes IPv6 nechodí; znamená to, že v seznamu je nenajdete.
Znamená IP mimo seznam, že jde o podvrh?
Nutně ne. Seznam může být neúplný nebo zastaralý — a stáří se mezi provozovateli liší v řádu let. Soubor Perplexity nesl datum z února 2025 a Applebot z října 2023, zatímco Google a ChatGPT-User byly z téhož dne, kdy jsem měřil. IP mimo seznam je důvod k opatrnosti, ne důkaz.
Má smysl blokovat AI roboty podle IP?
Anthropic ve své nápovědě upozorňuje, že blokování podle IP nemusí fungovat spolehlivě, protože robotovi zabrání i v načtení robots.txt, tedy vašeho vlastního pokynu. Ověřování podle IP a blokování podle IP jsou dvě různé věci: první dává smysl vždy, druhé zvažte.
Čtěte dál

Související články

Všechny články v blogu Zpět na úvod