V měření Shoptetu jsem stáhl homepage 47 e-shopů pod jmény pěti AI robotů. Všech 47 vrátilo odpověď 200 — přestože moje veřejná IP nepatří do žádného oficiálního rozsahu těch provozovatelů. Ověřil jsem si to.
Šlo přitom o jeden běžný požadavek na homepage, bez obcházení ochran a bez zátěže; testoval jsem jen to, jestli web identitu robota vůbec nějak kontroluje. Nekontroloval ji nikdo.
Tady na to navazuju praktickou otázkou: jak se identita AI robota ověřuje doopravdy. Porovnal jsem oficiální seznamy IP rozsahů pěti provozovatelů, kteří je publikují — OpenAI, Anthropic, Perplexity, Google a Apple.
Jmenovka není průkaz
User-agent je textový řetězec, který si v požadavku nastaví kdokoli. Napsat do něj „GPTBot“ zabere vteřinu. Blokace podle jména proto zastaví jen toho, kdo se nesnaží — a naopak nezastaví nikoho, kdo se snaží.
Samotný user-agent nestačí. V běžně zdokumentované praxi se ověření opírá hlavně o zdrojovou IP adresu, u Googlu navíc o DNS. Jméno robota berte jako nápovědu, který seznam otevřít — ne jako důkaz.
Provozovatelé kvůli tomu zveřejňují seznamy svých rozsahů. Vzal jsem všechny oficiální soubory těch pěti, které v článku srovnávám, a změřil, co v nich je.
Co jsem naměřil
Odečet z 8. srpna 2026, deset oficiálních souborů. Pro praxi jsou z toho podstatné tři věci: kdo publikuje IPv6, jak staré ty soubory jsou a jak široký prostor mají roboti vyvolaní uživatelem.
| Robot / zdroj | Prefixů | z toho IPv6 | Datum v souboru |
|---|---|---|---|
| GPTBot (OpenAI) | 21 | 0 | 30. 10. 2025 |
| OAI-SearchBot (OpenAI) | 35 | 0 | 2. 1. 2026 |
| ChatGPT-User (OpenAI) | 258 | 0 | 7. 8. 2026 |
| ClaudeBot a spol. (Anthropic) | 20 | 0 | 1. 5. 2026 |
| PerplexityBot | 8 | 0 | 7. 2. 2025 |
| Perplexity-User | 4 | 0 | 17. 10. 2025 |
| Googlebot | 315 | 146 | 7. 8. 2026 |
| Google special-crawlers | 270 | 135 | 7. 8. 2026 |
| Google user-triggered-fetchers | 1 056 | 528 | 7. 8. 2026 |
| Applebot | 12 | 0 | 27. 10. 2023 |
Tři věci na téhle tabulce stojí za pozornost.
IPv6 má z téhle pětice jen Google. Ostatní čtyři mají seznamy čistě IPv4. Pokud vám robot přijde přes IPv6, proti těmhle souborům ho nejspíš neověříte. Neznamená to, že přes IPv6 nechodí — znamená to, že v seznamu ho nenajdete.
(V širším měření z 11. srpna se objevil ještě jeden IPv6 prefix u CCBotu. Formulace „IPv6 zveřejňuje jen Google“, kterou tu bylo napsaná dřív, tedy neplatila.)
Stáří se liší od dne měření po bezmála tři roky. Google i ChatGPT-User měly datum z téhož dne, kdy jsem měřil. Soubor PerplexityBota nesl únor 2025 a Applebota říjen 2023. Nedělám z toho závěr o kvalitě provozovatele — starý soubor může znamenat i stabilní rozsahy.
Rozdíl mezi procházením a načtením na žádost uživatele je obrovský. GPTBot má 21 prefixů, ChatGPT-User 258. U Googlu 315 proti 1 056. V publikovaných seznamech mají tedy roboti vyvolaní uživatelem výrazně širší adresní prostor — reálný provoz z těch rozsahů jsem ale netestoval.
Pětice provozovatelů v tabulce není totožná s pěticí user-agentů z předchozího testu: Common Crawl jsem tehdy do srovnání nezařadil a Apple naopak v testu user-agentů nebyl, ale rozsahy publikuje.
Jak ověření probíhá
Máte IP adresu z logu. Postup je pět kroků:
- podle user-agentu si vytipujete provozovatele (jméno je nápověda, ne důkaz),
- v jeho dokumentaci najdete oficiální seznam rozsahů,
- ověříte, jestli adresa patří do některého prefixu,
- zkontrolujete datum v souboru,
- u Googlu můžete výsledek potvrdit ještě reverzním a zpětným DNS.
Kroky ale neplatí pro všechny stejně: se seznamem rozsahů pracujete u všech pěti, s DNS podle dokumentace u Googlu.
Porovnání se seznamem rozsahů. Vezmete soubor provozovatele a zjistíte, jestli adresa do některého prefixu patří. Funguje u všech pěti, jen si musíte pohlídat, že máte aktuální soubor a že vám adresa nepřišla přes IPv6.
Reverzní a zpětný DNS. Google to dokumentuje jako ruční metodu: reverzní dotaz na IP musí vrátit doménu googlebot.com, google.com nebo googleusercontent.com, a zpětný dotaz na tu doménu musí vrátit tutéž IP. Dvoukrokové ověření je důležité — samotný reverzní záznam si může nastavit majitel adresy.
Ověřování a blokování nejsou totéž
Tady je rozdíl, který se často slévá. Ověřit při čtení logu, jestli adresa spadá do zveřejněného rozsahu, dává smysl — bez toho čísla v logu nic neznamenají. Neplyne z toho ale, že podle téže adresy máte i blokovat.
Blokovat podle IP je jiné rozhodnutí. Anthropic v nápovědě upozorňuje, že blokování podle adresy nemusí fungovat spolehlivě, protože robotovi zabrání i v načtení robots.txt — tedy vašeho vlastního pokynu, kterým mu chcete něco sdělit. Zablokovaná adresa neuslyší ani „nechoď sem“.
Blokovat podle jména v user-agentu
Zastaví jen toho, kdo se nesnaží. Sám jsem z běžné IP poslal požadavky pod jmény pěti AI robotů a odpověď 200 dostal od 47 webů ze 47.
Považovat IP mimo seznam za důkaz podvrhu
Seznam může být neúplný nebo starý. Ve vzorku byl soubor z října 2023 i soubor aktualizovaný týž den. Je to důvod k opatrnosti, ne verdikt.
Zaměnit ověření za blokaci
Ověřovat má smysl vždy. Blokovat podle IP je rozhodnutí s vedlejším účinkem — robot pak nepřečte ani váš robots.txt.
Postup, když v logu uvidíte AI robota
- Pro ověření berte IP, ne samotné jméno User-agent je jen řetězec. Pro ověření rozhoduje adresa, ze které požadavek přišel.
- Najděte oficiální seznam v dokumentaci provozovatele Adresu nehádejte podle domény — u Anthropiku je soubor na claude.com, ne na anthropic.com.
- Porovnejte adresu s prefixy v souboru A zkontrolujte datum v souboru. Ve vzorku byly rozdíly v řádu let.
- U Googlu můžete použít reverzní a zpětný DNS Reverzní dotaz musí vrátit googlebot.com, google.com nebo googleusercontent.com a zpětný tutéž IP.
- U adresy IPv6 počítejte s tím, že ji nejspíš nedohledáte IPv6 prefixy měly v tomhle měření jen soubory Googlu; v širším vzorku k nim přibyl jediný prefix u CCBotu.
Kam to zapadá
Závěr je prostý: jméno robota berte jako tvrzení, IP adresu jako první ověřitelnou stopu.
Tenhle článek uzavírá limit, který jsem si sám přiznal v měření robots.txt na Shoptetu. Jména robotů, jejich účely a co který znamená, rozebírá návod na robots.txt pro AI. Řízení přístupu na úrovni CDN řeší Cloudflare a AI bot blocking a zátěž, kterou roboti dělají, AI roboti a zátěž webu.