Kdo z provozovatelů AI robotů publikuje IP rozsahy
Jméno robota v hlavičce je jen tvrzení — ověřil jsem si to tím, že jsem z běžné adresy prošel pod cizími jmény 47 weby ze 47. Pro správce cizího webu vede nejběžnější použitelná cesta přes seznam IP rozsahů od provozovatele.
Tak jsem si prošel třináct provozovatelů a osmnáct kandidátních adres a zjišťoval, kdo takový seznam vůbec dává. Osm ho má ve strojově čitelné podobě, Amazon jako stránku v dokumentaci — a u čtyř jsem žádný seznam nenašel.
Co jsem našel
Odečet 11. srpna 2026. Nejdřív ale k tomu, co přesně jsem hledal, protože u článku s touhle pointou na tom záleží.
Sestavil jsem 18 kandidátních adres u 13 provozovatelů. Tam, kde jsem dokumentaci znal z dřívějška, jsem šel na doloženou adresu; u zbytku jsem ji odvodil z konvence ostatních (domena.cz/nazevbota.json). Za nalezený jsem počítal jen ten případ, kdy odpověď byla platný JSON s prefixy uvnitř — ne pouhý kód 200, proč to nestačí. Nenalezený znamená, že jsem na těch adresách takový soubor nedostal; nic víc.
Amazon do těch osmnácti kandidátů v tomhle smyslu nepatřil — jeho stránky jsem našel až dodatečně v dokumentaci a nejsou to strojové soubory. Proto je uvádím zvlášť.
| Provozovatel | Soubor | Prefixů | z toho IPv6 | Datum | Stáří |
|---|---|---|---|---|---|
| vyvolaní uživatelem | 1 056 | 528 | 11. 8. 2026 | 0 dní | |
| DuckDuckGo | DuckAssistBot | 481 | 0 | 3. 7. 2026 | 39 dní |
| Googlebot | 315 | 146 | 11. 8. 2026 | 0 dní | |
| zvláštní roboti | 270 | 135 | 10. 8. 2026 | 1 den | |
| OpenAI | ChatGPT-User | 256 | 0 | 10. 8. 2026 | 1 den |
| OpenAI | OAI-SearchBot | 35 | 0 | 2. 1. 2026 | 221 dní |
| Microsoft | Bingbot | 28 | 0 | 3. 1. 2024 | 951 dní |
| OpenAI | GPTBot | 21 | 0 | 30. 10. 2025 | 285 dní |
| Anthropic | ClaudeBot a spol. | 20 | 0 | 1. 5. 2026 | 102 dní |
| Apple | Applebot | 12 | 0 | 27. 10. 2023 | 1 019 dní |
| Perplexity | PerplexityBot | 8 | 0 | 7. 2. 2025 | 550 dní |
| Common Crawl | CCBot | 6 | 1 | 4. 8. 2026 | 7 dní |
| Perplexity | Perplexity-User | 4 | 0 | 17. 10. 2025 | 298 dní |
Dohromady 2 512 prefixů.
Amazon publikuje. Skoro jsem napsal, že ne
Tohle je hlavní metodické poučení z celého měření a málem mě stálo chybu v článku.
V prvním kole mi u Amazonu vyšlo, že nepublikuje. Hledal jsem totiž soubor .json na adresách, které jsem si odvodil z konvence ostatních — a dostal 404.
Amazon adresy publikuje. Jen je nemá v JSON, ale ve třech běžných stránkách dokumentace:
| Stránka | Co v ní je |
|---|---|
amazonbot/ip-addresses/ | 525 samostatných IP adres |
amazonbot/searchbot-ip-addresses/ | 512 zápisů v CIDR |
amazonbot/live-ip-addresses/ | 1 024 samostatných IP adres |
Tři věci, které z té tabulky vylezou
Stáří se liší o skoro tři roky
Google aktualizoval v den měření, ChatGPT-User den předtím, CCBot týden. Naproti tomu Applebot nese datum z října 2023 — v den měření 1 019 dní — a Bingbot z ledna 2024, tedy 951 dní.
Neznamená to, že jsou ty seznamy špatně; provozovatel je mohl prostě nepotřebovat měnit. Znamená to, že datum si musíte přečíst přímo v souboru, abyste věděli, jak aktuální podklad zrovna používáte.
IPv6 se v těch seznamech skoro nevyskytuje
Ve všech třinácti souborech mají IPv6 prefixy jen tři soubory Googlu — a jediný prefix u CCBotu. Zbytek je čistě IPv4.
Praktický důsledek: když vám robot přijde přes IPv6, proti těmhle seznamům ho mimo Google skoro jistě neověříte.
Roboti vyvolaní uživatelem mají mnohem širší rozsah adres
U Googlu 1 056 prefixů proti 315 u Googlebota. U OpenAI 256 u ChatGPT-User proti 21 u GPTBota. Robot, který jde na web na pokyn uživatele, přichází z podstatně širší sítě než ten, který web systematicky prochází. U ChatGPT-User jde typicky o dotaz v ChatGPT, u Googlu do stejné skupiny patří i roboti pro ověření webu (Google Site Verifier) nebo předčítání stránky (Google Read Aloud).
U koho jsem seznam nenašel
ByteDance, Meta, Mistral a Cohere. U všech čtyř platí, že jsem seznam nenašel — netvrdím, že neexistuje.
Zvlášť stojí za pozornost Meta. V dokumentaci k webovým crawlerům výslovně doporučuje dávat na seznam povolených spíš IP adresy než user-agenty, protože je to bezpečnější. V té dokumentaci ale žádný veřejný seznam adres není a odkazuje se na kontaktní e-mail. Kdo chce to doporučení splnit, podle té dokumentace si o podklad musí napsat.
U ByteDance jsem hledal i v minulém článku — a právě její Bytespider měl v tamním vzorku českých médií pravidlo v robots.txt nejčastěji.
Jak s tím pracovat
Když si chcete robota ověřit
- Najděte seznam v dokumentaci, ne podle konvence adresa se u provozovatelů liší a formát taky. Amazon má stránky, ostatní JSON.
- Přečtěte datum uvnitř souboru ať víte, jak aktuální podklad používáte — rozptyl je v tomhle vzorku 1 019 dní.
- Počítejte s tím, že IPv6 tam nebude mimo Google měl v celém vzorku IPv6 jediný prefix.
- U robotů bez seznamu nemáte zpětnou kontrolu zbývá user-agent, který si nastaví kdokoli.
- Stáhněte si soubor znovu, než z něj budete vyvozovat ChatGPT-User měl 8. srpna 256 prefixů po předchozích 258 — mění se to.
Samotný postup ověření krok za krokem rozebírá starší článek.
Limity
Jeden odečet, 11. srpna 2026. Sledoval jsem třináct provozovatelů, ne všechny existující roboty. U čtyř nenalezených jsem zkoušel konvenční adresy a u Mety i dokumentaci — nemůžu vyloučit, že seznam je jinde.
Měřím dostupnost dokumentace, ne provoz: netestoval jsem, jestli roboti z těch rozsahů skutečně chodí. A počty u Amazonu jsou z parsování HTML stránky, ne ze strukturovaného souboru.
Tři chyby, které se u toho nabízejí
Odvodit adresu souboru z konvence a z 404 udělat závěr
Amazon publikuje, jen jinde a jinak. Konvence není dokumentace.
Vzít seznam a nepodívat se na datum
Mezi denní aktualizací a rokem 2023 je v tomhle vzorku rozdíl 1 019 dní.
Čekat, že u IPv6 to bude fungovat stejně
Mimo Google měl IPv6 v celém vzorku jediný prefix.
Shrnutí
Ověřit AI robota proti oficiálnímu seznamu IP jde u osmi provozovatelů rovnou, u Amazonu s ruční prací nad HTML — a u čtyř dalších jsem v tomhle měření použitelný seznam nenašel. Seznamy se liší formátem, rozsahem i stářím: od denní aktualizace po soubor z roku 2023.
Nejužitečnější poučení z celého měření ale není v tabulce: když soubor nenajdete tam, kde ho čekáte, nenašli jste ho — a to je něco jiného než že neexistuje.