Přeskočit na obsah

Kdo z provozovatelů AI robotů publikuje IP rozsahy

Prošel jsem 13 provozovatelů. U osmi jsem našel strojově čitelný soubor, u Amazonu HTML stránku, u čtyř nic. Stáří se liší skoro o tři roky.

~1 200 slov 6 častých otázek ~6 minut čtení Aktualizováno: 13. 9. 2026
Kdo z provozovatelů AI robotů publikuje IP rozsahy
Stručná odpověď

Strojově čitelný seznam IP rozsahů jsem našel u osmi provozovatelů ve třinácti souborech: Google, OpenAI, Anthropic, Perplexity, Apple, Microsoft, Common Crawl a DuckDuckGo. Amazon adresy publikuje taky, ale jako HTML stránku. U ByteDance, Mety, Mistralu a Cohere jsem seznam nenašel. Data v souborech jsou stará od nuly do 1 019 dní.

Kdo z provozovatelů AI robotů publikuje IP rozsahy

Jméno robota v hlavičce je jen tvrzení — ověřil jsem si to tím, že jsem z běžné adresy prošel pod cizími jmény 47 weby ze 47. Pro správce cizího webu vede nejběžnější použitelná cesta přes seznam IP rozsahů od provozovatele.

Tak jsem si prošel třináct provozovatelů a osmnáct kandidátních adres a zjišťoval, kdo takový seznam vůbec dává. Osm ho má ve strojově čitelné podobě, Amazon jako stránku v dokumentaci — a u čtyř jsem žádný seznam nenašel.

Co jsem našel

Odečet 11. srpna 2026. Nejdřív ale k tomu, co přesně jsem hledal, protože u článku s touhle pointou na tom záleží.

Sestavil jsem 18 kandidátních adres u 13 provozovatelů. Tam, kde jsem dokumentaci znal z dřívějška, jsem šel na doloženou adresu; u zbytku jsem ji odvodil z konvence ostatních (domena.cz/nazevbota.json). Za nalezený jsem počítal jen ten případ, kdy odpověď byla platný JSON s prefixy uvnitř — ne pouhý kód 200, proč to nestačí. Nenalezený znamená, že jsem na těch adresách takový soubor nedostal; nic víc.

Amazon do těch osmnácti kandidátů v tomhle smyslu nepatřil — jeho stránky jsem našel až dodatečně v dokumentaci a nejsou to strojové soubory. Proto je uvádím zvlášť.

ProvozovatelSouborPrefixůz toho IPv6DatumStáří
Googlevyvolaní uživatelem1 05652811. 8. 20260 dní
DuckDuckGoDuckAssistBot48103. 7. 202639 dní
GoogleGooglebot31514611. 8. 20260 dní
Googlezvláštní roboti27013510. 8. 20261 den
OpenAIChatGPT-User256010. 8. 20261 den
OpenAIOAI-SearchBot3502. 1. 2026221 dní
MicrosoftBingbot2803. 1. 2024951 dní
OpenAIGPTBot21030. 10. 2025285 dní
AnthropicClaudeBot a spol.2001. 5. 2026102 dní
AppleApplebot12027. 10. 20231 019 dní
PerplexityPerplexityBot807. 2. 2025550 dní
Common CrawlCCBot614. 8. 20267 dní
PerplexityPerplexity-User4017. 10. 2025298 dní

Dohromady 2 512 prefixů.

Amazon publikuje. Skoro jsem napsal, že ne

Tohle je hlavní metodické poučení z celého měření a málem mě stálo chybu v článku.

V prvním kole mi u Amazonu vyšlo, že nepublikuje. Hledal jsem totiž soubor .json na adresách, které jsem si odvodil z konvence ostatních — a dostal 404.

Amazon adresy publikuje. Jen je nemá v JSON, ale ve třech běžných stránkách dokumentace:

StránkaCo v ní je
amazonbot/ip-addresses/525 samostatných IP adres
amazonbot/searchbot-ip-addresses/512 zápisů v CIDR
amazonbot/live-ip-addresses/1 024 samostatných IP adres

Tři věci, které z té tabulky vylezou

Stáří se liší o skoro tři roky

Google aktualizoval v den měření, ChatGPT-User den předtím, CCBot týden. Naproti tomu Applebot nese datum z října 2023 — v den měření 1 019 dní — a Bingbot z ledna 2024, tedy 951 dní.

Neznamená to, že jsou ty seznamy špatně; provozovatel je mohl prostě nepotřebovat měnit. Znamená to, že datum si musíte přečíst přímo v souboru, abyste věděli, jak aktuální podklad zrovna používáte.

IPv6 se v těch seznamech skoro nevyskytuje

Ve všech třinácti souborech mají IPv6 prefixy jen tři soubory Googlu — a jediný prefix u CCBotu. Zbytek je čistě IPv4.

Praktický důsledek: když vám robot přijde přes IPv6, proti těmhle seznamům ho mimo Google skoro jistě neověříte.

Roboti vyvolaní uživatelem mají mnohem širší rozsah adres

U Googlu 1 056 prefixů proti 315 u Googlebota. U OpenAI 256 u ChatGPT-User proti 21 u GPTBota. Robot, který jde na web na pokyn uživatele, přichází z podstatně širší sítě než ten, který web systematicky prochází. U ChatGPT-User jde typicky o dotaz v ChatGPT, u Googlu do stejné skupiny patří i roboti pro ověření webu (Google Site Verifier) nebo předčítání stránky (Google Read Aloud).

U koho jsem seznam nenašel

ByteDance, Meta, Mistral a Cohere. U všech čtyř platí, že jsem seznam nenašel — netvrdím, že neexistuje.

Zvlášť stojí za pozornost Meta. V dokumentaci k webovým crawlerům výslovně doporučuje dávat na seznam povolených spíš IP adresy než user-agenty, protože je to bezpečnější. V té dokumentaci ale žádný veřejný seznam adres není a odkazuje se na kontaktní e-mail. Kdo chce to doporučení splnit, podle té dokumentace si o podklad musí napsat.

U ByteDance jsem hledal i v minulém článku — a právě její Bytespider měl v tamním vzorku českých médií pravidlo v robots.txt nejčastěji.

Jak s tím pracovat

Když si chcete robota ověřit

  • Najděte seznam v dokumentaci, ne podle konvence adresa se u provozovatelů liší a formát taky. Amazon má stránky, ostatní JSON.
  • Přečtěte datum uvnitř souboru ať víte, jak aktuální podklad používáte — rozptyl je v tomhle vzorku 1 019 dní.
  • Počítejte s tím, že IPv6 tam nebude mimo Google měl v celém vzorku IPv6 jediný prefix.
  • U robotů bez seznamu nemáte zpětnou kontrolu zbývá user-agent, který si nastaví kdokoli.
  • Stáhněte si soubor znovu, než z něj budete vyvozovat ChatGPT-User měl 8. srpna 256 prefixů po předchozích 258 — mění se to.

Samotný postup ověření krok za krokem rozebírá starší článek.

Limity

Jeden odečet, 11. srpna 2026. Sledoval jsem třináct provozovatelů, ne všechny existující roboty. U čtyř nenalezených jsem zkoušel konvenční adresy a u Mety i dokumentaci — nemůžu vyloučit, že seznam je jinde.

Měřím dostupnost dokumentace, ne provoz: netestoval jsem, jestli roboti z těch rozsahů skutečně chodí. A počty u Amazonu jsou z parsování HTML stránky, ne ze strukturovaného souboru.

Tři chyby, které se u toho nabízejí

Odvodit adresu souboru z konvence a z 404 udělat závěr

Amazon publikuje, jen jinde a jinak. Konvence není dokumentace.

Vzít seznam a nepodívat se na datum

Mezi denní aktualizací a rokem 2023 je v tomhle vzorku rozdíl 1 019 dní.

Čekat, že u IPv6 to bude fungovat stejně

Mimo Google měl IPv6 v celém vzorku jediný prefix.

Shrnutí

Ověřit AI robota proti oficiálnímu seznamu IP jde u osmi provozovatelů rovnou, u Amazonu s ruční prací nad HTML — a u čtyř dalších jsem v tomhle měření použitelný seznam nenašel. Seznamy se liší formátem, rozsahem i stářím: od denní aktualizace po soubor z roku 2023.

Nejužitečnější poučení z celého měření ale není v tabulce: když soubor nenajdete tam, kde ho čekáte, nenašli jste ho — a to je něco jiného než že neexistuje.

Sniper Design
Pomoc s implementací

Nechcete to řešit interně? Postavíme to za vás.

V Sniper Design děláme kompletní AI SEO — strategii, audit, implementaci i obsah. Zlatý partner Upgates i Shoptetu, přes 600 e‑shopů na CZ trhu. Na AI vyhledávání připravujeme návrhy homepage, obsahovou strukturu i audity klientských webů.

  • 600+ e‑shopů
  • Vlastní e‑shop MEGA DETAIL
FAQČasté otázky

Časté otázky, které k tématu nejčastěji padají

U kterých provozovatelů se dá robot ověřit proti seznamu IP?
V měření z 11. 8. 2026 jsem strojově čitelný soubor našel u osmi: Google, OpenAI, Anthropic, Perplexity, Apple, Microsoft, Common Crawl a DuckDuckGo. Amazon adresy publikuje také, ale jako HTML stránku, ne jako JSON.
Proč nestačí hledat soubor podle konvence?
Protože jednotné nejsou ani adresa, ani formát. Často jde o JSON, ale doména se liší (Anthropic ho má na claude.com, ne na anthropic.com) a Amazon má místo souboru běžné stránky v dokumentaci. Kontrola napsaná jen nad JSON tedy Amazon přehlédne — přesně to se mi při měření stalo.
Jak staré ty seznamy jsou?
Velmi různě. Google aktualizoval v den měření, ChatGPT-User den předtím a CCBot týden předtím. Naproti tomu soubor Applebota nese datum z října 2023 a Bingbota z ledna 2024. Datum si vždy přečtěte přímo v souboru.
Dá se robot ověřit, když přijde přes IPv6?
Většinou ne. V celém vzorku měly IPv6 prefixy jen tři soubory Googlu a jeden prefix u CCBotu. U ostatních jsou seznamy čistě IPv4, takže návštěvu přes IPv6 proti nim neporovnáte.
Co když provozovatel seznam nepublikuje?
Pak zbývá user-agent, což je jen tvrzení, které si nastaví kdokoli. U Mety je to zvlášť nepříjemné: dokumentace doporučuje allow-listovat spíš IP adresy než user-agenty, ale veřejný seznam adres v ní není a odkazuje na kontaktní e-mail.
Znamená nenalezený soubor, že neexistuje?
Ne. Znamená to, že jsem ho na dokumentovaných a konvenčních adresách nenašel. U Anthropicu jsem se kdysi takhle spletl a soubor byl jinde, než jsem hledal.
Čtěte dál

Související články

Všechny články v blogu Zpět na úvod