Kdo má v robots.txt GPTBota, většinou nemá OAI-SearchBota
Včera jsem prošel dokumentaci sedmi nastavení a zjistil, co který příkaz podle provozovatelů dělá. Dneska jsem stáhl robots.txt osmdesáti českých webů a podíval se, co je v nich reálně nasazené.
Nejdůležitější věta předem: máte-li v robots.txt jen GPTBota, řešíte podle dokumentace OpenAI trénink, ne zobrazení ve výsledcích vyhledávání v ChatGPT. Na to je samostatný OAI-SearchBot — a ten má ve vzorku jen třetina z těch, kdo mají pravidlo pro GPTBota.
| Kombinace u OpenAI | Počet z 80 |
|---|---|
| jen GPTBot — podle dokumentace trénink | 8 |
| oba | 4 |
| jen OAI-SearchBot — podle dokumentace zobrazení | 0 |
| ani jeden | 68 |
Pravidlo pro GPTBota má dvanáct webů. Jen čtyři z nich mají i OAI-SearchBota.
Roboti OpenAI a jejich různé dopady
Podle dokumentace OpenAI:
| Robot | Co podle dokumentace ovlivňuje |
|---|---|
| GPTBot | použití obsahu k tréninku modelů |
| OAI-SearchBot | zobrazení ve výsledcích vyhledávání v ChatGPT |
| ChatGPT-User | načtení stránky, o kterou si řekne uživatel v konverzaci |
| OAI-AdsBot | ověření bezpečnosti stránky nabízené jako reklama v ChatGPT |
Oprava k 12. 8. 2026: tenhle nadpis původně zněl „Tři roboti OpenAI“ a tabulka měla tři řádky. Dokumentace jich popisuje čtyři — OAI-AdsBot jsem přehlédl. Na závěrech článku to nic nemění, protože ten se týká dvojice GPTBot / OAI-SearchBot, ale počet jsem tvrdil špatně. Kategorii robotů vyvolaných uživatelem rozebírá samostatný článek.
Osm webů z dvanácti tedy má podle dokumentace ošetřený trénink, ale pravidlo pro OAI-SearchBota v souboru nemá.
Kombinace jen OAI-SearchBot se ve vzorku nevyskytla
Ani jednou. Každá nalezená konfigurace pro OpenAI obsahovala GPTBota. Jestli je to tím, že je starší a je v hotových vzorech robots.txt častěji, z měření nepoznám.
Stejný vzorec je vidět i u Googlu
Pravidlo pro Google-Extended má deset webů z osmdesáti a blokovací pravidlo pro Googlebot z nich má jeden. Podle dokumentace Googlu přitom Google-Extended řídí trénink a podkládání odpovědí pro Gemini. Zařazení do Search ani funkce s generativní AI ve Search, jako jsou Přehled od AI a režim AI, neřídí. Na ty má Google samostatné nastavení v Search Console, které z robots.txt nevidím.
Co v těch souborech je celkem
Aspoň jedno pravidlo pro sledované AI roboty má 20 z 80 domén — sedmnáct médií a tři e-shopy. Těch 47 e-shopů běží na jedné platformě s výchozím robots.txt, takže tři výjimky jsou tam, kde do souboru někdo sáhl ručně.
| Robot | Počet z 80 |
|---|---|
| Bytespider | 13 |
| ClaudeBot | 12 |
| GPTBot | 12 |
| Amazonbot | 11 |
| Google-Extended | 10 |
| PerplexityBot | 9 |
| anthropic-ai | 7 |
| Claude-Web | 7 |
| CCBot | 7 |
| Applebot-Extended | 6 |
| Meta-ExternalAgent | 5 |
| ChatGPT-User | 5 |
| Applebot | 4 |
| OAI-SearchBot | 4 |
Bytespider vede i v tomhle větším vzorku 80 domén — navazuje to na dřívější měření na 33 médiích.
Rychlá kontrola za minutu
Co se dá zjistit hned teď
- Otevřete si vlastní /robots.txt stačí připsat cestu za doménu; uvidíte přesně to, co uvidí robot.
- Najděte v něm GPTBot pokud k němu patří Disallow: /, máte podle dokumentace ošetřený trénink u OpenAI. Samotná zmínka nebo prázdné Disallow nestačí.
- Podívejte se, jestli je tam i OAI-SearchBot pokud není, zobrazení ve výsledcích vyhledávání v ChatGPT tím nastavením neřešíte.
- U Googlu se robots.txt nespoléhejte funkce s generativní AI ve Search řídí samostatné nastavení v Search Console.
- K řádku si připište datum a důvod za rok už nikdo nebude vědět, proč tam je.
Kompletní rozpis, co které nastavení podle dokumentace vypne, je v samostatném článku.
Limity a metodika
Jeden odečet, 12. srpna 2026. Vzorky nejsou náhodné: 33 médií je ruční seznam, 47 e-shopů je z jedné platformy — proto uvádím rozdělení odděleně. U části vzorku jde tedy o výchozí soubor platformy, ne o vědomou volbu.
Měřím konfiguraci, ne chování robotů ani záměr provozovatelů. Netestoval jsem, jestli se roboti podle těch pravidel řídí.
Parser počítá jen Disallow s neprázdnou hodnotou. Jiné mechanismy — meta tagy, hlavičky, blokace na serveru, nastavení v Search Console — nevidí.
Tři chyby, které se u toho nabízejí
Zkopírovat cizí robots.txt a mít pocit hotovo
Vzory kolující po internetu obvykle obsahují GPTBota. Podle dokumentace to řeší trénink, ne zobrazení ve výsledcích vyhledávání v ChatGPT.
Číst přítomnost pravidla jako záměr
Z řádku v souboru nepoznáte, co tím kdo chtěl. Ani já to z měření nepoznám.
Myslet si, že robots.txt ukáže celé nastavení
Nastavení v Search Console, meta tagy ani blokace na serveru v něm nejsou.
Shrnutí
Ve vzorku osmdesáti českých webů má pravidlo pro GPTBota dvanáct a jen čtyři mají i OAI-SearchBota. Opačná kombinace se nevyskytla ani jednou.
Neznamená to, že osm webů udělalo chybu. Znamená to jen, že v tomhle vzorku se samostatné pravidlo pro OAI-SearchBota objevuje výrazně méně často než pravidlo pro GPTBota, i když dokumentace mezi nimi rozlišuje.
Jak si ověřit, že robot, který se hlásí jménem, je opravdu ten pravý, rozebírá ověřování AI robotů.