Přeskočit na obsah

Content Signals: řízení AI botů podle účelu

Content Signals přidává do robots.txt preference podle účelu: vyhledávání, AI odpovědi, trénink. Jak to zapsat, s čím to zkombinovat a kdo to dnes vůbec čte.

~1 400 slov 6 častých otázek ~7 minut čtení Aktualizováno: 13. 9. 2026
Content Signals: řízení AI botů podle účelu
Stručná odpověď

Content Signals je rozšíření robots.txt od Cloudflare, kterým web vyjadřuje preferenci použití obsahu: pro vyhledávání, jako vstup do AI odpovědí a pro trénink modelů. Zapisuje se jednou řádkou vedle běžných pravidel; jména robotů nenahrazuje, doplňuje je. K 2. 9. 2026 žádný velký provozovatel veřejně nepotvrdil, že ho čte; Cloudflare ho řeší hlavně u ověřených botů ve své síti.

Účel místo jména — a jedna poctivá výhrada

Content Signals je rozšíření robots.txt od Cloudflare, kterým web vyjadřuje preferenci použití obsahu: pro vyhledávání, jako vstup do AI odpovědí a pro trénink modelů. Zapisuje se jednou řádkou vedle běžných pravidel; jména robotů nenahrazuje, doplňuje je. K 2. 9. 2026 žádný velký provozovatel veřejně nepotvrdil, že ho čte; Cloudflare ho řeší hlavně u ověřených botů ve své síti.

Základ — které roboty povolit a které omezit jménem — má řízení AI robotů v robots.txt. Tento text přidává další vrstvu: co Content Signals umí vyjádřit, jak se přesně zapisuje, s čím ho zkombinovat a co od něj čekat.

Proč jména nestačí

Každý velký provozovatel má dnes několik robotů s různým účelem (OpenAI jich dokumentuje čtyři, Anthropic tři) — a jména jsou si často podobná a snadno se spletou:

Aspekt Trénink Vyhledávání a citace
OpenAI GPTBot — „crawl content that may be used in training“; zákaz znamená nepoužít obsah pro trénink OAI-SearchBot — „surface websites in search results in ChatGPT's search features“; kdo ho zakáže, nemá se zobrazovat v odpovědích vyhledávání ChatGPT, podle OpenAI se ale může dál objevit jako navigační odkaz
Anthropic ClaudeBot — sbírá obsah, který „could potentially contribute to their training“ Claude-SearchBot — „improve search result quality for users“

Roboti, kteří stránku načtou až na dotaz uživatele, v tabulce nejsou, protože nejde o trénink ani o vyhledávací index. OpenAI u ChatGPT-User píše, že se na něj pravidla robots.txt „may not apply“; Anthropic u Claude-User uvádí, že robots.txt respektuje stejně jako u ClaudeBota a Claude-SearchBota.

Plynou z toho tři problémy. Jména přibývají — kdo před rokem zakázal GPTBot, tím nezakázal roboty, kteří přibyli později. Jméno neříká účel — musíte ho dohledat v dokumentaci každého provozovatele. A roboti vyvolaní uživatelem se robots.txt buď neřídí, nebo řídí podle libosti provozovatele; rozebírá je roboti vyvolaní uživatelem.

Content Signals obrací logiku: místo „kdo smí“ říká „k čemu se obsah podle preference webu má použít“. Je formulovaný obecně, i pro roboty, které ještě neexistují — účinek ale má jen tehdy, když ho konkrétní provozovatel začne číst a respektovat.

Co Content Signals umí vyjádřit

Cloudflare politiku zveřejnil 24. září 2025 pod licencí CC0, aby ji mohl převzít kdokoli. Syntaxe je jedna řádka ve skupině pravidel:

User-Agent: *
Content-Signal: search=yes, ai-train=no
Allow: /

Tři signály mají v dokumentu tyhle definice:

Tři signály účelu

  • search „building a search index and providing search results (e.g., returning hyperlinks and short excerpts)“ — klasické vyhledávání s odkazy a úryvky.
  • ai-input „inputting content into one or more AI models (e.g., retrieval augmented generation, grounding)“ — obsah jako vstup do AI odpovědi.
  • ai-train „training or fine-tuning AI models“ — trénink a doladění modelů.

Dvě pravidla k tomu: neuvedený signál je neutrální — web podle Cloudflare „neither grants nor restricts permission“. A u tří signálů search, ai-input a ai-train jsou hodnoty jen yes a no; parametr use= (níže) má vlastní hodnoty.

Údaj o rozšíření pochází ze stejného oznámení ze září 2025: spravovaný robots.txt s výchozím search=yes, ai-train=no měly zapnutý „over 3.8 million domains“. Novější číslo Cloudflare neuvádí.

Kdo to čte — poctivě

Tady je ta výhrada z úvodu. K 2. 9. 2026 žádný velký provozovatel botů veřejně neuvádí, že Content Signals čte. Dokumentace OpenAI ani Anthropicu k robotům je nezmiňuje. A John Mueller z Googlu na Redditu podle Search Engine Roundtable (6. 7. 2026) napsal, že direktiva nemá „no effects whatsoever for any crawler or LLM“ a jen „adds bloat & future maintenance“ — a že neví o žádném crawleru ani modelu, který by ji potvrdil.

Cloudflare to sám nezastírá: v oznámení stojí, že signály „express preferences; they are not technical countermeasures against scraping. Some companies might simply ignore them.“ Vymáhání existuje jen uvnitř jeho sítě: ověřené boty (Verified Bots), které signály ignorují nebo obsah reprodukují celý, mohou přijít o status ověření — a Cloudflare od července 2026 uvádí, že boty reprodukující obsah v plném rozsahu ověřené být nemohou.

Nejčastější přání českého webu: být k nalezení a citovaný, ale nekrmit trénink. Zapisuje se to jmény a Content Signals dohromady — jména pro provozovatele, kteří je dokumentují, signály pro všechny ostatní i pro budoucnost. Pokud tím myslíte klasické vyhledávání s odkazy a úryvky, stačí varianta A níže; pokud chcete výslovně povolit i použití obsahu jako vstupu do AI odpovědí, je přesnější varianta B.

  1. Rozhodněte, kde pravidlo vzniká

    Máte-li zapnutý spravovaný robots.txt v Cloudflare, nejdřív si otevřete výsledný /robots.txt a najděte vloženou řádku Content-signal. Ruční řádku přidávejte jen tehdy, když tím nevytvoříte druhou skupinu User-agent: * nebo protichůdné hodnoty.

  2. Vyhledávací roboty povolte jménem

    OAI-SearchBot, Claude-SearchBot, PerplexityBot dostanou vlastní skupinu s Allow. Na rozdíl od Content Signals provozovatelé jména svých robotů, vyhledávacích i tréninkových, skutečně dokumentují.

  3. Tréninkové roboty omezte jménem

    GPTBot, ClaudeBot, CCBot — Disallow na to, co nechcete v tréninku. Google-Extended řešte zvlášť, je to řídicí token, ne robot.

  4. Do skupiny User-agent: * přidejte Content-Signal

    Základ je search=yes, ai-train=no — vyhledávání s odkazy a úryvky ano, trénink ne. Pokud chcete výslovně povolit i použití obsahu v AI odpovědích, přidejte ai-input=yes; bez něj zůstává tenhle účel neutrální.

  5. Parametr use= jen když víte, co chcete

    reference je výchozí a odpovídá „citace s odkazem“. Hodnotu immediate nebo full nastavujte jen s jasným důvodem.

  6. Ověřte a zapište datum

    Po nasazení projděte kontroly níže a k souboru si poznamenejte, k jakému datu jste ho nastavovali. Podpora signálů se může změnit.

Takhle vypadá výsledek v celku — jména nahoře, signály ve výchozí skupině. Ukázka je modelová: nepřepisujte podle ní celý soubor naslepo, doplňte skupiny do svého existujícího robots.txt tak, aby zůstala zachovaná vaše pravidla pro indexaci. Seznam robotů je příklad, aktuální tabulku má základní článek.

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: *
Content-Signal: search=yes, ai-train=no
Allow: /

To je varianta A: vyhledávání s odkazy a úryvky ano, trénink ne, použití v AI odpovědích nechává neutrální. Kdo chce výslovně říct i „ano“ AI odpovědím, použije variantu BContent-Signal: search=yes, ai-input=yes, ai-train=no — s vědomím, že k 2. 9. 2026 žádný velký provozovatel veřejně nepotvrdil, že tuhle preferenci čte.

Pořadí skupin nerozhoduje: konkrétní User-agent má u běžných parserů přednost před *. Cloudflare uvádí zápis Content-Signal ve skupině * jako obecnou preferenci webu; jak by případný čtenář signálů řešil vztah mezi konkrétní skupinou a skupinou *, veřejně potvrzené není. Kdo chce nejasnost snížit, zopakuje řádku i v konkrétních skupinách, na kterých mu záleží.

Pro úplnost: náš vlastní robots.txt k 2. 9. 2026 Content Signals nepoužívá a řídí přístup jmény. Přidáme ho ve chvíli, kdy ho aspoň jeden provozovatel, na kterém nám záleží, veřejně potvrdí — do té doby by to bylo jen tvrzení bez adresáta.

Jak ověřit, že se nic nerozbilo

Řádka Content-Signal sama nic neblokuje — rozbít indexaci může jen chyba v Disallow. Právě proto má smysl kontrola:

Čtyři kontroly po nasazení

  • Soubor je dostupný a čitelný Otevřete https://vasedomena.cz/robots.txt — HTTP 200, vaše skupiny na správných místech. U Cloudflare zkontrolujte, jestli spravovaná část nepřibyla před tu vaši.
  • Kontrola URL v Search Console Projděte klíčové adresy přes kontrolu URL. Stav „blokováno souborem robots.txt“ by se měl objevit jen tam, kde jste ho chtěli.
  • Report Indexování stránek po pár dnech Sledujte, jestli nepřibyly stránky „blokováno souborem robots.txt“.
  • Log serveru Googlebot i vyhledávací AI roboti (OAI-SearchBot, Claude-SearchBot, PerplexityBot) mají chodit dál. Tréninkové roboty, které jste omezili jménem, by měly přestat stahovat zakázané adresy — samotný robots.txt mohou načítat dál.

Dvě věci, se kterými se to plete

AIPREF (IETF) má stejný princip — vyjádřit účel, ne jméno — ale jiný slovník: hlavička nebo pravidlo Content-Usage: train-ai=n. Slovníkový draft je z dubna 2026 s expirací v říjnu, doprovodný draft o připojení preferencí propadl bez nové revize. Není to totéž co Content Signals a není to standard; co z toho plyne, rozebírá základní článek o robots.txt pro AI roboty.

Kategorie botů v Cloudflare (Search, Agent, Training) jsou jiná vrstva — nastavení v účtu Cloudflare, které přístup skutečně odepře, ne řádka v robots.txt. Rozebírá je řízení AI robotů v Cloudflare.

Časté chyby

01

Nahradit jména signály

Signály nikdo z velkých provozovatelů nepotvrdil; jména dokumentují všichni. Signály jsou doplněk, jména základ.

02

Spoléhat na signál jako na ochranu

Cloudflare sám píše, že jde o preference, ne o technické opatření. Co musí platit dnes, řešte na serveru nebo v CDN.

03

Zakázat ai-input a divit se, že citace mizí

Signál ai-input=no říká „nepoužívej můj obsah v AI odpovědích“. Kdo ho jednou začne respektovat, vás z odpovědí vyřadí — i z těch s odkazem.

04

Nechat spravovaný soubor bez kontroly

Cloudflare svou část připojí před vaši. Po zapnutí si celý výsledný robots.txt přečtěte — dvě skupiny User-agent: * za sebou jsou zdroj nedorozumění.

Shrnutí

  • Content Signals říká „k čemu“, jména říkají „kdo“. Obojí patří do robots.txt vedle sebe; signály jména nenahrazují.
  • Tři signály (search, ai-input, ai-train) plus od července 2026 use= (immediate, reference, full). Neuvedený signál je neutrální.
  • K 2. 9. 2026 žádný velký provozovatel veřejně nepotvrdil, že signály čte; Cloudflare je řeší hlavně u ověřených botů ve své síti.
  • Přidat je nízkorizikové, spoléhat ne. Citace povolte jménem vyhledávacích robotů, trénink omezte jménem tréninkových, signál přidejte navíc.
  • Po nasazení ověřte dostupnost souboru, kontrolu URL v Search Console, report Indexování stránek a logy.

Nevíte, které roboty na váš web chodí a co jim váš robots.txt vlastně říká? AI SEO audit za 3 600 Kč projde logy, robots.txt i nastavení CDN a řekne, kde povolujete něco, co nechcete, a kde blokujete citace, které chcete.

Zdroje: Cloudflare, Content Signals Policy, 24. 9. 2025 · Cloudflare, Your site, your rules: new AI traffic options, 1. 7. 2026 · Cloudflare, dokumentace spravovaného robots.txt, aktualizace 3. 8. 2026 · OpenAI, dokumentace robotů · Anthropic, dokumentace robotů, 7. 4. 2026 · Search Engine Roundtable, Google Says Cloudflare Content Signals Robots.txt Directive Has No Effects Whatsoever, 6. 7. 2026 · IETF, drafty draft-ietf-aipref-vocab-06 a draft-ietf-aipref-attach-04. Vše ověřeno 2. 9. 2026.

Sniper Design
Pomoc s implementací

Nechcete to řešit interně? Postavíme to za vás.

V Sniper Design děláme kompletní AI SEO — strategii, audit, implementaci i obsah. Zlatý partner Upgates i Shoptetu, přes 600 e‑shopů na CZ trhu. Na AI vyhledávání připravujeme návrhy homepage, obsahovou strukturu i audity klientských webů.

  • 600+ e‑shopů
  • Vlastní e‑shop MEGA DETAIL
FAQČasté otázky

Časté otázky, které k tématu nejčastěji padají

Co je Content Signals?
Rozšíření robots.txt, které Cloudflare zveřejnil 24. září 2025 pod licencí CC0. Řádkou Content-Signal web vyjadřuje preferenci, k čemu se obsah má a nemá použít: search (vyhledávací index a výsledky s odkazy a úryvky), ai-input (vstup do AI odpovědí, například RAG) a ai-train (trénink modelů). Od července 2026 přibyl parametr use= s hodnotami immediate, reference a full.
Nahrazuje Content Signals pravidla podle jmen robotů?
Ne. Je to doplněk. Jména (GPTBot, OAI-SearchBot, ClaudeBot…) řídí, kdo smí na web; Content Signals vyjadřuje preferenci, k čemu se obsah má a nemá použít. Dává smysl mít obojí — a jména zůstávají tím, co provozovatelé botů skutečně dokumentují.
Kdo Content Signals respektuje?
K 2. 9. 2026 to ve své dokumentaci neuvádí OpenAI ani Anthropic a John Mueller z Googlu napsal, že direktiva nemá žádný účinek na žádný crawler ani model. Vymáhání existuje jen v síti Cloudflare: ověřené boty, které signály ignorují, mohou přijít o status.
Má tedy smysl to nastavovat?
Jako vyjádření preference ano. Samotná řádka Content-Signal by indexaci rozbít neměla, protože neznámé direktivy roboti ignorují; riziko vzniká jen při chybě v Disallow nebo při zapnutí spravovaného robots.txt v Cloudflare bez kontroly výsledného souboru. Jako ochranu ne — cokoli musí platit dnes, řešte jmény robotů a na úrovni serveru nebo CDN.
Jak zapsat, že chci citace, ale ne trénink?
Kombinací: vyhledávací roboty (OAI-SearchBot, Claude-SearchBot, PerplexityBot) povolit jménem, tréninkové (GPTBot, ClaudeBot, CCBot) omezit jménem, a k tomu do skupiny User-agent: * přidat Content-Signal. Pro vyhledávání s odkazy a úryvky stačí search=yes, ai-train=no; pokud chcete výslovně povolit i použití obsahu v AI odpovědích, přidejte ai-input=yes. K 2. 9. 2026 ale žádný velký provozovatel veřejně nepotvrdil, že tuto preferenci čte.
Jak ověřit, že jsem si nerozbil indexaci?
Otevřete robots.txt v prohlížeči, zkontrolujte klíčové adresy v Search Console přes kontrolu URL, po pár dnech projděte report Indexování stránek a v logu serveru ověřte, že Googlebot i vyhledávací AI roboti dál chodí. Řádka Content-Signal sama nic neblokuje; rozbít indexaci může jen chyba v Disallow.
Čtěte dál

Související články

Všechny články v blogu Zpět na úvod