Content Signals v robots.txt: co smí AI s vaším obsahem a kdo to respektuje
Robots.txt vznikl v roce 1994 pro jediný účel: říct robotovi, kam smí a kam ne. Neřeší, co se s obsahem stane potom. Dokud byli hlavními návštěvníky vyhledávače, které za obsah platily návštěvností, nebyl to problém. V éře generativní AI, kdy jeden a tentýž robot může obsah zaindexovat, vložit do odpovědi chatbota i použít pro trénink modelu, začala tato „černobílá“ logika přestávat stačit.
Přesně na tuto mezeru míří Content Signals - iniciativa a stejnojmenná specifikace od společnosti Cloudflare, představená 24. září 2025. Rozšiřuje robots.txt o strojově čitelný slovník, kterým vyjádříte preferenci nikoli k přístupu, ale k použití obsahu.
Co Content Signals přesně řeší
Klasické robots.txt pracuje s direktivami Allow a Disallow. Ty rozhodují o
tom, zda robot smí URL stáhnout. Nic víc. Pokud stažení povolíte, nemáte v souboru žádný nástroj,
jak odlišit tři velmi rozdílné scénáře:
- obsah je zaindexován a ve výsledcích se zobrazí odkaz s krátkým úryvkem,
- obsah je v reálném čase načten do jazykového modelu, aby posloužil jako podklad pro odpověď,
- obsah se stane součástí trénovací sady pro nový model.
Z pohledu vydavatele mají tyto tři situace zcela jinou hodnotu. První mu přivádí návštěvníky, druhá může přivést citaci a menší část návštěvnosti, třetí typicky nepřináší zpět nic. Content Signals proto zavádí právě tři odpovídající kategorie.
Tři signály a jejich definice
Direktiva se zapisuje do bloku pravidel k danému User-Agent a nabývá hodnot
yes (souhlas) nebo no (nesouhlas). Pokud signál vynecháte,
nevyjadřujete žádnou preferenci - nesouhlas ani souhlas.
| Signál | Význam podle specifikace | Typický zástupce |
|---|---|---|
| search | Budování vyhledávacího indexu a poskytování výsledků vyhledávání, tedy vracení odkazů a krátkých úryvků. Nezahrnuje generování AI souhrnů. | Googlebot, SeznamBot, Bingbot |
| ai-input | Vkládání obsahu do jednoho či více AI modelů, například retrieval augmented generation (RAG), grounding nebo jiné načtení obsahu v reálném čase pro generativní odpověď. | OAI-SearchBot, PerplexityBot, Claude-SearchBot |
| ai-train | Trénování nebo doladění (fine-tuning) AI modelů. | GPTBot, ClaudeBot, CCBot, Google-Extended |
Klíčové je oddělení search od ai-input. Specifikace výslovně říká, že „search“ nezahrnuje generované AI souhrny. Právě zde vzniká celý spor kolem AI přehledů Googlu: z pohledu vydavatele jde o dvě různá použití, z pohledu Googlu o jeden nedělitelný produkt.
Jak vypadá zápis v robots.txt
Nejjednodušší varianta platí pro všechny roboty. Cloudflare ji doporučuje jako výchozí pro weby, které chtějí zůstat ve vyhledávačích, ale nechtějí být tréninkovými daty:
Content-Signal: ai-train=no, search=yes, ai-input=no
Allow: /
Generátor na contentsignals.org nabízí čtyři přednastavené politiky, které se liší mírou otevřenosti:
| Politika | Zápis | Pro koho |
|---|---|---|
| Disallow All | Zákaz jakéhokoli použití bez písemného souhlasu | Uzavřené portály. Pozor: může vyřadit web i z Googlu. |
| Allow Search Only | search=yes, ai-input=no, ai-train=no |
Vydavatelé žijící z návštěvnosti a reklamy |
| Allow Search & AI Input | search=yes, ai-input=yes, ai-train=no |
Doporučeno pro většinu firem a e-shopů |
| Allow vše | search=yes, ai-input=yes, ai-train=yes |
Maximální dosah, žádné omezení |
Cílení na konkrétní roboty
Direktivu lze zapsat do bloku každého robota zvlášť. To dává smysl například tehdy, když chcete otevřít obsah vyhledávacím botům AI platforem, ale ne jejich trénovacím crawlerům:
User-Agent: googlebot
Content-Signal: ai-train=no, search=yes, ai-input=no
Allow: /
User-Agent: bingbot
Content-Signal: ai-train=no, search=yes, ai-input=no
Allow: /
User-Agent: OAI-Searchbot
Content-Signal: ai-train=no, search=yes, ai-input=no
Allow: /
Odlišná pravidla pro různé části webu
Specifikace umožňuje uvést cestu přímo v direktivě. Můžete tak například otevřít stránku „O nás“ úplně všemu, blog nechat pouze pro vyhledávání a klientskou sekci zavřít docela:
User-Agent: *
Content-Signal: /about ai-train=yes, search=yes, ai-input=yes
Allow: /about
# Blog pouze pro vyhledávání
User-Agent: *
Content-Signal: /blog/ ai-train=no, search=yes, ai-input=no
Allow: /blog/
# Dashboard zcela mimo
User-Agent: *
Disallow: /dashboard/
Zápis s cestou je oproti klasickému robots.txt nezvyklý a je jedním z důvodů, proč zatím nemá parsery. Standardní RFC 9309, které robots.txt formalizuje, cizí direktivy nezakazuje - v sekci 2.2.4 naopak výslovně připouští, že crawler smí zpracovat i jiné záznamy, než které norma definuje, a smí k nim být benevolentní. Zásadní je jiná věta téže sekce: parsování cizích záznamů nesmí zasáhnout do parsování direktiv, které norma definuje. Odtud plyne praktický závěr - Content-Signal vám robots.txt nerozbije, ale nikdo ho ani nevyhodnotí.
Právní rovina: výhrada práv podle článku 4
Content Signals nejsou jen technický zápis. Cloudflare k nim dodává komentářový blok, který se do robots.txt vkládá jako lidsky čitelná smluvní podmínka. Ta stanovuje, že přístupem na web návštěvník souhlasí s dodržováním uvedených signálů, a končí formulací, že jakákoli omezení vyjádřená prostřednictvím Content Signals představují výslovnou výhradu práv podle článku 4 směrnice EU 2019/790 o autorském právu na jednotném digitálním trhu.
To je pro evropské a české weby podstatnější než technická podpora. Článek 4 zavádí výjimku pro automatizovanou analýzu textů a dat (text and data mining) a zároveň umožňuje nositelům práv toto použití vyloučit - ovšem u obsahu zpřístupněného online pouze strojově čitelným způsobem. Do českého práva byla směrnice promítnuta zákonem č. 429/2022 Sb., kterým se novelizoval autorský zákon č. 121/2000 Sb.
Věta v robots.txt je tedy jedním z mála běžně dostupných způsobů, jak takovou výhradu vůbec vyjádřit. Cloudflare sám ovšem upozorňuje, že soud či regulátor může dojít k závěru, že robots.txt nezakládá vymahatelné právní povinnosti. Jde o indicii, nikoli o jistotu - a rozhodně to není náhrada za právní konzultaci.
Které crawlery a vyhledávače zápis podporují
Toto je nejdůležitější část článku a zároveň ta nejméně příjemná. K srpnu 2026 se
žádný velký provozovatel crawleru nebo jazykového modelu veřejně nezavázal direktivu
Content-Signal vyhodnocovat.
Nejjasněji se vyjádřil Google. John Mueller v červenci 2026 uvedl, že mu není znám žádný crawler ani LLM, který by direktivu používal, a doplnil, že nepodporované položky jen zvyšují nároky na údržbu souboru robots.txt. Server Search Engine Roundtable to shrnul titulkem, že direktiva nemá žádný efekt. Stejné stanovisko Google zastává i vůči souboru llms.txt.
Je proto potřeba důsledně oddělit dvě věci: co robot dodržuje z klasického robots.txt a zda navíc čte Content-Signal. První sloupec je dobrá zpráva, druhý zatím ne.
| Provozovatel / robot | Respektuje robots.txt | Vyhodnocuje Content-Signal | Co reálně funguje místo toho |
|---|---|---|---|
| Google - Googlebot | Ano | Ne (potvrzeno 7/2026) | Disallow, nosnippet, max-snippet,
data-nosnippet |
| Google - Google-Extended | Ano | Ne | Samostatný token pro trénink a grounding Gemini |
| Microsoft - Bingbot | Ano | Ne | Disallow, meta nocache a noarchive
pro Copilot |
| OpenAI - GPTBot, OAI-SearchBot | Ano | Ne | Oddělené user-agenty pro trénink a vyhledávání |
| OpenAI - ChatGPT-User | Částečně | Ne | Jde o načtení vyvolané uživatelem, pravidla se liší |
| Anthropic - ClaudeBot, Claude-SearchBot, Claude-User | Ano (i Crawl-delay) | Ne | Oddělené user-agenty pro trénink, vyhledávání a načtení vyvolané uživatelem |
| Perplexity - PerplexityBot, Perplexity-User | Deklarováno, zpochybněno | Ne | Blokace na úrovni WAF, ověřování podle IP rozsahů |
| Apple - Applebot, Applebot-Extended | Ano | Ne | Applebot-Extended jako opt-out z tréninku |
| Meta - Meta-ExternalAgent | Ano | Ne | Disallow na konkrétní user-agent |
| Common Crawl - CCBot | Ano | Ne | Disallow (nepřímo omezí desítky modelů) |
| Seznam.cz - SeznamBot | Ano (robots.txt 2.0) | Ne | Disallow, podpora regulárních výrazů |
| Neznámí a maskovaní roboti | Ne | Ne | Pouze blokace na úrovni serveru, WAF nebo CDN |
Přehled zachycuje stav v srpnu 2026. Provozovatelé své crawlery a pravidla průběžně mění, proto doporučuji ověřovat aktuální dokumentaci konkrétní platformy.
Proč velké firmy váhají
Důvod není jen lenost. Podpora signálu ai-input by pro Google znamenala přiznat, že AI
přehledy jsou jiný produkt než klasické vyhledávání - což dlouhodobě odmítá. Pro OpenAI či
Anthropic by zase znamenala potvrdit, že jejich vyhledávací roboti dělají něco jiného než
indexaci.
Druhým důvodem je fragmentace. Vedle Content Signals soupeří o stejné místo RSL (Really
Simple Licensing) spuštěné 10. září 2025, které jde dál a přidává do robots.txt přímo
licenční a royalty podmínky včetně modelů pay-per-crawl a pay-per-inference. Paralelně běží
standardizace v IETF pracovní skupině AIPREF, která připravuje hlavičku
Content-Usage a odpovídající pravidlo v robots.txt. Provozovatelé crawlerů logicky
čekají, který ze tří přístupů se stane skutečným standardem.
Jaká je reálná adopce
Na straně vydavatelů je situace opačná - nasazení roste, protože je téměř zdarma. Cloudflare při
spuštění v září 2025 přidal výchozí politiku search=yes, ai-train=no automaticky do
spravovaného robots.txt u 3,8 milionu domén. Signál ai-input záměrně
nechal prázdný, protože podle něj v této oblasti zatím neexistuje shoda.
To znamená, že řada webů má Content Signals nasazené, aniž o tom jejich majitelé vědí. Pokud web běží na Cloudflare, doporučuji si soubor robots.txt zkontrolovat.
Data o blokování AI botů ukazují, že vydavatelé postupují spíše selektivně než plošně. Podle analýzy více než 4 200 souborů robots.txt z konce července 2026 patřily mezi nejblokovanější trénovací crawlery GPTBot (633 domén), CCBot (567 domén) a ClaudeBot (563 domén). Podíl odpovědí HTTP 403 na požadavky AI botů dosáhl v červenci 2026 zhruba 9,6 % a v posledním týdnu měsíce vystoupal na 12,9 %, tedy více než dvojnásobek oproti roku 2025.
Pro srovnání: podle citovaných průzkumů blokuje trénovací AI boty asi 79 % velkých zpravodajských webů, ale pouze 14 % vydavatelů blokuje AI boty úplně všechny. To dobře ilustruje, o co většině z nich jde - nechtějí zmizet z AI odpovědí, chtějí jen nebýt zdarma tréninkovými daty.
Novinka z července 2026: parametr use a tři kategorie botů
Cloudflare specifikaci 1. července 2026 rozšířil. Vedle původních tří signálů přibyl volitelný
parametr use, který popisuje, jak hluboko smí systém s obsahem pracovat:
Content-Signal: search=yes, ai-train=no, use=reference
Allow: /
- use=immediate - interakce s obsahem bez jeho ukládání,
- use=reference - indexace, úryvek a zpětný odkaz (výchozí hodnota),
- use=full - souhrn a reprodukce obsahu.
Zákazníkům se spravovaným robots.txt Cloudflare doplnil use=reference automaticky.
Zároveň přestal pracovat s jednou obecnou kategorií „AI boti“ a rozdělil je na tři: Search
(sbírá a indexuje obsah, aby o něm později odpovídal), Agent (jedná v reálném čase
jménem konkrétního člověka) a Training (sbírá obsah pro trénink modelů).
Pozor na 15. září 2026
Od tohoto data platí pro nové domény na Cloudflare nové výchozí nastavení: na stránkách, které zobrazují reklamu, budou boti kategorií Training a Agent blokováni, zatímco kategorie Search zůstane povolena. Logika je taková, že přítomnost reklamy je signálem, že si provozovatel na stránce přeje lidského návštěvníka.
Zásadní je ale dopad na víceúčelové crawlery. Googlebot, Bingbot i Applebot procházejí web současně pro vyhledávání i pro AI. U zákazníků, kteří si zvolí blokaci kategorie Training, mohou být na reklamních stránkách blokováni také. To je přesně ten scénář, který dokáže nepozorovaně poškodit organickou viditelnost. Nastavení se dá změnit v sekci Security ještě před 15. zářím a doporučuji to na každém webu za Cloudflare ověřit.
Souvisí to s tím, na co jsem upozorňoval v článku AI boti mají HTTP 200. To ale ještě neznamená, že opravdu vidí váš obsah - mezi tím, co si myslíte, že jste nastavili, a tím, co robot skutečně dostane, bývá překvapivě velký rozdíl.
Content Signals versus cíle GEO
Tady je potřeba být upřímný. Většina mých klientů se dnes snaží o pravý opak toho, k čemu Content Signals vznikly. Chtějí být v AI odpovědích vidět, chtějí být citováni a chtějí odtud návštěvnost. Obor GEO (Generative Engine Optimization) stojí na tom, že AI systém obsah najde, pochopí a použije.
Z toho plyne jednoduché doporučení: signál ai-input obvykle nechcete nastavit
na „no“. Odmítnutím vkládání obsahu do modelu v reálném čase byste odmítali přesně tu
část AI ekosystému, která vám vrací návštěvnost. Data reportu Adobe, která jsem rozebíral v článku
AI návštěvnost e-shopů roste o 393 %,
ukazují, že tato návštěvnost konvertuje o 42 % lépe než ostatní zdroje. Zavírat před ní dveře nedává
pro e-shop ani firemní web ekonomický smysl.
Naopak ai-train=no je pro většinu komerčních webů rozumná výchozí volba.
Neplyne z něj žádné riziko pro viditelnost a představuje aspoň formální výhradu práv.
| Typ webu | Doporučené nastavení | Proč |
|---|---|---|
| E-shop | search=yes, ai-input=yes, ai-train=no |
Chce být v AI doporučeních produktů, netěží z tréninku |
| Firemní web a služby | search=yes, ai-input=yes, ai-train=no |
Citace v AI odpovědi je nový kanál poptávek |
| Zpravodajství a magazín | search=yes, ai-input=no, ai-train=no |
Model financovaný reklamou, AI souhrn nahrazuje návštěvu |
| Placený a členský obsah | Disallow + blokace na úrovni serveru | Deklarace nestačí, je nutné technické vynucení |
| Dokumentace a znalostní báze | search=yes, ai-input=yes, ai-train=yes |
Cílem je maximální rozšíření znalosti o produktu |
Co Content Signals rozhodně neumí
- Nezabrání stažení obsahu. Jde o preferenci, nikoli o technické opatření.
- Neblokují nic samy o sobě. Blokace se dělá direktivou
Disallow, pravidly WAF nebo bot managementem. - Nezaručují právní vymahatelnost. Sám Cloudflare uvádí, že soudy mohou dojít k závěru, že robots.txt povinnosti nezakládá.
- Nezastaví roboty, kteří robots.txt ignorují. Ti jej nečtou už dnes.
- Nenahradí strukturovaná data ani kvalitní obsah. O tom, zda vás AI cituje, rozhoduje srozumitelnost a úplnost obsahu, ne direktiva.
Platí tedy jednoduché pravidlo: deklarace a vynucení jsou dvě různé vrstvy. Content Signals patří do první, firewall a bot management do druhé. Kdo očekává, že řádek v robots.txt zastaví scraping, bude zklamán. Technickou stránku připravenosti webu pro roboty a agenty rozebírám podrobněji v článku Jak připravit web pro AI agenty.
Praktický postup nasazení
- Zkontrolujte současný stav. Otevřete
vasedomena.cz/robots.txta podívejte se, zda tam už direktivaContent-Signalnení - Cloudflare ji mohl doplnit automaticky. - Rozhodněte o strategii. Odpovězte si, zda chcete být v AI odpovědích vidět.
Pokud ano,
ai-inputnechte nayesnebo prázdné. - Vygenerujte zápis. Použijte generátor na contentsignals.org nebo si direktivu napište ručně.
- Vložte i právní komentář. Bez něj přicházíte o hlavní přínos - výhradu práv podle článku 4.
- Nesahejte na signál search. Nastavení
search=nonikdy nepoužívejte na webu, který chce být ve vyhledávačích. - Ověřte, že soubor zůstal validní. V Google Search Console zkontrolujte report robots.txt, případně otestujte na platformě, kde je robots.txt omezený, zda se zápis vůbec propsal.
- Doplňte reálné blokace. Trénovací crawlery, které opravdu nechcete, zakažte
direktivou
Disallowna jejich user-agent. - Nastavte vynucení. U citlivého obsahu přidejte pravidla na úrovni WAF nebo CDN.
- Zkontrolujte nastavení Cloudflare před 15. zářím 2026. Zejména kvůli víceúčelovým crawlerům a stránkám s reklamou.
- Sledujte logy. Bez analýzy serverových logů nezjistíte, kdo na web skutečně chodí a co dostává.
Závěr: levná pojistka, žádný zázrak
Content Signals jsou dobře navržený a srozumitelný pokus vyřešit reálný problém - robots.txt rozhoduje o přístupu, ale mlčí o použití. Zápis je triviální, náklady nulové a v evropském kontextu má díky výhradě práv podle článku 4 smysl i přesto, že jej zatím nikdo strojově nevyhodnocuje.
Zároveň je ale potřeba mít realistická očekávání. K srpnu 2026 direktiva nemění chování žádného významného crawleru. Pokud si od ní slibujete ochranu obsahu, sáhněte po blokaci na síťové úrovni. Pokud si od ní slibujete lepší viditelnost v AI, sáhněte po kvalitním a strukturovaném obsahu.
Osobně ji doporučuji nasadit ve variantě search=yes, ai-input=yes, ai-train=no -
stojí to pět minut, nic nerozbije, vyjadřuje jasné stanovisko a pokud se standard prosadí, budete
připraveni. Rozhodně bych ale kolem ní nestavěl obsahovou strategii. Ta se dnes rozhoduje jinde:
v tom, jak srozumitelně a úplně web
odpovídá na otázky uživatelů.
Zdroje
- Content Signals - oficiální stránka specifikace a generátor
- Cloudflare Blog: Giving users choice with Cloudflare's new Content Signals Policy (24. 9. 2025)
- Cloudflare Blog: Your site, your rules - new AI traffic options (červenec 2026)
- Cloudflare Changelog: New options to manage AI traffic (1. 7. 2026)
- Search Engine Roundtable: Google Says Cloudflare Content Signals Robots.txt Directive Has No Effects Whatsoever
- IETF: Setting standards for AI preferences (pracovní skupina AIPREF)
- RSL: Really Simple Licensing - konkurenční licenční standard
- RFC 9309: Robots Exclusion Protocol
- Směrnice EU 2019/790, článek 4 (výhrada k text and data mining)
- Nápověda Seznam.cz: Robots.txt a řízení procházení
- Analýza robots.txt a blokování AI crawlerů (červenec 2026)
- AI boti mají HTTP 200. To ale ještě neznamená, že opravdu vidí váš obsah
- Jak připravit web pro AI agenty
- AI návštěvnost e-shopů roste o 393 %
Článek popisuje stav k 31. srpnu 2026. Oblast se rychle vyvíjí, proto před nasazením ověřte aktuální dokumentaci Cloudflare i jednotlivých provozovatelů crawlerů. Text nepředstavuje právní poradenství - k otázkám výhrady autorských práv konzultujte advokáta.
Nevíte, koho na svůj web pouštíte a co odtud odnáší?
Projdu vaše robots.txt, nastavení Cloudflare i serverové logy a nastavím pravidla tak, abyste zůstali vidět tam, kde to má obchodní smysl.
Přidat do preferovaných zdrojů na Googlu