Technické SEO • AI • Robots.txt

Content Signals v robots.txt: co smí AI s vaším obsahem a kdo to respektuje

Ivo Kylián
14. srpna 2026 • Aktualizováno 31. srpna 2026 • 12 min čtení
Content Signals je rozšíření souboru robots.txt, které představil Cloudflare v září 2025 na adrese contentsignals.org. Pomocí direktivy Content-Signal můžete deklarovat, zda smí být váš obsah použit pro klasické vyhledávání (search), pro odpovědi generativní AI v reálném čase (ai-input) nebo pro trénování modelů (ai-train). Zápis je snadný a v EU funguje jako strojově čitelná výhrada práv. K srpnu 2026 ho ale žádný velký crawler ani LLM veřejně nevyhodnocuje - Google to řekl otevřeně. V článku najdete syntaxi, právní kontext, novinky z července 2026 a přehled toho, co jednotlivé vyhledávače a AI společnosti skutečně podporují.

Robots.txt vznikl v roce 1994 pro jediný účel: říct robotovi, kam smí a kam ne. Neřeší, co se s obsahem stane potom. Dokud byli hlavními návštěvníky vyhledávače, které za obsah platily návštěvností, nebyl to problém. V éře generativní AI, kdy jeden a tentýž robot může obsah zaindexovat, vložit do odpovědi chatbota i použít pro trénink modelu, začala tato „černobílá“ logika přestávat stačit.

Přesně na tuto mezeru míří Content Signals - iniciativa a stejnojmenná specifikace od společnosti Cloudflare, představená 24. září 2025. Rozšiřuje robots.txt o strojově čitelný slovník, kterým vyjádříte preferenci nikoli k přístupu, ale k použití obsahu.

Co Content Signals přesně řeší

Klasické robots.txt pracuje s direktivami Allow a Disallow. Ty rozhodují o tom, zda robot smí URL stáhnout. Nic víc. Pokud stažení povolíte, nemáte v souboru žádný nástroj, jak odlišit tři velmi rozdílné scénáře:

  • obsah je zaindexován a ve výsledcích se zobrazí odkaz s krátkým úryvkem,
  • obsah je v reálném čase načten do jazykového modelu, aby posloužil jako podklad pro odpověď,
  • obsah se stane součástí trénovací sady pro nový model.

Z pohledu vydavatele mají tyto tři situace zcela jinou hodnotu. První mu přivádí návštěvníky, druhá může přivést citaci a menší část návštěvnosti, třetí typicky nepřináší zpět nic. Content Signals proto zavádí právě tři odpovídající kategorie.

Tři signály a jejich definice

Direktiva se zapisuje do bloku pravidel k danému User-Agent a nabývá hodnot yes (souhlas) nebo no (nesouhlas). Pokud signál vynecháte, nevyjadřujete žádnou preferenci - nesouhlas ani souhlas.

Signál Význam podle specifikace Typický zástupce
search Budování vyhledávacího indexu a poskytování výsledků vyhledávání, tedy vracení odkazů a krátkých úryvků. Nezahrnuje generování AI souhrnů. Googlebot, SeznamBot, Bingbot
ai-input Vkládání obsahu do jednoho či více AI modelů, například retrieval augmented generation (RAG), grounding nebo jiné načtení obsahu v reálném čase pro generativní odpověď. OAI-SearchBot, PerplexityBot, Claude-SearchBot
ai-train Trénování nebo doladění (fine-tuning) AI modelů. GPTBot, ClaudeBot, CCBot, Google-Extended

Klíčové je oddělení search od ai-input. Specifikace výslovně říká, že „search“ nezahrnuje generované AI souhrny. Právě zde vzniká celý spor kolem AI přehledů Googlu: z pohledu vydavatele jde o dvě různá použití, z pohledu Googlu o jeden nedělitelný produkt.

Co robots.txt řeší a co doplňuje Content Signals
FÁZE 1 • PŘÍSTUP Allow / Disallow Smí robot URL vůbec stáhnout? Vynucováno dobrovolně, ale respektováno všemi velkými crawlery od roku 1994. Podpora: prakticky univerzální FÁZE 2 • POUŽITÍ Content-Signal K čemu smí obsah po stažení použít? search • ai-input • ai-train Deklarace preference, nikoli technická bariéra. Podpora: zatím žádná potvrzená

Jak vypadá zápis v robots.txt

Nejjednodušší varianta platí pro všechny roboty. Cloudflare ji doporučuje jako výchozí pro weby, které chtějí zůstat ve vyhledávačích, ale nechtějí být tréninkovými daty:

User-Agent: *
Content-Signal: ai-train=no, search=yes, ai-input=no
Allow: /

Generátor na contentsignals.org nabízí čtyři přednastavené politiky, které se liší mírou otevřenosti:

Politika Zápis Pro koho
Disallow All Zákaz jakéhokoli použití bez písemného souhlasu Uzavřené portály. Pozor: může vyřadit web i z Googlu.
Allow Search Only search=yes, ai-input=no, ai-train=no Vydavatelé žijící z návštěvnosti a reklamy
Allow Search & AI Input search=yes, ai-input=yes, ai-train=no Doporučeno pro většinu firem a e-shopů
Allow vše search=yes, ai-input=yes, ai-train=yes Maximální dosah, žádné omezení

Cílení na konkrétní roboty

Direktivu lze zapsat do bloku každého robota zvlášť. To dává smysl například tehdy, když chcete otevřít obsah vyhledávacím botům AI platforem, ale ne jejich trénovacím crawlerům:

# Povolí indexaci pro vyhledávání, nikoli trénink
User-Agent: googlebot
Content-Signal: ai-train=no, search=yes, ai-input=no
Allow: /

User-Agent: bingbot
Content-Signal: ai-train=no, search=yes, ai-input=no
Allow: /

User-Agent: OAI-Searchbot
Content-Signal: ai-train=no, search=yes, ai-input=no
Allow: /

Odlišná pravidla pro různé části webu

Specifikace umožňuje uvést cestu přímo v direktivě. Můžete tak například otevřít stránku „O nás“ úplně všemu, blog nechat pouze pro vyhledávání a klientskou sekci zavřít docela:

# Stránka o firmě bez omezení
User-Agent: *
Content-Signal: /about ai-train=yes, search=yes, ai-input=yes
Allow: /about

# Blog pouze pro vyhledávání
User-Agent: *
Content-Signal: /blog/ ai-train=no, search=yes, ai-input=no
Allow: /blog/

# Dashboard zcela mimo
User-Agent: *
Disallow: /dashboard/

Zápis s cestou je oproti klasickému robots.txt nezvyklý a je jedním z důvodů, proč zatím nemá parsery. Standardní RFC 9309, které robots.txt formalizuje, cizí direktivy nezakazuje - v sekci 2.2.4 naopak výslovně připouští, že crawler smí zpracovat i jiné záznamy, než které norma definuje, a smí k nim být benevolentní. Zásadní je jiná věta téže sekce: parsování cizích záznamů nesmí zasáhnout do parsování direktiv, které norma definuje. Odtud plyne praktický závěr - Content-Signal vám robots.txt nerozbije, ale nikdo ho ani nevyhodnotí.

Právní rovina: výhrada práv podle článku 4

Content Signals nejsou jen technický zápis. Cloudflare k nim dodává komentářový blok, který se do robots.txt vkládá jako lidsky čitelná smluvní podmínka. Ta stanovuje, že přístupem na web návštěvník souhlasí s dodržováním uvedených signálů, a končí formulací, že jakákoli omezení vyjádřená prostřednictvím Content Signals představují výslovnou výhradu práv podle článku 4 směrnice EU 2019/790 o autorském právu na jednotném digitálním trhu.

To je pro evropské a české weby podstatnější než technická podpora. Článek 4 zavádí výjimku pro automatizovanou analýzu textů a dat (text and data mining) a zároveň umožňuje nositelům práv toto použití vyloučit - ovšem u obsahu zpřístupněného online pouze strojově čitelným způsobem. Do českého práva byla směrnice promítnuta zákonem č. 429/2022 Sb., kterým se novelizoval autorský zákon č. 121/2000 Sb.

Věta v robots.txt je tedy jedním z mála běžně dostupných způsobů, jak takovou výhradu vůbec vyjádřit. Cloudflare sám ovšem upozorňuje, že soud či regulátor může dojít k závěru, že robots.txt nezakládá vymahatelné právní povinnosti. Jde o indicii, nikoli o jistotu - a rozhodně to není náhrada za právní konzultaci.

Které crawlery a vyhledávače zápis podporují

Toto je nejdůležitější část článku a zároveň ta nejméně příjemná. K srpnu 2026 se žádný velký provozovatel crawleru nebo jazykového modelu veřejně nezavázal direktivu Content-Signal vyhodnocovat.

Nejjasněji se vyjádřil Google. John Mueller v červenci 2026 uvedl, že mu není znám žádný crawler ani LLM, který by direktivu používal, a doplnil, že nepodporované položky jen zvyšují nároky na údržbu souboru robots.txt. Server Search Engine Roundtable to shrnul titulkem, že direktiva nemá žádný efekt. Stejné stanovisko Google zastává i vůči souboru llms.txt.

Je proto potřeba důsledně oddělit dvě věci: co robot dodržuje z klasického robots.txt a zda navíc čte Content-Signal. První sloupec je dobrá zpráva, druhý zatím ne.

Provozovatel / robot Respektuje robots.txt Vyhodnocuje Content-Signal Co reálně funguje místo toho
Google - Googlebot Ano Ne (potvrzeno 7/2026) Disallow, nosnippet, max-snippet, data-nosnippet
Google - Google-Extended Ano Ne Samostatný token pro trénink a grounding Gemini
Microsoft - Bingbot Ano Ne Disallow, meta nocache a noarchive pro Copilot
OpenAI - GPTBot, OAI-SearchBot Ano Ne Oddělené user-agenty pro trénink a vyhledávání
OpenAI - ChatGPT-User Částečně Ne Jde o načtení vyvolané uživatelem, pravidla se liší
Anthropic - ClaudeBot, Claude-SearchBot, Claude-User Ano (i Crawl-delay) Ne Oddělené user-agenty pro trénink, vyhledávání a načtení vyvolané uživatelem
Perplexity - PerplexityBot, Perplexity-User Deklarováno, zpochybněno Ne Blokace na úrovni WAF, ověřování podle IP rozsahů
Apple - Applebot, Applebot-Extended Ano Ne Applebot-Extended jako opt-out z tréninku
Meta - Meta-ExternalAgent Ano Ne Disallow na konkrétní user-agent
Common Crawl - CCBot Ano Ne Disallow (nepřímo omezí desítky modelů)
Seznam.cz - SeznamBot Ano (robots.txt 2.0) Ne Disallow, podpora regulárních výrazů
Neznámí a maskovaní roboti Ne Ne Pouze blokace na úrovni serveru, WAF nebo CDN

Přehled zachycuje stav v srpnu 2026. Provozovatelé své crawlery a pravidla průběžně mění, proto doporučuji ověřovat aktuální dokumentaci konkrétní platformy.

Proč velké firmy váhají

Důvod není jen lenost. Podpora signálu ai-input by pro Google znamenala přiznat, že AI přehledy jsou jiný produkt než klasické vyhledávání - což dlouhodobě odmítá. Pro OpenAI či Anthropic by zase znamenala potvrdit, že jejich vyhledávací roboti dělají něco jiného než indexaci.

Druhým důvodem je fragmentace. Vedle Content Signals soupeří o stejné místo RSL (Really Simple Licensing) spuštěné 10. září 2025, které jde dál a přidává do robots.txt přímo licenční a royalty podmínky včetně modelů pay-per-crawl a pay-per-inference. Paralelně běží standardizace v IETF pracovní skupině AIPREF, která připravuje hlavičku Content-Usage a odpovídající pravidlo v robots.txt. Provozovatelé crawlerů logicky čekají, který ze tří přístupů se stane skutečným standardem.

Jaká je reálná adopce

Na straně vydavatelů je situace opačná - nasazení roste, protože je téměř zdarma. Cloudflare při spuštění v září 2025 přidal výchozí politiku search=yes, ai-train=no automaticky do spravovaného robots.txt u 3,8 milionu domén. Signál ai-input záměrně nechal prázdný, protože podle něj v této oblasti zatím neexistuje shoda.

To znamená, že řada webů má Content Signals nasazené, aniž o tom jejich majitelé vědí. Pokud web běží na Cloudflare, doporučuji si soubor robots.txt zkontrolovat.

Data o blokování AI botů ukazují, že vydavatelé postupují spíše selektivně než plošně. Podle analýzy více než 4 200 souborů robots.txt z konce července 2026 patřily mezi nejblokovanější trénovací crawlery GPTBot (633 domén), CCBot (567 domén) a ClaudeBot (563 domén). Podíl odpovědí HTTP 403 na požadavky AI botů dosáhl v červenci 2026 zhruba 9,6 % a v posledním týdnu měsíce vystoupal na 12,9 %, tedy více než dvojnásobek oproti roku 2025.

Pro srovnání: podle citovaných průzkumů blokuje trénovací AI boty asi 79 % velkých zpravodajských webů, ale pouze 14 % vydavatelů blokuje AI boty úplně všechny. To dobře ilustruje, o co většině z nich jde - nechtějí zmizet z AI odpovědí, chtějí jen nebýt zdarma tréninkovými daty.

Novinka z července 2026: parametr use a tři kategorie botů

Cloudflare specifikaci 1. července 2026 rozšířil. Vedle původních tří signálů přibyl volitelný parametr use, který popisuje, jak hluboko smí systém s obsahem pracovat:

User-agent: *
Content-Signal: search=yes, ai-train=no, use=reference
Allow: /
  • use=immediate - interakce s obsahem bez jeho ukládání,
  • use=reference - indexace, úryvek a zpětný odkaz (výchozí hodnota),
  • use=full - souhrn a reprodukce obsahu.

Zákazníkům se spravovaným robots.txt Cloudflare doplnil use=reference automaticky. Zároveň přestal pracovat s jednou obecnou kategorií „AI boti“ a rozdělil je na tři: Search (sbírá a indexuje obsah, aby o něm později odpovídal), Agent (jedná v reálném čase jménem konkrétního člověka) a Training (sbírá obsah pro trénink modelů).

Pozor na 15. září 2026

Od tohoto data platí pro nové domény na Cloudflare nové výchozí nastavení: na stránkách, které zobrazují reklamu, budou boti kategorií Training a Agent blokováni, zatímco kategorie Search zůstane povolena. Logika je taková, že přítomnost reklamy je signálem, že si provozovatel na stránce přeje lidského návštěvníka.

Zásadní je ale dopad na víceúčelové crawlery. Googlebot, Bingbot i Applebot procházejí web současně pro vyhledávání i pro AI. U zákazníků, kteří si zvolí blokaci kategorie Training, mohou být na reklamních stránkách blokováni také. To je přesně ten scénář, který dokáže nepozorovaně poškodit organickou viditelnost. Nastavení se dá změnit v sekci Security ještě před 15. zářím a doporučuji to na každém webu za Cloudflare ověřit.

Souvisí to s tím, na co jsem upozorňoval v článku AI boti mají HTTP 200. To ale ještě neznamená, že opravdu vidí váš obsah - mezi tím, co si myslíte, že jste nastavili, a tím, co robot skutečně dostane, bývá překvapivě velký rozdíl.

Content Signals versus cíle GEO

Tady je potřeba být upřímný. Většina mých klientů se dnes snaží o pravý opak toho, k čemu Content Signals vznikly. Chtějí být v AI odpovědích vidět, chtějí být citováni a chtějí odtud návštěvnost. Obor GEO (Generative Engine Optimization) stojí na tom, že AI systém obsah najde, pochopí a použije.

Z toho plyne jednoduché doporučení: signál ai-input obvykle nechcete nastavit na „no“. Odmítnutím vkládání obsahu do modelu v reálném čase byste odmítali přesně tu část AI ekosystému, která vám vrací návštěvnost. Data reportu Adobe, která jsem rozebíral v článku AI návštěvnost e-shopů roste o 393 %, ukazují, že tato návštěvnost konvertuje o 42 % lépe než ostatní zdroje. Zavírat před ní dveře nedává pro e-shop ani firemní web ekonomický smysl.

Naopak ai-train=no je pro většinu komerčních webů rozumná výchozí volba. Neplyne z něj žádné riziko pro viditelnost a představuje aspoň formální výhradu práv.

Typ webu Doporučené nastavení Proč
E-shop search=yes, ai-input=yes, ai-train=no Chce být v AI doporučeních produktů, netěží z tréninku
Firemní web a služby search=yes, ai-input=yes, ai-train=no Citace v AI odpovědi je nový kanál poptávek
Zpravodajství a magazín search=yes, ai-input=no, ai-train=no Model financovaný reklamou, AI souhrn nahrazuje návštěvu
Placený a členský obsah Disallow + blokace na úrovni serveru Deklarace nestačí, je nutné technické vynucení
Dokumentace a znalostní báze search=yes, ai-input=yes, ai-train=yes Cílem je maximální rozšíření znalosti o produktu

Co Content Signals rozhodně neumí

  • Nezabrání stažení obsahu. Jde o preferenci, nikoli o technické opatření.
  • Neblokují nic samy o sobě. Blokace se dělá direktivou Disallow, pravidly WAF nebo bot managementem.
  • Nezaručují právní vymahatelnost. Sám Cloudflare uvádí, že soudy mohou dojít k závěru, že robots.txt povinnosti nezakládá.
  • Nezastaví roboty, kteří robots.txt ignorují. Ti jej nečtou už dnes.
  • Nenahradí strukturovaná data ani kvalitní obsah. O tom, zda vás AI cituje, rozhoduje srozumitelnost a úplnost obsahu, ne direktiva.

Platí tedy jednoduché pravidlo: deklarace a vynucení jsou dvě různé vrstvy. Content Signals patří do první, firewall a bot management do druhé. Kdo očekává, že řádek v robots.txt zastaví scraping, bude zklamán. Technickou stránku připravenosti webu pro roboty a agenty rozebírám podrobněji v článku Jak připravit web pro AI agenty.

Praktický postup nasazení

  1. Zkontrolujte současný stav. Otevřete vasedomena.cz/robots.txt a podívejte se, zda tam už direktiva Content-Signal není - Cloudflare ji mohl doplnit automaticky.
  2. Rozhodněte o strategii. Odpovězte si, zda chcete být v AI odpovědích vidět. Pokud ano, ai-input nechte na yes nebo prázdné.
  3. Vygenerujte zápis. Použijte generátor na contentsignals.org nebo si direktivu napište ručně.
  4. Vložte i právní komentář. Bez něj přicházíte o hlavní přínos - výhradu práv podle článku 4.
  5. Nesahejte na signál search. Nastavení search=no nikdy nepoužívejte na webu, který chce být ve vyhledávačích.
  6. Ověřte, že soubor zůstal validní. V Google Search Console zkontrolujte report robots.txt, případně otestujte na platformě, kde je robots.txt omezený, zda se zápis vůbec propsal.
  7. Doplňte reálné blokace. Trénovací crawlery, které opravdu nechcete, zakažte direktivou Disallow na jejich user-agent.
  8. Nastavte vynucení. U citlivého obsahu přidejte pravidla na úrovni WAF nebo CDN.
  9. Zkontrolujte nastavení Cloudflare před 15. zářím 2026. Zejména kvůli víceúčelovým crawlerům a stránkám s reklamou.
  10. Sledujte logy. Bez analýzy serverových logů nezjistíte, kdo na web skutečně chodí a co dostává.

Závěr: levná pojistka, žádný zázrak

Content Signals jsou dobře navržený a srozumitelný pokus vyřešit reálný problém - robots.txt rozhoduje o přístupu, ale mlčí o použití. Zápis je triviální, náklady nulové a v evropském kontextu má díky výhradě práv podle článku 4 smysl i přesto, že jej zatím nikdo strojově nevyhodnocuje.

Zároveň je ale potřeba mít realistická očekávání. K srpnu 2026 direktiva nemění chování žádného významného crawleru. Pokud si od ní slibujete ochranu obsahu, sáhněte po blokaci na síťové úrovni. Pokud si od ní slibujete lepší viditelnost v AI, sáhněte po kvalitním a strukturovaném obsahu.

Osobně ji doporučuji nasadit ve variantě search=yes, ai-input=yes, ai-train=no - stojí to pět minut, nic nerozbije, vyjadřuje jasné stanovisko a pokud se standard prosadí, budete připraveni. Rozhodně bych ale kolem ní nestavěl obsahovou strategii. Ta se dnes rozhoduje jinde: v tom, jak srozumitelně a úplně web odpovídá na otázky uživatelů.

Zdroje

Článek popisuje stav k 31. srpnu 2026. Oblast se rychle vyvíjí, proto před nasazením ověřte aktuální dokumentaci Cloudflare i jednotlivých provozovatelů crawlerů. Text nepředstavuje právní poradenství - k otázkám výhrady autorských práv konzultujte advokáta.

Nevíte, koho na svůj web pouštíte a co odtud odnáší?

Projdu vaše robots.txt, nastavení Cloudflare i serverové logy a nastavím pravidla tak, abyste zůstali vidět tam, kde to má obchodní smysl.

Technický audit webu GEO Dlouhodobá SEO správa
Přidat do preferovaných zdrojů na Googlu

Chcete mít nad AI crawlery skutečnou kontrolu?

Nastavíme robots.txt, blokace i strategii viditelnosti v AI vyhledávačích tak, aby dávaly obchodní smysl.

Nezávazně poptat SEO a GEO služby