Sniper Design

AI vyhledávání

AI crawlery a robots.txt: pustit je, nebo blokovat?

AI crawlery a robots.txt: pustit je, nebo blokovat?
GPTBot, ClaudeBot, PerplexityBot a další — co který dělá, jak je řídit v robots.txt a proč plošná blokace může e-shopu uškodit víc, než čekáte.

AI crawlery jsou vyhledávací roboti, kteří načítají obsah webů pro potřeby umělé inteligence. Dělí se na tři typy: tréninkové (sbírají data pro učení modelů), vyhledávací (indexují pro vyhledávání uvnitř AI nástrojů) a ty vyvolané uživatelem. Řídí se v souboru robots.txt a rozdíl mezi typy je zásadní — blokace vyhledávacího robota může omezit vaši viditelnost v odpovědích.

„Zablokovali jsme AI botům přístup" zní jako rozumné obranné opatření. V praxi to ale může znamenat, že si firma zavřela cestu do odpovědí ChatGPT nebo Perplexity — aniž by to měla v úmyslu. Rozdíl mezi jednotlivými roboty je totiž větší, než se zdá.

Tři typy AI robotů

Než začnete cokoli blokovat, je potřeba vědět, co který robot dělá:

  1. Tréninkoví — sbírají obsah, ze kterého se učí jazykové modely. Když je zablokujete, provozovatel by váš obsah k tréninku použít neměl. Na to, jestli vás AI zmíní v odpovědi, to přímo nemíří.
  2. Vyhledávací — indexují web pro vyhledávání uvnitř AI nástroje. Tady blokace bolí nejvíc: bez nich se do odpovědí dostáváte hůř.
  3. Vyvolaní uživatelem — načtou konkrétní stránku, když o to uživatel v chatu požádá (třeba když vloží odkaz).

Kdo je kdo: přehled běžných robotů

RobotProvozovatelTypCo znamená jeho blokace
OAI-SearchBotOpenAIvyhledávacípodle dokumentace se vyloučené weby nebudou zobrazovat ve výsledcích vyhledávání ChatGPT
GPTBotOpenAItréninkovýobsah se nemá použít k trénování modelů
ChatGPT-UserOpenAIakce uživateletýká se načtení vyvolaného uživatelem
Claude-SearchBotAnthropicvyhledávacípodle dokumentace snižuje viditelnost ve výsledcích
ClaudeBotAnthropictréninkovýobsah se nemá použít pro vývoj modelů
Claude-UserAnthropicakce uživatelesystém nezíská obsah v reakci na dotaz uživatele
PerplexityBotPerplexityvyhledávacíomezí zařazení do odpovědí Perplexity
Perplexity-UserPerplexityakce uživateletýká se načtení na přímý pokyn uživatele
Google-ExtendedGoogleřídicí tokenovlivňuje použití obsahu pro Gemini — viz níže
CCBotCommon Crawltréninkovýobsah se nedostane do veřejného datasetu, který bývá zdrojem tréninkových dat

Přesné chování a aktuální seznam robotů najdete v oficiálních dokumentacích: OpenAI, Anthropic a Google. Vyplatí se je občas zkontrolovat — roboti přibývají a mění se.

Pozor na Google-Extended

Tenhle případ se plete nejčastěji. Podle dokumentace Googlu Google-Extended není samostatný robot, ale řídicí token v robots.txt — nemá vlastní identifikaci user-agenta. Ovlivňuje, jestli se procházený obsah použije pro trénink budoucích modelů Gemini a pro takzvaný grounding v Gemini Apps a Vertex AI. Google zároveň výslovně uvádí, že neovlivňuje zařazení webu v Google Search ani se nepoužívá jako hodnoticí signál.

Jak roboty řídit v robots.txt

Pravidla se zapisují pro každého robota zvlášť. Pokud chcete být vidět v AI odpovědích, ale nechcete přispívat do trénování modelů, může to vypadat takhle:

# Vyhledávací roboti — pustit (chci být vidět v odpovědích)
User-agent: OAI-SearchBot
Allow: /
Disallow: /admin/
Disallow: /api/

User-agent: Claude-SearchBot
Allow: /
Disallow: /admin/
Disallow: /api/

User-agent: PerplexityBot
Allow: /
Disallow: /admin/
Disallow: /api/

# Tréninkoví roboti — zakázat (nechci přispívat do tréninku)
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Všichni ostatní
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /api/

Sitemap: https://www.priklad.cz/sitemap.xml

Pozor na časté nedorozumění: robot se řídí jen tím blokem, který je pro něj určený — pravidla z bloku User-agent: * se na něj nevztahují. Pokud tedy někomu povolíte celý web přes Allow: /, musíte mu v jeho vlastním bloku zopakovat i zákazy pro neveřejné části. Jinak mu je fakticky zpřístupníte.

My jsme na vlastním robots.txt zvolili opačný přístup — AI roboty pouštíme včetně tréninkových, protože chceme, aby nás AI nástroje uměly načíst a pochopit. Je to obchodní rozhodnutí, ne technická nutnost, a nezaručuje nám to žádné citace.

Pustit, nebo blokovat? Obojí má své důvody

Neexistuje jedna správná odpověď — záleží na tom, čím se živíte:

  1. Pustit dává smysl, když je pro vás viditelnost cennější než obsah sám. Typicky e-shopy, služby, lokální firmy: chcete, aby vás AI doporučila.
  2. Blokovat tréninkové roboty dává smysl, když je vaším produktem samotný obsah — média, kurzy, databáze, originální fotografie. Tam je legitimní nechtít, aby se z vaší práce trénoval model.
  3. Blokovat vyhledávací roboty má smysl jen výjimečně. Je to volba „nechci být v AI odpovědích vidět" — a tu je dobré udělat vědomě.

Důležitá poznámka: robots.txt je dobrovolný standard. Slušní provozovatelé ho respektují, ale není to technická ochrana obsahu. Kdo ho ignoruje, toho jím nezastavíte.

Časté chyby

  1. Plošná blokace „všeho s AI v názvu". Nejrychlejší způsob, jak si zavřít cestu do AI odpovědí.
  2. Blokace v přesvědčení, že to ochrání obsah. Chrání jen před těmi, kdo pravidla dodržují.
  3. Zaměňování Google-Extended za vyhledávání. S indexací v Google Search nesouvisí.
  4. Nastavit a zapomenout. Roboti přibývají a mění se; robots.txt patří do pravidelné kontroly.
  5. Zapomenuté Disallow z vývoje. Občas se stane, že na produkci zůstane blokace celého webu.

Často kladené otázky

Zablokuje robots.txt AI spolehlivě?

Ne. Je to dobrovolný standard — respektují ho ti, kdo chtějí. Není to technická ochrana obsahu a nezabrání ani tomu, aby se informace o vás dostaly k modelům jinou cestou, například přes zmínky na jiných webech.

Když zablokuju GPTBot, zmizím z ChatGPT?

Podle dokumentace OpenAI slouží GPTBot k trénování modelů, ne k vyhledávání. Pro zobrazení ve vyhledávání ChatGPT je podstatný OAI-SearchBot — ten je potřeba nechat projít.

Ovlivní Google-Extended moje pozice v Googlu?

Podle dokumentace Googlu ne. Google-Extended řeší použití obsahu pro modely Gemini a Google uvádí, že neovlivňuje zařazení webu ve vyhledávání ani není hodnoticím signálem.

Mám AI roboty pustit, nebo zakázat?

Záleží na tom, jestli je pro vás cennější viditelnost, nebo ochrana obsahu. E-shopy a služby obvykle chtějí být vidět; tvůrci původního obsahu mohou chtít omezit alespoň trénink. Rozhodujte se podle typu robota, ne plošně.

Závěr

Řízení AI robotů není otázka „ano, nebo ne", ale otázka, kterému robotovi co dovolíte. Kdo si to rozdělí na trénink a vyhledávání, může si nechat kontrolu nad svým obsahem a přitom si nezavřít cestu k viditelnosti. Plošná blokace je pohodlná, ale často stojí přesně to, o co e-shopu jde.

Nevíte, jestli váš web AI roboty pouští, nebo blokuje? Projděte si svůj robots.txt — a pokud chcete pomoct s celkovou viditelností v AI vyhledávání, podívejte se na naši službu SEO pro AI vyhledávače. Souvislosti vysvětlujeme i v článcích co je GEO a llms.txt pro e-shop.