AI vyhledávání
AI crawlery a robots.txt: pustit je, nebo blokovat?
AI crawlery jsou vyhledávací roboti, kteří načítají obsah webů pro potřeby umělé inteligence. Dělí se na tři typy: tréninkové (sbírají data pro učení modelů), vyhledávací (indexují pro vyhledávání uvnitř AI nástrojů) a ty vyvolané uživatelem. Řídí se v souboru robots.txt a rozdíl mezi typy je zásadní — blokace vyhledávacího robota může omezit vaši viditelnost v odpovědích.
„Zablokovali jsme AI botům přístup" zní jako rozumné obranné opatření. V praxi to ale může znamenat, že si firma zavřela cestu do odpovědí ChatGPT nebo Perplexity — aniž by to měla v úmyslu. Rozdíl mezi jednotlivými roboty je totiž větší, než se zdá.
Tři typy AI robotů
Než začnete cokoli blokovat, je potřeba vědět, co který robot dělá:
- Tréninkoví — sbírají obsah, ze kterého se učí jazykové modely. Když je zablokujete, provozovatel by váš obsah k tréninku použít neměl. Na to, jestli vás AI zmíní v odpovědi, to přímo nemíří.
- Vyhledávací — indexují web pro vyhledávání uvnitř AI nástroje. Tady blokace bolí nejvíc: bez nich se do odpovědí dostáváte hůř.
- Vyvolaní uživatelem — načtou konkrétní stránku, když o to uživatel v chatu požádá (třeba když vloží odkaz).
Kdo je kdo: přehled běžných robotů
| RobotProvozovatelTypCo znamená jeho blokace | |||
OAI-SearchBot | OpenAI | vyhledávací | podle dokumentace se vyloučené weby nebudou zobrazovat ve výsledcích vyhledávání ChatGPT |
GPTBot | OpenAI | tréninkový | obsah se nemá použít k trénování modelů |
ChatGPT-User | OpenAI | akce uživatele | týká se načtení vyvolaného uživatelem |
Claude-SearchBot | Anthropic | vyhledávací | podle dokumentace snižuje viditelnost ve výsledcích |
ClaudeBot | Anthropic | tréninkový | obsah se nemá použít pro vývoj modelů |
Claude-User | Anthropic | akce uživatele | systém nezíská obsah v reakci na dotaz uživatele |
PerplexityBot | Perplexity | vyhledávací | omezí zařazení do odpovědí Perplexity |
Perplexity-User | Perplexity | akce uživatele | týká se načtení na přímý pokyn uživatele |
Google-Extended | řídicí token | ovlivňuje použití obsahu pro Gemini — viz níže | |
CCBot | Common Crawl | tréninkový | obsah se nedostane do veřejného datasetu, který bývá zdrojem tréninkových dat |
Přesné chování a aktuální seznam robotů najdete v oficiálních dokumentacích: OpenAI, Anthropic a Google. Vyplatí se je občas zkontrolovat — roboti přibývají a mění se.
Pozor na Google-Extended
Tenhle případ se plete nejčastěji. Podle dokumentace Googlu Google-Extended není samostatný robot, ale řídicí token v robots.txt — nemá vlastní identifikaci user-agenta. Ovlivňuje, jestli se procházený obsah použije pro trénink budoucích modelů Gemini a pro takzvaný grounding v Gemini Apps a Vertex AI. Google zároveň výslovně uvádí, že neovlivňuje zařazení webu v Google Search ani se nepoužívá jako hodnoticí signál.
Jak roboty řídit v robots.txt
Pravidla se zapisují pro každého robota zvlášť. Pokud chcete být vidět v AI odpovědích, ale nechcete přispívat do trénování modelů, může to vypadat takhle:
Pozor na časté nedorozumění: robot se řídí jen tím blokem, který je pro něj určený — pravidla z bloku User-agent: * se na něj nevztahují. Pokud tedy někomu povolíte celý web přes Allow: /, musíte mu v jeho vlastním bloku zopakovat i zákazy pro neveřejné části. Jinak mu je fakticky zpřístupníte.
My jsme na vlastním robots.txt zvolili opačný přístup — AI roboty pouštíme včetně tréninkových, protože chceme, aby nás AI nástroje uměly načíst a pochopit. Je to obchodní rozhodnutí, ne technická nutnost, a nezaručuje nám to žádné citace.
Pustit, nebo blokovat? Obojí má své důvody
Neexistuje jedna správná odpověď — záleží na tom, čím se živíte:
- Pustit dává smysl, když je pro vás viditelnost cennější než obsah sám. Typicky e-shopy, služby, lokální firmy: chcete, aby vás AI doporučila.
- Blokovat tréninkové roboty dává smysl, když je vaším produktem samotný obsah — média, kurzy, databáze, originální fotografie. Tam je legitimní nechtít, aby se z vaší práce trénoval model.
- Blokovat vyhledávací roboty má smysl jen výjimečně. Je to volba „nechci být v AI odpovědích vidět" — a tu je dobré udělat vědomě.
Důležitá poznámka: robots.txt je dobrovolný standard. Slušní provozovatelé ho respektují, ale není to technická ochrana obsahu. Kdo ho ignoruje, toho jím nezastavíte.
Časté chyby
- Plošná blokace „všeho s AI v názvu". Nejrychlejší způsob, jak si zavřít cestu do AI odpovědí.
- Blokace v přesvědčení, že to ochrání obsah. Chrání jen před těmi, kdo pravidla dodržují.
- Zaměňování Google-Extended za vyhledávání. S indexací v Google Search nesouvisí.
- Nastavit a zapomenout. Roboti přibývají a mění se; robots.txt patří do pravidelné kontroly.
- Zapomenuté
Disallowz vývoje. Občas se stane, že na produkci zůstane blokace celého webu.
Často kladené otázky
Zablokuje robots.txt AI spolehlivě?
Ne. Je to dobrovolný standard — respektují ho ti, kdo chtějí. Není to technická ochrana obsahu a nezabrání ani tomu, aby se informace o vás dostaly k modelům jinou cestou, například přes zmínky na jiných webech.
Když zablokuju GPTBot, zmizím z ChatGPT?
Podle dokumentace OpenAI slouží GPTBot k trénování modelů, ne k vyhledávání. Pro zobrazení ve vyhledávání ChatGPT je podstatný OAI-SearchBot — ten je potřeba nechat projít.
Ovlivní Google-Extended moje pozice v Googlu?
Podle dokumentace Googlu ne. Google-Extended řeší použití obsahu pro modely Gemini a Google uvádí, že neovlivňuje zařazení webu ve vyhledávání ani není hodnoticím signálem.
Mám AI roboty pustit, nebo zakázat?
Záleží na tom, jestli je pro vás cennější viditelnost, nebo ochrana obsahu. E-shopy a služby obvykle chtějí být vidět; tvůrci původního obsahu mohou chtít omezit alespoň trénink. Rozhodujte se podle typu robota, ne plošně.
Závěr
Řízení AI robotů není otázka „ano, nebo ne", ale otázka, kterému robotovi co dovolíte. Kdo si to rozdělí na trénink a vyhledávání, může si nechat kontrolu nad svým obsahem a přitom si nezavřít cestu k viditelnosti. Plošná blokace je pohodlná, ale často stojí přesně to, o co e-shopu jde.
Nevíte, jestli váš web AI roboty pouští, nebo blokuje? Projděte si svůj robots.txt — a pokud chcete pomoct s celkovou viditelností v AI vyhledávání, podívejte se na naši službu SEO pro AI vyhledávače. Souvislosti vysvětlujeme i v článcích co je GEO a llms.txt pro e-shop.