Robots.txt: k čemu je a jak ho správně nastavit
Soubor robots.txt je jednoduchý textový soubor, který říká vyhledávačům, co mají nebo nemají procházet. Neřeší zabezpečení, ale pomáhá řídit indexaci. Pro SEO je důležitý, protože zabraňuje indexaci nepotřebných částí webu a zefektivňuje práci robotů.
Pokud chcete rychle vytvořit základní verzi, použijte generátor robots.txt.
Vysvětlení pojmu
Robots.txt je součástí standardu Robots Exclusion Protocol. Vyhledávače ho při návštěvě webu obvykle kontrolují jako první. V souboru můžete nastavit pravidla pro jednotlivé user-agenty (roboty). Například Googlebot může mít jiná pravidla než Bingbot.
Soubor se umísťuje do kořene webu, tedy na adresu https://domena.cz/robots.txt. Pokud není dostupný, robot pokračuje a prochází web bez omezení.
Jak to vytvořit ručně
Robots.txt se píše jako jednoduchý text:
- User-agent: určuje pro koho pravidlo platí (např. * pro všechny).
- Disallow: zakáže procházení konkrétního adresáře.
- Allow: naopak povolí konkrétní cestu.
Příklad:
User-agent: *
Disallow: /admin/
Tím zakážete indexaci administrace pro všechny roboty. Pokud chcete výjimku, použijte Allow.
Praktické příklady
Příklad 1: Zákaz indexace /admin/ a /private/.
Příklad 2: Povolení /media/ a zákaz /tmp/.
Příklad 3: Speciální pravidlo pro Googlebot, které povolí více než ostatním.
Dobře nastavený robots.txt zlepší indexaci a ušetří crawl budget, což je důležité zejména u větších webů.
Jak ověřit nastavení
Po vytvoření robots.txt je dobré ho otestovat. V Google Search Console najdete nástroj pro kontrolu robots.txt. Ten vám ukáže, zda jsou důležité stránky přístupné robotům.
U menších webů stačí rychlá kontrola v prohlížeči – otevřete robots.txt a zkontrolujte, že neobsahuje zbytečné zákazy.
Online nástroj
Generátor robots.txt vám umožní vytvořit základní soubor během chvilky. Pokud řešíte i sitemap, hodí se generátor sitemap.
Typické scénáře použití
Nejčastější použití robots.txt je blokace administrace nebo interních částí webu. U e-shopů se často blokují filtry a parametry URL, které by zbytečně zahlcovaly index. U redakčních systémů se blokují například systémové adresáře nebo preview stránky.
Důležité je také nastavit pravidla pro různé boty. Například některé marketingové nástroje (audit boty) nemusíte chtít pustit na celý web. U veřejně dostupného obsahu však bývá nejlepší jednoduše povolit vše a blokovat jen citlivé části.
Robots.txt lze kombinovat se sitemap. Tím dáte vyhledávačům jasně najevo, co má být procházeno a kde jsou všechny důležité stránky.
Checklist pro robots.txt
- Ověřte, že neblokujete důležité stránky.
- Přidejte odkaz na sitemap.xml.
- Otestujte robots.txt v Search Console.
- Po změnách webu soubor znovu zkontrolujte.
Tipy a časté chyby
- Robots.txt není ochrana: nezabrání přístupu, jen indexaci.
- Nechtěný zákaz: pozor na Disallow: / – to zablokuje celý web.
- Chybějící sitemap: doporučuje se přidat odkaz na sitemap.xml.
- Testování: ověřte si pravidla v Google Search Console.
- Špatné cesty: ujistěte se, že zakazujete opravdu správnou URL.
Co do robots.txt nepatří
Robots.txt není nástroj pro zabezpečení. Pokud v souboru uvedete citlivé adresáře, jen upozorníte na jejich existenci. Citlivé části webu je potřeba zabezpečit heslem nebo omezením přístupu.
Také je potřeba být opatrný s příliš širokými pravidly. Disallow: / zablokuje celý web a může způsobit, že vaše stránky zmizí z vyhledávání. U větších webů je vhodné robots.txt pravidelně kontrolovat.
Robots.txt by také neměl blokovat soubory, které jsou nutné pro správné vykreslení stránky (například CSS a JS). Pokud Google nemůže načíst styly, může stránku vyhodnotit jako méně kvalitní.
- Nezveřejňujte citlivé adresáře: robots.txt není ochrana.
- Nezakazujte celý web: Disallow: / je kritická chyba.
- Nezakazujte CSS/JS: robot potřebuje vidět stránku jako uživatel.
- Pravidelně kontrolujte: zvlášť po redesignu webu.
Pokud používáte více domén nebo subdomén, každá může mít vlastní robots.txt. Nezapomeňte tedy vytvořit soubor pro každou doménu zvlášť, jinak se může stát, že roboty budou mít omezený přístup.
U složitějších webů je vhodné vytvořit si seznam adresářů, které chcete blokovat. Tak předejdete náhodným chybám. V praxi jde často o administrační sekce, dočasné stránky, nebo interní vyhledávání.
Pokud spravujete web ve více prostředích (například staging), ujistěte se, že robots.txt ve veřejném prostředí není příliš restriktivní. Stává se, že pravidla ze stagingu zůstanou v produkci a web se přestane indexovat.
Jednoduché pravidlo: co nechcete ve výsledcích vyhledávání, buď blokujte, nebo označte noindex. Robots.txt je jen jedna z možností, ale často stačí.
U vícejazyčných webů se doporučuje robots.txt ponechat jednoduchý a spíše se soustředit na správné sitemap a kanonické URL. Příliš složitá pravidla mohou vést k nečekanému chování robotů.
FAQ
Může robots.txt zabránit hacknutí?
Ne, slouží jen pro vyhledávače, ne jako zabezpečení.
Musím mít robots.txt?
Není povinný, ale je doporučený pro správnou indexaci.
Jak zjistím, že je správný?
Google nabízí nástroj pro kontrolu robots.txt v Search Console.
Může robots.txt zablokovat celý web?
Ano, pokud nastavíte Disallow: /, web se přestane indexovat.
Je vhodné blokovat /admin/?
Ano, administraci není potřeba indexovat, takže je dobré ji zakázat.
Robots.txt a SEO v praxi
Správně nastavený robots.txt pomáhá vyhledávačům soustředit se na důležitý obsah. Pokud máte například e‑shop s tisíci URL a filtry, robots.txt může zabránit tomu, aby se robot zacyklil v nekonečných kombinacích filtrů.
Robots.txt by ale neměl blokovat stránky, které chcete indexovat. Pokud máte pochybnosti, je lepší nic neblokovat a případně použít jiné nástroje jako noindex. Robots.txt slouží spíše pro optimalizaci procházení než pro přímé řízení indexace.
Dobrým zvykem je pravidelně kontrolovat robots.txt po větších změnách na webu. I malá chyba může mít velký dopad, například náhodný zákaz důležité sekce webu.
Závěr
Robots.txt je jednoduchý, ale důležitý soubor. Správným nastavením můžete řídit indexaci a zlepšit SEO. Použijte náš generátor a ušetřete čas. Další SEO tipy najdete v článcích Utilio.