Co je robots.txt
Robots.txt je textový soubor, který umožňuje správci webu zakázat nebo povolit přístup některým robotům (botů), např. GoogleBot, SeznamBot a další.
Modul robots.txt v e-shopu
E-shop obsahuje modul, díky kterému můžete rozšířit obsah souboru robots.txt. Textové pole pro doplnění obsahu robots.txt se nachází v Nastavení ▸ SEO. Na jeho obsah není aplikována validace, takže jej můžete upravovat bez omezení.
Pomocí direktiv Disallow, Allow a User-agent můžete určovat, které částí e-shopu mají či nemají roboti procházet. Díky tomuto můžete lépe využívat přidělený Crawl Budget, tedy řídit, jakým stránkám vašeho e-shopu se májí roboti věnovat v rámci časového limitu přiděleného pro váš web.
V souboru robots.txt můžete také omezit četnost procházení roboty pomocí direktivy Request-rate (Seznam) a Crawl-delay (Bing, Yahoo,
Yandex, …). Tímto můžete snížít i celkový počet přístupů roboty. Omezení pro Google lze nastavit v nástroji Google Search Console.
Robots.txt na e-shopu obsahuje již tento výchozí blok direktiv:
- User-agent: * – Definuje blok direktiv určené pro všechny roboty.
- Sitemap – Odkaz na sitemap.xml. Není tak potřeba uvádět v administraci.
- Disallow: /admin/ – Zakázání procházení administrace.
- Request-rate: 30/1m – Doporučená rychlost procházení pro SeznamBot. Maximálně 30 přístupů za minutu. V případě, že ji chcete změnit, lze ji předefinovat direktivou v bloku pro konkrétní User-agent: SeznamBot. Toto můžete doplnit v administraci ve zmiňovaném textovém poli.
- Crawl-delay: 10 – Doporučená rychlost procházení (pro Yahoo, Bing, Yandex a další). Jeden přístup během 10 sekund. Stejně jako pro Request-rate lze ji předefinovat v bloku pro konkrétní User-agent.
Více o robots.txt se dočtete v nápovědě Google, Seznam.cz a přiložený článcích: