robots.txt
Die robots.txt ist eine Textdatei im Hauptverzeichnis einer Website (beispielfirma.de/robots.txt), die Suchmaschinen-Crawlern mitteilt, welche Bereiche der Website sie nicht besuchen sollen.
Die robots.txt ist eine Textdatei im Hauptverzeichnis einer Website (beispielfirma.de/robots.txt), die Suchmaschinen-Crawlern mitteilt, welche Bereiche der Website sie nicht besuchen sollen — etwa das Admin-Backend, interne Suchergebnisse oder Systemverzeichnisse. Zusätzlich verweist sie meist auf die XML-Sitemap.
Zwei Missverständnisse sind verbreitet. Erstens: Die robots.txt ist eine Bitte, kein Schutz. Seriöse Crawler halten sich daran, unseriöse nicht; vertrauliche Inhalte gehören hinter ein Login, nicht in die robots.txt. Zweitens: Eine per robots.txt gesperrte Seite kann trotzdem im Google-Index landen (ohne Inhalt, nur mit URL), wenn andere Seiten darauf verlinken — wer eine Seite aus der Suche haben will, braucht das noindex-Tag, nicht die robots.txt. Der klassische Unfall: Die Staging-Umgebung ist per robots.txt gesperrt, wird auf den Live-Server kopiert, und die Sperre kommt mit. Die Website verschwindet aus Google, und niemand versteht, warum.
Siehe auch