robots.txt
Eine Textdatei im Stammverzeichnis einer Website, die Suchmaschinen-Crawlern mitteilt, welche Adressen sie abrufen dürfen und welche außen vor bleiben.
Die Datei liegt im Stammverzeichnis einer Domain, also unter ihre-domain.de/robots.txt, und steuert den Zugriff der Crawler. Sie regelt damit das Crawling und bewahrt den Server vor unnötiger Last durch automatische Abrufe.
Was sie leistet und wofür sie nicht gedacht ist
Google schreibt ausdrücklich, dass die robots.txt nicht dazu dient, Webseiten aus der Suche auszuschließen. Eine gesperrte Adresse kann durchaus im Index erscheinen, sobald andere Websites auf sie verweisen. Zum Ausschluss aus den Ergebnissen nennt Google das noindex-Meta-Tag, einen entsprechenden Antwortheader wie das X-Robots-Tag oder einen Passwortschutz.
Der Bezug zum Linkaufbau
Zielseiten für eingehende Verweise bleiben abrufbar, damit Suchmaschinen den Zusammenhang zwischen Verweis und Inhalt herstellen können. Für Bereiche ohne Suchwert, etwa interne Filterseiten, eignet sich die Sperre dagegen gut und schont das Crawl-Budget.