Die Datei folgt dem Robots Exclusion Protocol, das 2022 als RFC 9309 standardisiert wurde. Sie enthält Regeln je Crawler (User-agent) mit Allow- und Disallow-Anweisungen sowie optional den Verweis auf die XML-Sitemap. Google liest die Datei vor jedem Crawl-Vorgang und respektiert die Regeln, ebenso die meisten seriösen Crawler. Böswillige Bots ignorieren sie.
Zwei Fehler sehe ich regelmäßig. Erstens wird die robots.txt genutzt, um Seiten aus dem Index zu halten; dafür ist die noindex-Anweisung zuständig. Zweitens blockieren Regeln versehentlich CSS- und JavaScript-Dateien, sodass Google Seiten nicht korrekt rendern kann. Neu hinzugekommen ist die Entscheidung, welche KI-Crawler wie GPTBot oder Google-Extended zugelassen werden.