Google ignoriert Robots.txt: Was kleine Unternehmen jetzt wissen müssen

Google ignoriert Robots.txt: Was kleine Unternehmen jetzt wissen müssen

Zuletzt aktualisiert: 26. Juli 2026

Quick Answer: Google kann robots.txt-Anweisungen unter bestimmten Umständen ignorieren, zum Beispiel wenn eine gesperrte Seite von externen Seiten verlinkt wird. Seit Juli 2026 hat Google zusätzlich bestätigt, dass weit verbreitete KI-Schutz-Direktiven in robots.txt (wie Cloudflares „content-signal“) keinerlei Wirkung haben. Für kleine Unternehmen bedeutet das: robots.txt allein reicht nicht, um unerwünschte Inhalte aus dem Google-Index fernzuhalten.

Key Takeaways

  • robots.txt ist kein Sicherheitsmechanismus. Google selbst sagt: Die Datei soll Serverlast reduzieren, nicht Seiten aus dem Index ausschließen. [3]
  • Verlinkte Seiten können trotz robots.txt-Sperre indexiert werden. Wenn externe Seiten auf eine gesperrte URL zeigen, kann Google diese URL kennen und anzeigen, auch ohne den Inhalt zu crawlen.
  • Cloudflares „content-signal“-Direktive wird von Google vollständig ignoriert. John Mueller bestätigte am 6. Juli 2026: kein Crawler, kein LLM beachtet diese Direktive. [1][4]
  • Der Meta-Robots-Tag ist zuverlässiger als robots.txt, wenn Sie Seiten wirklich aus dem Index ausschließen wollen.
  • Kleine Unternehmen sind besonders betroffen, weil sie oft keine technische Kontrolle über ihre robots.txt haben und auf Standardkonfigurationen vertrauen.
  • Falsch konfigurierte robots.txt-Dateien können wichtige Seiten versehentlich blockieren und Rankings kosten.
  • Google belohnt saubere Arbeit: Eine korrekt gepflegte robots.txt in Kombination mit dem richtigen Einsatz von noindex-Tags ist die solide Grundlage.
  • Google Search Console bietet ein kostenloses Tool, um die robots.txt zu testen und Crawling-Probleme zu erkennen.

Was ist robots.txt und wofür ist sie da?

Die robots.txt ist eine einfache Textdatei, die im Hauptverzeichnis einer Website liegt (z. B. ihrebetrieb.de/robots.txt). Sie teilt Suchmaschinen-Crawlern mit, welche Bereiche der Website sie besuchen dürfen und welche nicht.

Wichtig zu verstehen: robots.txt ist ein Hinweis, keine Sperre. Seriöse Crawler wie Googlebot halten sich freiwillig daran. Andere Bots ignorieren sie komplett. [3]

Typische Einsatzzwecke:

  • Interne Suchseiten oder Filterergebnisse vom Crawling ausschließen
  • Staging-Umgebungen schützen
  • Crawling-Budget auf wichtige Seiten konzentrieren
  • Doppelte Inhalte reduzieren

Für einen Handwerksbetrieb mit einer überschaubaren Website ist robots.txt oft weniger relevant als für große Online-Shops. Trotzdem sollte die Datei korrekt konfiguriert sein, denn ein falscher Eintrag kann die gesamte Website für Google unsichtbar machen.

Warum ignoriert Google die robots.txt-Datei?

Google ignoriert robots.txt nicht pauschal, aber es gibt konkrete Situationen, in denen die Datei keine Wirkung hat. Das Thema „Google ignoriert Robots.txt: Was kleine Unternehmen jetzt wissen müssen“ ist deshalb aktueller denn je.

Situation 1: Verlinkte Seiten trotz Sperrung Wenn eine externe Website auf eine URL verlinkt, die in Ihrer robots.txt gesperrt ist, kann Google diese URL trotzdem kennen und in den Index aufnehmen, allerdings ohne den Seiteninhalt zu crawlen. Das Ergebnis: Die URL erscheint in den Suchergebnissen, aber ohne Titel und Beschreibung. Das sieht unprofessionell aus und kann Klicks kosten.

Situation 2: KI-Schutz-Direktiven ohne Wirkung Am 6. Juli 2026 bestätigte John Mueller (Google) auf Reddit: Cloudflares „content-signal“-Direktive in robots.txt hat keinerlei Wirkung auf Google-Crawler oder KI-Systeme. [1][4] Diese Direktive ist bereits auf rund 20 % aller Websites eingebaut, aber sie schützt nicht vor Google. [1]

Situation 3: Google Gemini Notebook Fetcher Im Juli 2026 wurde bekannt, dass Google den User-Agent eines KI-bezogenen Crawlers (für Gemini Notebook) umbenennt. Die alte Bezeichnung wird nur noch bis August 2026 unterstützt. [7] Wer diesen Bot in der robots.txt blockieren wollte, muss die Einträge aktualisieren.

Kernaussage aus der Google-Dokumentation: robots.txt ist „kein Mechanismus, um eine Seite aus Google herauszuhalten.“ [3]

Wie wirkt sich das auf mein SEO-Ranking aus?

Das hängt davon ab, was in Ihrer robots.txt steht und ob die Konfiguration korrekt ist.

Negative Auswirkungen durch falsche robots.txt:

  • Wichtige Seiten werden nicht gecrawlt und nicht indexiert
  • Das Crawling-Budget wird auf unwichtige Bereiche verschwendet
  • Gesperrte Seiten erscheinen ohne Inhalt in den Suchergebnissen, wenn sie extern verlinkt sind

Negative Auswirkungen durch ignorierte robots.txt:

  • Inhalte, die Sie nicht indexiert haben wollten (z. B. Testseiten, doppelte Inhalte), erscheinen in Google
  • Das kann die Qualität Ihres Gesamtauftritts bei Google verschlechtern
  • Crawling-Ressourcen werden auf unerwünschte Seiten verwendet

Für kleine Betriebe gilt: Eine falsch konfigurierte robots.txt ist oft gefährlicher als gar keine. Wer seine Handwerker-Website technisch sauber aufstellt, vermeidet diese Probleme von Anfang an.

robots.txt vs. Meta-Robots-Tag: Was ist der Unterschied?

robots.txt vs. Meta-Robots-Tag: Was ist der Unterschied?

Beide Werkzeuge steuern, was Google crawlt und indexiert, aber sie funktionieren unterschiedlich.

Merkmal robots.txt Meta-Robots-Tag
Wirkung Verhindert das Crawlen Verhindert die Indexierung
Zuverlässigkeit Kann ignoriert werden Wird von Google zuverlässig beachtet
Einsatzort Datei im Root-Verzeichnis Im <head> jeder einzelnen Seite
Seite aus Index entfernen Nicht geeignet Geeignet (noindex)
Crawling-Budget steuern Geeignet Nicht geeignet

Fazit: Wenn Sie eine Seite wirklich aus dem Google-Index ausschließen wollen, verwenden Sie den Meta-Robots-Tag mit noindex. Die robots.txt allein reicht dafür nicht. [3]

Ein häufiger Fehler: Betriebe blockieren eine Seite in robots.txt und setzen noindex. Das ist kontraproduktiv, weil Google dann die noindex-Anweisung gar nicht lesen kann, da die Seite nicht gecrawlt wird.

Sollte ich meine robots.txt noch verwenden, wenn Google sie ignoriert?

Ja, aber mit realistischen Erwartungen. robots.txt hat weiterhin sinnvolle Einsatzzwecke, solange Sie wissen, was sie kann und was nicht.

Sinnvolle Einsatzzwecke 2026:

  • Crawling-Budget auf wichtige Seiten lenken (besonders bei großen Websites)
  • Interne Tools oder Admin-Bereiche vom Crawling ausschließen
  • Doppelte Inhalte durch Parameter-URLs reduzieren

Was robots.txt nicht kann:

  • Seiten zuverlässig aus dem Index entfernen
  • KI-Crawler oder LLMs blockieren (laut Google-Bestätigung) [1][4]
  • Sicherheitssensible Inhalte schützen (dafür brauchen Sie ein Passwort oder Zugangsbeschränkungen)

Für einen kleinen Handwerksbetrieb mit 10-20 Seiten ist robots.txt oft nur eine kurze Datei mit wenigen Einträgen. Das ist in Ordnung. Wichtiger ist, dass keine wichtigen Seiten versehentlich gesperrt sind. Wer seinen SEO-Check für den Handwerksbetrieb noch nicht gemacht hat, sollte dort anfangen.

Welche Alternativen gibt es zur robots.txt?

Es gibt mehrere Werkzeuge, die je nach Ziel besser geeignet sind als robots.txt.

Für Indexierungskontrolle:

  • Meta-Robots-Tag (noindex): Zuverlässigste Methode, um Seiten aus dem Index zu entfernen
  • X-Robots-Tag im HTTP-Header: Funktioniert auch für Nicht-HTML-Dateien wie PDFs
  • Canonical-Tag: Zeigt Google die bevorzugte Version einer Seite bei doppelten Inhalten

Für Zugangsbeschränkungen:

  • Passwortschutz / HTTP-Authentifizierung: Einzige Methode, die wirklich verhindert, dass Inhalte öffentlich zugänglich sind
  • Firewall-Regeln auf Server-Ebene: Für technisch versierte Nutzer

Für KI-Crawler:

  • Derzeit gibt es keinen zuverlässigen Standard. Googles eigene KI-Crawler ignorieren viele Direktiven. [1][7] Das Thema entwickelt sich noch.

Wer tiefer in die technischen Grundlagen einsteigen will, findet im Artikel über Googlebot und wie der Google-Crawler Ihre Website bewertet weitere nützliche Informationen.

Wie kann ich Google davon abhalten, meine Seite zu crawlen?

Vollständig verhindern lässt sich das Crawling durch Google nur mit einer Zugangsbeschränkung auf Server-Ebene. Alles andere ist ein Hinweis, kein Befehl.

Abgestufte Optionen:

  1. robots.txt mit Disallow: Googlebot hält sich in der Regel daran, aber es gibt Ausnahmen (verlinkte URLs).
  2. Meta-Robots-Tag noindex, nofollow: Google crawlt die Seite, nimmt sie aber nicht in den Index auf und folgt keinen Links.
  3. Passwortschutz: Verhindert das Crawling zuverlässig, macht die Seite aber auch für normale Besucher unzugänglich.
  4. Google Search Console, URL-Entfernung: Entfernt eine URL temporär aus den Suchergebnissen (gilt 6 Monate).

Für kleine Betriebe ist die praktische Empfehlung: Inhalte, die nicht öffentlich sein sollen, gehören nicht auf die öffentliche Website.

Ist meine Website betroffen, wenn Google robots.txt ignoriert?

Ist meine Website betroffen, wenn Google robots.txt ignoriert?

Das hängt von Ihrer aktuellen Konfiguration ab. Prüfen Sie diese drei Punkte:

1. Nutzen Sie Cloudflare mit aktiviertem „content-signal“? Dann haben Sie möglicherweise eine robots.txt-Direktive, die Sie für wirksam halten, es aber nicht ist. Google ignoriert sie vollständig. [1][6]

2. Haben Sie Seiten in robots.txt gesperrt, die extern verlinkt sind? Diese Seiten können trotzdem in den Suchergebnissen erscheinen, allerdings ohne Inhalt.

3. Haben Sie wichtige Seiten versehentlich gesperrt? Das ist der häufigste Fehler. Besonders nach einem Website-Relaunch oder einem CMS-Wechsel passiert das schnell.

Wenn Sie unsicher sind, lohnt sich ein Suchmaschinenoptimierungs-Check für Ihren Handwerksbetrieb, um solche Probleme aufzudecken.

Kann ich robots.txt in der Google Search Console überprüfen?

Ja. Google Search Console bietet ein kostenloses Tool, mit dem Sie Ihre robots.txt direkt testen können.

So geht es:

  1. Melden Sie sich in der Google Search Console an.
  2. Wählen Sie Ihre Website aus.
  3. Gehen Sie zu „Einstellungen“ und dann zu „robots.txt“.
  4. Dort sehen Sie die aktuelle Datei und können prüfen, ob bestimmte URLs blockiert sind.

Zusätzlich zeigt der Bericht „Crawling-Statistiken“, welche Seiten Google besucht und wie oft. Das gibt einen guten Überblick, ob Ihr Crawling-Budget sinnvoll eingesetzt wird.

Wichtig: Das Tool zeigt nur, ob Googlebot die Seite laut robots.txt crawlen darf. Es sagt nichts darüber aus, ob die Seite indexiert ist. Dafür nutzen Sie den Bericht „URL-Prüfung“.

Wie lange ignoriert Google schon robots.txt-Dateien?

robots.txt wurde 1994 als informeller Standard eingeführt. Google hat die Datei nie als verbindliche Regel behandelt, sondern immer als Empfehlung. [5]

Neu im Jahr 2026 ist die öffentliche Bestätigung durch John Mueller, dass spezifische KI-Schutz-Direktiven (wie Cloudflares „content-signal“) keinerlei Wirkung haben. [1][4] Das ist eine wichtige Klarstellung, weil viele Website-Betreiber davon ausgegangen sind, dass diese Direktiven funktionieren.

Google arbeitet seit Juli 2026 außerdem daran, den robots.txt-Standard nach 25 Jahren erstmals zu formalisieren. [5] Das könnte mittelfristig zu mehr Klarheit führen, ändert aber nichts an der aktuellen Situation.

Welche Fehler machen Unternehmen bei robots.txt?

Diese Fehler sehen wir regelmäßig bei kleinen Betrieben:

  • Gesamte Website gesperrt: Disallow: / blockiert alles. Passiert oft nach einem Website-Relaunch, wenn die Staging-Konfiguration übernommen wird.
  • CSS und JavaScript gesperrt: Google kann dann das Layout nicht korrekt rendern, was die Bewertung der Seite verschlechtert. [10]
  • Vertrauen in unwirksame Direktiven: Cloudflares „content-signal“ oder andere KI-Schutz-Direktiven, die Google ignoriert. [1][8]
  • robots.txt als Sicherheitslösung: Sensible Bereiche werden nur per robots.txt „geschützt“, sind aber weiterhin öffentlich zugänglich.
  • Keine regelmäßige Überprüfung: Die robots.txt wird einmal eingerichtet und nie wieder angeschaut.

Wer seine Handwerker-Website richtig strukturieren will, sollte die robots.txt als Teil der technischen Grundlage regelmäßig prüfen.

Was sollten kleine Unternehmen jetzt tun?

Das Thema „Google ignoriert Robots.txt: Was kleine Unternehmen jetzt wissen müssen“ lässt sich auf eine klare Handlungsempfehlung herunterbrechen.

Checkliste für kleine Betriebe:

  • robots.txt unter ihrebetrieb.de/robots.txt aufrufen und prüfen, was dort steht
  • Sicherstellen, dass keine wichtigen Seiten gesperrt sind (besonders Startseite, Leistungsseiten, Kontakt)
  • Google Search Console nutzen, um Crawling-Fehler zu erkennen
  • Für Seiten, die nicht indexiert werden sollen: Meta-Robots-Tag mit noindex verwenden, nicht nur robots.txt
  • Cloudflare-Nutzer: Prüfen, ob „content-signal“-Direktive aktiv ist, und keine falschen Erwartungen daran knüpfen [1][6]
  • Sensible Inhalte per Passwortschutz sichern, nicht per robots.txt

Google belohnt saubere Arbeit. Eine korrekt konfigurierte technische Basis ist keine Garantie für gute Rankings, aber eine falsche Konfiguration kann Rankings aktiv zerstören.

Wer sich nicht sicher ist, wo seine Website technisch steht, findet im lokalen SEO-Ratgeber für Handwerker einen guten Einstieg.

FAQ

Kann Google eine Seite indexieren, die in robots.txt gesperrt ist? Ja. Wenn externe Websites auf die gesperrte URL verlinken, kann Google die URL kennen und in den Index aufnehmen, auch ohne den Inhalt zu crawlen. Die Seite erscheint dann ohne Titel und Beschreibung in den Suchergebnissen.

Was ist Cloudflares „content-signal“ und warum funktioniert es nicht? Es ist eine robots.txt-Direktive, die Cloudflare entwickelt hat, um KI-Crawler zu steuern. John Mueller von Google bestätigte am 6. Juli 2026, dass kein Google-Crawler und kein LLM diese Direktive beachtet. Sie hat keinerlei Wirkung. [1][4]

Wie entferne ich eine Seite zuverlässig aus dem Google-Index? Verwenden Sie den Meta-Robots-Tag mit noindex im <head> der Seite. Zusätzlich können Sie in der Google Search Console die URL-Entfernung beantragen, was die Seite für 6 Monate aus den Ergebnissen nimmt.

Brauche ich als kleiner Handwerksbetrieb überhaupt eine robots.txt? Eine einfache robots.txt schadet nicht und kann sinnvoll sein. Wichtiger ist, dass sie keine wichtigen Seiten sperrt. Für eine Website mit 10-20 Seiten ist der Einfluss gering.

Was ist der Unterschied zwischen robots.txt und dem noindex-Tag? robots.txt steuert, ob Google eine Seite crawlt (besucht). Der noindex-Tag steuert, ob Google eine Seite indexiert (in die Suchergebnisse aufnimmt). Für den Ausschluss aus dem Index ist noindex die richtige Wahl.

Wie teste ich, ob Google meine robots.txt liest? In der Google Search Console unter „Einstellungen“ finden Sie das robots.txt-Tool. Dort können Sie prüfen, welche URLs blockiert sind. Für eine schnelle Prüfung rufen Sie einfach ihrebetrieb.de/robots.txt im Browser auf.

Gilt robots.txt auch für KI-Crawler wie ChatGPT oder Perplexity? Nicht zuverlässig. Viele KI-Crawler ignorieren robots.txt-Direktiven. Es gibt derzeit keinen verbindlichen Standard, der alle KI-Systeme verpflichtet, robots.txt zu beachten. [1][3]

Was passiert, wenn ich CSS und JavaScript in robots.txt sperre? Google kann das Layout Ihrer Website nicht korrekt rendern. Das verschlechtert die Bewertung der Seite und kann Rankings negativ beeinflussen. CSS und JavaScript sollten nie gesperrt sein. [10]

Muss ich meine robots.txt regelmäßig aktualisieren? Ja, besonders nach Website-Relaunchs, CMS-Wechseln oder wenn neue Bereiche zur Website hinzukommen. Eine veraltete robots.txt kann wichtige neue Seiten versehentlich sperren.

Kann ich robots.txt nutzen, um Konkurrenten vom Crawlen abzuhalten? Nein. robots.txt ist öffentlich zugänglich. Jeder kann sie lesen. Sie schützt nicht vor Konkurrenten, die Ihre Inhalte manuell kopieren.

Fazit

robots.txt ist ein nützliches Werkzeug, aber kein zuverlässiger Schutz. Google hat im Juli 2026 klar bestätigt, dass bestimmte Direktiven vollständig ignoriert werden und dass die Datei grundsätzlich kein Mittel ist, um Seiten aus dem Index fernzuhalten. [1][3][4]

Für kleine Betriebe und Handwerker gilt: Prüfen Sie Ihre robots.txt auf Fehler, nutzen Sie den Meta-Robots-Tag für Indexierungskontrolle, und verlassen Sie sich nicht auf KI-Schutz-Direktiven, die Google ignoriert. Die Google Search Console ist dabei Ihr kostenloses Kontrollwerkzeug.

Wer seine Website technisch sauber aufstellt, schafft die Grundlage für stabile Rankings. Google belohnt saubere Arbeit, aber nur, wenn die technische Basis stimmt.

Nächste Schritte:

  1. robots.txt Ihrer Website aufrufen und prüfen
  2. Google Search Console auf Crawling-Fehler prüfen
  3. Wichtige Seiten mit noindex-Tag statt robots.txt steuern
  4. Bei Unsicherheit: professionellen SEO-Check für Ihren Betrieb durchführen lassen

References

[1] Googles Crawler Math Turns Against It As The Open Web Pushes Back – https://ppc.land/googles-crawler-math-turns-against-it-as-the-open-web-pushes-back/

[3] Intro – https://developers.google.com/search/docs/crawling-indexing/robots/intro

[4] Recap 07 06 2026 41632 – https://www.seroundtable.com/recap-07-06-2026-41632.html

[5] Google Kicks Off July By Finally Standardizing Robots Txt After 25 Years – https://onward.justia.com/google-kicks-off-july-by-finally-standardizing-robots-txt-after-25-years/

[6] Cloudflare Content Signals What Google Actually Said – https://www.tryvizup.com/blog/cloudflare-content-signals-what-google-actually-said

[7] Google Gemininotebook Fetcher Ignores Robots Txt Dealers – https://www.savvydealer.com/blog/google-gemininotebook-fetcher-ignores-robots-txt-dealers

[8] Cloudflare Content Signals No Effect Google – https://www.josephcharnin.com/seo/cloudflare-content-signals-no-effect-google/

[9] Robots Txt In 2026 What It Does – https://spaceandstory.co/blog/robots-txt-in-2026-what-it-does

[10] 9 Robots Txt Rules Googlebot Ignores Even If You Add Them To Your File 7222 – https://www.stanventures.com/news/9-robots-txt-rules-googlebot-ignores-even-if-you-add-them-to-your-file-7222/