Direkte Antwort

Nutze robots.txt, um den Crawler-Zugriff zu steuern, noindex, um einem Crawler mitzuteilen, eine abrufbare Ressource nicht zu indexieren, Authentifizierung, um private Daten zu schützen, und einen passenden HTTP-Status oder eine Weiterleitung, um darzustellen, ob eine Ressource existiert. Nutze Sitemaps, um die Entdeckung zu unterstützen und kanonische URLs zu bekräftigen. Keine dieser Steuerungen garantiert ein Ranking.

Der häufigste technische Fehler besteht darin, eine URL in robots.txt zu blockieren und gleichzeitig zu erwarten, dass Google auf derselben blockierten Seite ein noindex-Tag liest. Wenn Google die Seite nicht crawlen kann, sieht es die Direktive möglicherweise nie. Der gefährlichste Fehler ist, Robots-Regeln als Sicherheitsmaßnahme zu verwenden. Eine Robots-Datei ist öffentlich, und regelkonformes Crawling ist keine Zugriffskontrolle.

Wähle die Steuerung anhand des gewünschten URL-Zustands aus und teste dann die tatsächlich bereitgestellte Antwort, statt der CMS-Einstellung zu vertrauen.

Was du danach kannst

Am Ende dieser Lektion kannst du:

  • Entdeckung, Crawl-Steuerung, Index-Steuerung und Zugriffssteuerung erklären;
  • zwischen Robots, Meta-Robots, X-Robots-Tag, Authentifizierung, Statuscodes und Weiterleitungen wählen;
  • eine gültige kanonische Sitemap aufbauen;
  • erklären, was lastmod, priority und changefreq können und was nicht;
  • IndexNow von Googles Entdeckungssystemen unterscheiden;
  • Crawl-, Index-, Nutzer- und Sicherheitsergebnisse für eine URL vorhersagen.

Vier unterschiedliche Aufgaben

Technische Steuerungen werden einfacher, wenn man ihre Aufgaben voneinander trennt.

Entdeckung

Wie erfährt ein Crawler, dass eine URL existiert?

Häufige Quellen:

  • crawlbare interne Links;
  • externe Links;
  • Weiterleitungen;
  • bereits bekannte URLs;
  • XML-, RSS-, mRSS- oder Text-Sitemaps.

Eine URL kann entdeckt werden und trotzdem nie gecrawlt oder indexiert werden.

Crawl-Zugriff

Kann ein Crawler die URL anfragen?

Das Robots Exclusion Protocol erlaubt es Website-Betreibern, Crawl-Regeln zu veröffentlichen. RFC 9309 standardisiert das Protokoll. Konforme Crawler interpretieren die Regeln, aber Robots ist keine Autorisierung.

Indexierungsfähigkeit

Wenn ein System die Ressource abruft, ist es dann erlaubt und sinnvoll, sie zu speichern?

Bei unterstützten Crawlern kann eine noindex-Direktive im HTML oder ein HTTP-X-Robots-Tag die Indexierungsfähigkeit entziehen. Der Crawler muss die Antwort abrufen, um die Direktive zu lesen.

Sicherheit

Ist die Ressource für eine unautorisierte Person oder ein unautorisiertes System verfügbar?

Authentifizierung, Autorisierung, Netzwerkrichtlinien und eine korrekte Mandantentrennung schützen Daten. Suchdirektiven tun das nicht.

Wie robots.txt funktioniert

Googles Einführung zu robots.txt beschreibt die Datei als Mechanismus zur Steuerung des Crawler-Traffics.

Speicherort

Die Datei gehört an die Wurzel des Hosts und Protokolls, das sie steuert:

https://www.example.com/robots.txt

Eine Datei unter /folder/robots.txt steuert den Host nicht. Regeln für einen Host oder eine Subdomain steuern nicht automatisch einen anderen.

User-Agent-Gruppen

Regeln werden nach Crawler-Name gruppiert:

User-agent: *
Disallow: /internal-search/

Die Wildcard-Gruppe gilt für Crawler, die gemäß dem Protokoll und der jeweiligen Crawler-Implementierung darauf zutreffen.

Allow und Disallow

Regeln wirken auf URL-Pfade. Teste reale Beispiele, denn Details beim Abgleich, Kodierung, Groß- und Kleinschreibung und Crawler-spezifische Erweiterungen können Teams überraschen.

Grenzen

Robots-Regeln können nicht:

  • eine URL geheim halten;
  • ein Passwort erzwingen;
  • eine bekannte URL zuverlässig aus einem Index entfernen;
  • Crawling erzwingen;
  • Indexierung erzwingen;
  • einen Crawler steuern, der das Protokoll ignoriert.

Eine per Disallow gesperrte URL kann über Links trotzdem bekannt bleiben und als reines URL-Ergebnis erscheinen, weil der Crawler den Inhalt für eine bessere Darstellung nicht abrufen kann.

Meta-Robots und X-Robots-Tag

Verwende für HTML-Seiten eine HTML-Meta-Direktive:

<meta name="robots" content="noindex, follow">

Verwende einen HTTP-Header, wenn die Ressource kein HTML ist oder eine Steuerung auf Header-Ebene zuverlässiger ist:

X-Robots-Tag: noindex

Das ist nützlich für PDFs, generierte Dateien und Medien-Antworten.

Blockiere das Crawling nicht, bevor der unterstützte Crawler noindex beobachtet hat. Nach der Entfernung kann eine Crawl-Richtlinie neu überdacht werden, aber halte den Kompromiss fest: Verhinderst du künftiges Abrufen, können geänderte Direktiven nicht mehr gelesen werden.

Authentifizierung und Statuscodes

Private Inhalte

Liefere eine authentifizierte Erfahrung aus. Nicht authentifizierte Anfragen sollten keine privaten Mandantendaten innerhalb einer 200-Seite erhalten. Nutze einen korrekten Autorisierungsablauf und teste ihn ohne Cookies.

Fehlende Inhalte

Liefere 404 oder 410, wenn keine Ressource oder relevanter Ersatz existiert. Liefere kein 200 mit „nicht gefunden", das erzeugt ein Soft-404-Muster.

Ersetzte Inhalte

Nutze eine direkte permanente Weiterleitung, wenn ein naher Ersatz existiert. Leite nicht jede gelöschte Seite auf die Startseite um.

Vorübergehende Nichtverfügbarkeit

Nutze einen aussagekräftigen temporären Status und einen Wiederherstellungsplan. Anhaltende Serverfehler beeinträchtigen das Crawling und können letztlich auch die Indexpräsenz beeinträchtigen.

Statuscodes und kanonische Signale untersuchst du in Schritt 8.

Was Sitemaps wirklich leisten

Eine Sitemap ist eine maschinenlesbare Liste von URLs, die eine Suchmaschine kennen soll. Sie unterstützt die Entdeckung, besonders bei neuen, großen, medienreichen oder schwach verlinkten Bereichen.

Googles Leitfaden zum Aufbau von Sitemaps dokumentiert diese Grenzen für eine Sitemap:

  • nicht mehr als 50.000 URLs;
  • nicht mehr als 50 MB unkomprimiert;
  • vollständig qualifizierte absolute URLs;
  • UTF-8-Kodierung.

Nutze einen Sitemap-Index, wenn du mehrere Sitemap-Dateien brauchst.

Kanonische, indexierbare URLs aufnehmen

Die Sitemap ist ein kanonisches Signal unter mehreren. Fülle sie nicht mit Weiterleitungen, Fehlern, Parameter-Duplikaten, blockierten URLs oder noindex-Seiten.

Einen wahrheitsgemäßen lastmod verwenden

lastmod sollte eine wesentliche Änderung der Seite abbilden, nicht jedes Deployment oder jede Navigationsänderung. Google gibt an, den Wert zu nutzen, wenn er durchgängig korrekt ist.

Nicht auf priority oder changefreq verlassen

Google gibt an, die Sitemap-Felder priority und changefreq zu ignorieren. Ihre Einbindung erzeugt keine Crawl-Dringlichkeit.

Übermittlung ist ein Hinweis

Übermittle über die Search Console, die Search Console API oder eine Sitemap-Zeile in robots. Die Übermittlung garantiert weder Crawling noch Indexierung.

Eine verwaiste URL in einer Sitemap kann entdeckt werden, aber das Fehlen kontextueller interner Links schadet trotzdem der Navigation, den Beziehungen zwischen Seiten und der Pflegbarkeit.

Das Sitemaps-Protokoll definiert das gemeinsame XML-Format. Suchmaschinen können eigene unterstützte Erweiterungen und Verhaltensweisen hinzufügen, prüfe daher die aktuelle Dokumentation jeder Suchmaschine.

Übermittelt IndexNow URLs an Google?

IndexNow ist ein eigenständiges Protokoll zur Benachrichtigung über URL-Änderungen, das von teilnehmenden Suchmaschinen unterstützt wird. Die offizielle Protokolldokumentation erklärt, wie eine Website teilnehmende Suchmaschinen über hinzugefügte, aktualisierte oder gelöschte URLs benachrichtigen kann.

Beschreibe IndexNow nicht als Googles Indexierungs-API. Eine Benachrichtigung garantiert weder Crawling noch Indexierung, und eine Unterstützung durch die Google-Suche sollte ohne aktuelle offizielle Google-Dokumentation nicht angenommen werden.

Nutze es nur, wenn:

  • die Ziel-Suchmaschinen die Unterstützung dokumentieren;
  • deine Implementierung den Website-Besitz korrekt authentifiziert;
  • Übermittlungen idempotent und ratenbegrenzt sind;
  • gelöschte und aktualisierte Zustände korrekt sind;
  • es interne Links und Sitemaps nicht ersetzt.

Der Steuerungs-Selektor

Ziel Robots.txt Meta oder X-Robots Authentifizierung oder Status Sitemap Erwartetes Crawl-Ergebnis Erwartetes Index-Ergebnis Sicherheitsniveau
Geringwertigen Crawl-Traffic steuern Disallow für ausgewählte Muster nach Analyse Meist keine Normaler öffentlicher Status Geringwertige URLs ausschließen Passender konformer Crawler ruft nicht ab URL kann bekannt bleiben Keines
Öffentliche HTML-Seite deindexieren Allow noindex 200 während der Verarbeitung Ausschließen Crawler kann Direktive abrufen Seite wird nach Verarbeitung nicht mehr indexierbar Keines
Öffentliches PDF aus dem Index entfernen Allow X-Robots-Tag: noindex 200 während der Verarbeitung Ausschließen Crawler kann Header abrufen PDF wird nach Verarbeitung nicht mehr indexierbar Keines
Private Kontodaten schützen Für Sicherheit irrelevant Hinter Zugriffskontrolle irrelevant Authentifizierung und Autorisierung Ausschließen Unautorisierter Crawler kann private Inhalte nicht abrufen Öffentlich nicht indexierbar Hoch bei korrekter Umsetzung
URL mit Ersatz zurückziehen Allow Keine Direktes 301 oder 308 Alte entfernen, finale aufnehmen Crawler folgt Weiterleitung Signale können sich auf der finalen URL konsolidieren Keines
URL ohne Ersatz zurückziehen Allow Keine 404 oder 410 Entfernen Crawler stellt Abwesenheit fest URL kann den Index verlassen Keines
Neue kanonische URL ankündigen Allow index oder Standard 200 Aufnehmen Entdeckung unterstützt Anzeigefähig, nicht garantiert Keines
Staging privat halten Nicht auf robots verlassen Nicht ausreichend Authentifizierung oder Netzwerkbeschränkung Ausschließen Unautorisierter Zugriff verweigert Kein öffentlicher Inhalt zu indexieren Hoch bei korrekter Umsetzung

Lade den Crawl- und Index-Steuerungs-Selektor herunter.

Ein wiederholbarer Bereitstellungsprozess

1. URL-Klassen inventarisieren

Gruppiere öffentliche Lektionen, private Kontorouten, Filter, Dateien, Vorschauen, zurückgezogene URLs und Fehlerzustände. Technische Richtlinien sollten auf Klassen wirken, nicht auf Einzelfall-Erinnerung.

2. Den gewünschten Zustand festhalten

Notiere für jede Klasse:

  • öffentlich oder privat;
  • Crawl erlaubt oder blockiert;
  • indexierungsfähig oder ausgeschlossen;
  • kanonischer Eigentümer;
  • erwarteter Status;
  • Sitemap-Aufnahme;
  • Sicherheitsgrenze.

3. Für jede Aufgabe eine Steuerung wählen

Lass Robots, noindex, Canonical und Weiterleitung nicht gegeneinander arbeiten.

4. Aus stabilen Routendaten generieren

Nutze dasselbe kanonische Inventar für Navigation, Sitemap, Metadaten und strukturierte Daten. Das verringert Drift.

5. Die bereitgestellte Antwort testen

Prüfe:

  • finalen Status und Weiterleitungskette;
  • Antwort-Header;
  • Robots-Abruf;
  • Meta-Direktiven in Quelle und Rendering;
  • nicht authentifizierten Zugriff;
  • Sitemap-Syntax und URLs.

6. Repräsentative Crawler sicher testen

Nutze offizielle Testwerkzeuge und verifizierte Serverlogs. User-Agent-Strings allein beweisen nicht, dass eine Anfrage von einem echten Crawler stammt.

7. Das Ergebnis überwachen

Nutze die Search-Console-Abdeckung, Stichproben der URL-Prüfung, die Sitemap-Verarbeitung und Serverlogs. Ein Konfigurations-Commit beweist nur, dass sich die Konfiguration geändert hat.

Durchgerechnetes Beispiel: eine Academy mit gemischten URL-Zuständen

Die synthetische Website enthält:

  • öffentliche Academy-Lektionen;
  • Staging-Vorschauen;
  • private Kontoseiten;
  • generierte Lektions-PDFs;
  • interne Such- und Filter-URLs;
  • zurückgezogene Lektionen, mit und ohne Ersatz.

Öffentliche Lektionen

Liefere 200, erlaube das Crawling, nutze Self-Canonicals, verlinke sie aus der Academy-Navigation, und nimm die kanonischen URLs in die Sitemap auf.

Staging-Vorschauen

Schütze sie durch Authentifizierung oder eine Netzwerkgrenze. Schließe sie aus öffentlichen Sitemaps aus. Eine Disallow: /preview/-Zeile kann konformes Crawling reduzieren, sie kann die Vorschau aber nicht absichern.

Private Kontoseiten

Verlange bei jeder Anfrage eine Autorisierung. Teste die Mandantentrennung. Liefere niemals Mandantendaten an eine nicht authentifizierte Anfrage in der Hoffnung, noindex würde sie schützen.

Generierte PDFs

Wenn das PDF eine nützliche indexierbare Ressource ist, nimm es nur auf, wenn es einen eigenständigen Zweck erfüllt. Soll die HTML-Lektion kanonisch sein und das PDF nicht erscheinen, nutze eine unterstützte HTTP-Header-Richtlinie und entferne das PDF aus der Sitemap.

Gefilterte Listen

Entscheide, ob eine Filterkombination dauerhaften Nutzer- und Suchwert hat. Blockiere nicht pauschal, bevor du den aktuellen Indexzustand verstanden hast. Richte bei geringwertigen öffentlichen Kombinationen Links, Canonicals, Index-Direktiven und Crawl-Richtlinie aufeinander aus.

Zurückgezogene Lektionen

Leite direkt zu einem nahen Ersatz weiter. Liefere 404 oder 410, wenn kein Äquivalent existiert. Entferne alte URLs aus Sitemaps und internen Links.

Warum das scheitern kann

Wenn das Routing-Framework für jede fehlende Lektion 200 liefert, kann die Sitemap sauber wirken, während die Fehlerbehandlung trotzdem Soft-404s erzeugt. Wenn ein CDN authentifizierte Inhalte ohne die korrekten Mandanten- und Autorisierungsschlüssel cacht, sind Suchdirektiven für den Sicherheitsvorfall irrelevant.

Originale SEOryon-Testdateien

Nutze:

Die Beispiel-URLs sind Dokumentation, keine Produktionsdatei zum blinden Kopieren. Ersetze Routen und Daten durch kanonische Daten aus deinem eigenen Repository.

Häufige Fehler

Disallow plus noindex

Der Crawler ruft die Seite möglicherweise nicht ab und liest noindex daher möglicherweise nicht.

Geheimnisse in robots.txt veröffentlichen

Die Datei ist öffentlich. Sensible Pfade können Aufmerksamkeit erregen.

Annehmen, dass jeder Crawler sich wie Google verhält

Protokollunterstützung und JavaScript-Fähigkeiten variieren. Prüfe die Dokumentation des jeweiligen Crawlers.

Relative oder nicht-kanonische Sitemap-URLs

Verwende absolute, vorgesehene kanonische URLs.

Bei jedem Build jeden lastmod aktualisieren

Falsche Aktualität macht das Feld weniger vertrauenswürdig.

Eine Sitemap als Architektur behandeln

Erstelle crawlbare kontextuelle Links. Eine maschinelle Liste ersetzt keine Nutzernavigation.

IndexNow mit Google-Indexierung verwechseln

Es ist ein eigenständiges Protokoll zwischen teilnehmenden Suchmaschinen, und die Übermittlung bleibt eine Benachrichtigung.

Übung: Steuerungen für zehn Absichten wählen

Wähle für jede Absicht Robots, Index-Direktive, Status oder Authentifizierung, Sitemap-Zustand und erwartetes Ergebnis:

  1. neue öffentliche Lektion;
  2. private Abrechnungsseite;
  3. abgelaufenes Event mit nahem jährlichem Ersatz;
  4. gelöschte Testseite ohne Ersatz;
  5. öffentliches PDF, das aus der Suche verschwinden soll;
  6. facettierte URL, die bereits indexiert ist, aber keinen Nutzen mehr hat;
  7. Staging-Umgebung;
  8. Site-interne Suchergebnisse;
  9. öffentliches Bild für die Bildersuche vorgesehen;
  10. vorübergehender Wartungsausfall.

Lösungsschlüssel

  • Neue Lektion: allow, 200, kanonische URL in die Sitemap aufnehmen, intern verlinken.
  • Abrechnung und Staging: durch Authentifizierung oder Netzwerkkontrollen schützen, aus der Sitemap ausschließen.
  • Ersetztes Event: direkte permanente Weiterleitung, alte URL aus der Sitemap entfernen.
  • Gelöschte Testseite: 404 oder 410, Links und Sitemap-Eintrag entfernen.
  • PDF-Entfernung: Crawl erlauben, X-Robots-Tag: noindex senden, aus der Sitemap ausschließen.
  • Indexierte Facette: erlauben, bis die Deindexierungs-Direktive verarbeitet ist, Links und Canonical-Richtlinie aufeinander abstimmen.
  • Site-interne Suche: meist vom Index ausschließen; Crawl-Richtlinie anhand von Umfang und aktuellem Zustand wählen.
  • Öffentliches Bild: das Bild und seine Ressourcen erlauben, nützlichen Seitenkontext liefern.
  • Wartung: einen wahrheitsgemäßen vorübergehenden Fehlerzustand liefern, schnell wiederherstellen und überwachen.

Eine bestandene Antwort muss ausdrücklich feststellen, dass Robots weder Abrechnungs- noch Staging-Daten schützen kann.

Abschließende Checkliste

  • Jede URL-Klasse hat einen schriftlich festgehaltenen gewünschten Zustand.
  • Private Daten sind durch Authentifizierung und Autorisierung geschützt.
  • Robots wird ausschließlich für den Crawler-Zugriff genutzt.
  • Ein Crawler kann jede noindex-Direktive abrufen, die er verarbeiten muss.
  • Nicht-HTML-Index-Direktiven nutzen einen unterstützten Antwort-Header.
  • Fehlende Ressourcen liefern aussagekräftige Statuscodes.
  • Weiterleitungen führen direkt zu relevanten Ersatzinhalten.
  • Sitemaps enthalten ausschließlich kanonische öffentliche URLs.
  • Jede Sitemap bleibt unter 50.000 URLs und 50 MB unkomprimiert.
  • lastmod bildet wesentliche, wahrheitsgemäße Änderungen ab.
  • priority und changefreq werden nicht als Google-Steuerungen behandelt.
  • Wichtige Seiten haben crawlbare interne Links.
  • IndexNow ist auf dokumentierte teilnehmende Suchmaschinen beschränkt.
  • Bereitgestellte Antworten werden ohne eingeloggte Sitzung getestet.
  • Das Monitoring bestätigt Crawl- und Index-Ergebnisse nach der Veröffentlichung.

Häufig gestellte Fragen

Braucht jede Website eine robots.txt-Datei?

Nein. Eine Website ohne Crawl-Einschränkungen kann ohne eigene Regeln funktionieren. Eine gültige Datei ist nützlich, wenn du eine explizite Crawler-Richtlinie oder eine Sitemap-Entdeckung brauchst.

Entfernt robots.txt eine Seite aus Google?

Nicht zuverlässig. Es verhindert das Crawling durch konforme Crawler. Eine bekannte URL kann ohne Inhalt indexiert bleiben. Nutze je nach Fall ein abrufbares noindex, einen Entfernungsprozess, eine Weiterleitung oder einen Abwesenheitszustand.

Verbessert eine Sitemap das Ranking?

Sie unterstützt die Entdeckung und die kanonische Signalgebung. Sie garantiert nicht direkt Crawling, Indexierung oder Ranking.

Sollten private Seiten noindex verwenden?

Private Seiten sollten Authentifizierung und Autorisierung nutzen. noindex kann eine zusätzliche öffentliche Suchanweisung sein, nicht die Sicherheitsgrenze.

Sollte jede Aktualisierung IndexNow auslösen?

Übermittle nur korrekte hinzugefügte, aktualisierte oder gelöschte URLs an teilnehmende Suchmaschinen. Baue Idempotenz und Ratenbegrenzung ein, und übermittle kein unverändertes Rauschen.

Quellen und Methodik

Community-Recherchen zeigten anhaltende Verwirrung rund um robots.txt, noindex, Index-Aufblähung und massenhafte URL-Entfernung. Diese Fragen prägten die Reihenfolge und die Beispiele dieser Lektion. Community-Antworten wurden nicht als Autorität herangezogen.

  1. Google Search Central, Einführung zu robots.txt, aktualisiert am 10. Dezember 2025 und geprüft am 28. Juli 2026. Offizielles Google-Verhalten und offizielle Einschränkungen.
  2. RFC 9309, Robots Exclusion Protocol, veröffentlicht im September 2022 und geprüft am 28. Juli 2026. Internetstandard für das Protokoll.
  3. Google Search Central, Sitemap erstellen und einreichen, aktualisiert am 8. Juli 2026 und geprüft am 28. Juli 2026. Offizielle Google-Formate, -Grenzen und -Einreichungshinweise für Sitemaps.
  4. Sitemaps.org, Sitemaps-XML-Format, geprüft am 28. Juli 2026. Gemeinsame Protokolldefinition.
  5. IndexNow, Protokolldokumentation, geprüft am 28. Juli 2026. Offizielles Benachrichtigungsprotokoll für teilnehmende Suchmaschinen. Eine Benachrichtigung garantiert keine Indexierung.

Zurück: So funktioniert die Suche 2026
Weiter: Indexierung, Canonicals, Weiterleitungen und HTTP-Status