WikiDer > Protokoll zum Ausschluss von Robotern

Robots Exclusion Protocol

Es Protokoll zum Ausschluss von Robotern, Roboter-Ausschlussstandard oder robots.txt-Protokoll ist ein Konvention um (Teile) einer normal zugänglichen Website mit Sicherheit zu schützen Netzspinnen und Suchroboter. Dies wird hauptsächlich verwendet, um (Teile von) a Webseite wird automatisch unaufgefordert kopiert und z. B. in Suchergebnissen von Suchmaschinen. Das Kopieren kann auch die Zugänglichkeit einer Website beeinträchtigen, insbesondere wenn es sich um eine stark besuchte Website handelt. Websites verwenden dieses Protokoll auch, um beispielsweise sicherzustellen, dass Suchmaschinen nur die Startseite einer Website anzeigen.

Das Protokoll verwendet die robots.txtDatei, die in der Wurzelverzeichnis wird auf einer Website platziert. Alternativ zu dieser speziellen Datei können vorhandene HTML-Dateien mit HTML-Tag verwendet werden Meta das Attribut "Roboter" enthalten sein.

Herkunft und Verwendung

Es gibt keinen Beamten Standard oder RFC von dem Protokoll zum Ausschluss von Robotern. Es wurde mit a . gemacht Konsens im Juni 1994 erstellt von Mitgliedern der WWW Robots Mailing List ([email protected])

Das Protokoll dient jedoch nur der Beratung und basiert auf der Kooperation des besuchenden Webroboters. Es kann also den Zugriff auf Dateien und Ordner eigentlich nicht verweigern und ist daher ungeeignet, (Teile) einer Website zu schützen. Es gibt Roboter, die das Protokoll ignorieren oder nicht kennen (absichtlich oder nicht). Die Datei robots.txt ist auch für alle sichtbar. Dies kann dann zum Beispiel verwendet werden, um User-Agent eines Roboters wie ein normaler Webbrowser damit der Roboter problemlos seine Arbeit auf einer Website erledigen kann. Auch wenn von einem solchen Verhalten abgeraten und es als sehr unhöflich angesehen wird, kann das Protokoll den Schutz der Website nicht garantieren. Das Protokoll dient daher hauptsächlich dazu, keine für Besucher irrelevanten Daten in den Suchergebnissen von Suchmaschinen anzuzeigen.

Option 1: spezielle robots.txt-Datei

robots.txt ist der Computerdatei das enthält Anweisungen für Benutzeragenten, laut Protokoll.

Ein einfaches Beispiel für die Syntax ist:

User-Agent: spambot10000Disallow: /

Das Obige besagt, dass alle Benutzerprogramme, die sich als spambot10000 identifizieren, aufgefordert werden, nicht auf "/" und alle Unterverzeichnisse zuzugreifen. Mit anderen Worten: kein Zugriff auf die gesamte Website.

User-Agent: *Disallow: /cgi-bin/Disallow: /test/Disallow: /private/

Im zweiten Beispiel sehen wir ein Sternchen: * nach User-agent:. Das bedeutet: „all robots“ In diesem Beispiel dürfen alle Robots alle Verzeichnisse außer cgi-bin, test und private besuchen.

sehen Externe Links für einige Beispieldateien.

Option 2: Attribut Meta name="robots" in bestehenden HTML-Seiten

Die Alternative zur speziellen robots.txt-Datei besteht darin, ein Attribut der HTML-TagMeta hinzufügen, genannt "Roboter". Dadurch kann ein Roboter angewiesen werden, eine bestimmte Webseite zu indizieren oder nicht und ob er den Links zu einer anderen Webseite folgen soll oder nicht. Das folgende Beispiel ist eine Anweisung in einer HTML-Seite, die alle Robots auffordert, diese Seite zu indizieren, aber nicht den Links auf der Seite zu folgen:

<meta name="robots" content="index,nofollow" />

Allerdings ist es mit dieser Option nicht möglich, bestimmten Benutzeragenten Anweisungen zu erteilen. Dies kann nur mit robots.txt.

Externe Links

Allgemeines

Beispiele