WikiDer > Spinne

Spider
Für den Spider-Autotyp siehe Roadster.

EIN Spinne (ebenfalls Webcrawler genannt) ist a Knochen dass es weltweites Netz methodisch und automatisiert. Spinnen machen Sie oft eine lokale Kopie der gefundenen Seiten, um sie später bearbeiten und indizieren zu können, z.B. Suchmaschinen.

Die Funktionsweise ist einfach: Die Spinne beginnt mit einer Liste von URLs und besuche sie nacheinander, wo alle Hyperlinks die auf den besuchten Seiten erscheinen, werden der Liste der zu besuchenden URLs hinzugefügt. Auf diese Weise kann eine Spinne fast alle öffentlich zugänglichen Seiten im Internet besuchen. Spinnen besuchen sie oft regelmäßig, um ihren Index auf dem neuesten Stand zu halten.

Spinnen müssen sich beim Roaming korrekt verhalten, da sie Seiten schneller anfordern und verarbeiten können als ein Mensch. Die meisten Spinnen machen sich die Mühe, Seiten von einer zu öffnen Webserver nicht alle nacheinander anzufordern, sondern über einen Zeitraum zu verteilen, um eine Überlastung des jeweiligen Webservers zu vermeiden.

robots.txt

Für Website-Besitzer und -Administratoren wurden Methoden eingeführt, um das Verhalten von Spidern zu beeinflussen. Zum Beispiel eine Textdatei namens 'robots.txt' werden mit Einschränkungen für eine oder mehrere Spinnen festgelegt. Es kann angegeben werden, welche Teile der Website von bestimmten Spidern genutzt werden nicht darf besichtigt werden. Vor dem Besuch einer Website prüft ein guter Spider, ob diese Datei existiert und ob es Einschränkungen für diesen Spider gibt.[1]

Einige Spider ignorieren die robots.txt-Datei. Dies kann negative Auswirkungen auf die besuchte Website haben. Um dem entgegenzuwirken, können Sie über einen Webserver IP-Adressen der jeweiligen Spinnen. Gut erzogene Roboter befolgen die Regeln in der robots.txt-Datei.

Meta-Tags

Es ist möglich, Meta-Tags für Robots in den Header einzelner Webseiten einzufügen. Wenn dieses Meta-Tag nicht vorhanden ist, nimmt der Roboter den Standardwert an:

<meta name="robots" content="index,follow">

Das Inhaltselement hat die folgenden Variationen:

  • index / noindex – ob die Seite indexiert werden soll oder nicht not[2]
  • follow / nofollow – ob man Hyperlinks auf der Seite folgen soll oder nicht
  • noarchive – die Seite nicht lokal archivieren

Index und Folgen haben keine direkte Auswirkung, standardmäßig wird eine Seite indiziert und den Hyperlinks auf einer Seite wird gefolgt.

User-Agent

Eine Spinne meldet sich mit einem bestimmten an User-Agent. Zum Beispiel die Spinnen von Google Log mit Useragent Googlebot oder vollständig 'Googlebot/2.X (http://www.googlebot.com/bot.html)'. Unternehmen, die Spinnen verwenden, tun gut daran, zu erklären, was sie mit der Spinne vorhaben und welches Verhalten sie zeigt. Das machen die großen Suchmaschinen bereits.

Spinnen werden nicht nur verwendet, um Daten für Suchmaschinen zu sammeln. Spinnen durchsuchen das Internet auf ähnliche Weise aktiv auf der Suche nach E-mailadressen. Eine E-Mail-Adresse hat ein einheitliches Format und ist daher leicht erkennbar. Die gesammelten E-Mail-Adressen werden dann verkauft an Spam zu senden.

Hinweis

  1. Siehe zum Beispiel die Textdatei robots.txt aus Wikipedia.
  2. MedienWiki bietet die Möglichkeit, eine Seite zu diesem Zweck mit einem magisches Wort.