Was ist ein Crawler?
Ein Crawler, auch Webcrawler, Soider, (Search)Bot oder Robot, ist ein automatisiertes Computerprogramm, das das World Wide Web systematisch durchsucht und dabei besuchte Websites analysiert. Ziel ist eine Indexierung der besuchten Websites. Dabei werden diese mit bestimmten Schlüsselbegriffen gepaart und in Datenbanken und Indexen abgespeichert. Dieser Technik bedienen sich vor allem Suchmaschinen wie Google, Bing & Co. um die Milliarden von existierende Webseiten mit stetig steigender Tendenz zu verstehen, zu ordnen und zielgerichtet bei Suchanfragen als Suchergebnisse präsentieren zu können.
Die Funktionsweise eines Crawlers
Um seinen Hauptzweck, die Indexierung von Webseiten, erfüllen zu können, muss ein Crawler zunächst einzelne Seiten besuchen. Hierbei werden die Informationen und der Content analysiert und in eigene Datenbanken abgespeichert. Die Besuchstour beginnt mit einer vordefinierten Liste von URLs auch Seeds genannt. Von hier aus erkennt der Crawler gesetzte Hyperlinks, die er folgt um auf weitere Seiten zu gelangen. Dabei spielt es keine Rolle, ob es sich um Verlinkungen innerhalb der gleichen Website handelt, als um interne Links, oder um externe Verlinkungen mit denen der Crawler auf andere URLs weitergeleitet wird. [Hier kommt die Bedeutung von Backlinks ins Spiel.] Auf dieser Reise begegnet ein Crawler immer mehr Links mit immer mehr Inhalten. Je kontinuierlicher ein Crawler diesen Prozess fortführt, desto größer werden die Datenbestände und es steigt die Anzahl der besuchten Seiten.