Was ist archiveorgbot?
Der Webrobot archiveorgbot indexiert und analysiert Inhalte von Webseiten. Er zeigt sich meistens mit der IP Adresse 204.62.248.253 und unter Verwendung des User Agent Mozilla/5.0 (compatible; archive.org_bot +http://archive.org/details/archive.org_bot) Zeno/d3712ae warc/v0.8.99. Mit 0.0012% Marktanteil ist archiveorgbot auf Platz 179 der aktivsten Webrobots im Internet.
Technische Einordnung von archiveorgbot
archiveorgbot wurde in Webserver-Logs als Bot oder Crawler erkannt. Die wichtigsten technischen Hinweise findest du auf dieser Seite: bekannte User-Agents, beobachtete IP-Adressen, Aktivitätsdaten und passende robots.txt-Regeln.
Für eine konkrete Entscheidung solltest du zusätzlich prüfen, welche URLs archiveorgbot abruft, wie häufig die Zugriffe sind und ob der Bot deine robots.txt-Regeln respektiert.
Gefahreneinschätzung und Bewertung
Sollte man archiveorgbot blockieren?
Prüfe zuerst Zugriffshäufigkeit, aufgerufene URLs und User-Agent. Danach kannst du entscheiden, ob eine Blockierung sinnvoll ist.
robots.txt – archiveorgbot blockieren
Füge diese Zeilen in deine robots.txt ein, um archiveorgbot den Zugriff auf deine Website zu verwehren:
User-agent: archiveorgbot
Disallow: /
Du kannst den Zugriff auch gezielt einschränken, statt ihn komplett zu blockieren:
User-agent: archiveorgbot
Disallow: /wp-admin/
Disallow: /wp-includes/
Allow: /
Häufige Fragen zu archiveorgbot
Ist archiveorgbot gut oder schlecht?
Das hängt vom Einsatzzweck ab. archiveorgbot ist als Web-Crawler eingeordnet. Entscheidend sind Nutzen, Serverlast, Crawl-Verhalten und ob der Bot deine robots.txt-Regeln respektiert.
Wie erkenne ich archiveorgbot in Server-Logs?
Suche nach dem User-Agent-Namen archiveorgbot. Ein beobachteter User-Agent ist Mozilla/5.0 (compatible; archive.org_bot +http://archive.org/details/archive.org_bot) Zeno/d3712ae warc/v0.8.99. Vergleiche ausserdem IP-Adressen, Zugriffsmuster und aufgerufene URLs.
Reicht robots.txt zum Blockieren?
robots.txt ist ein Hinweis für regelkonforme Crawler. Unerwünschte oder aggressive Bots können diese Regeln ignorieren. In solchen Fällen helfen zusätzlich Firewall-Regeln, WAF-Regeln oder Blockierungen im Hosting/CDN.
Kann ein Bot seinen User-Agent fälschen?
Ja. Ein User-Agent ist leicht zu fälschen. Für wichtige Entscheidungen solltest du zusätzlich IP-Adresse, Reverse-DNS, Zugriffsmuster, Häufigkeit und aufgerufene URLs prüfen.
IP-Adressen 2 bekannte IPs
Diese IP-Adressen wurden bisher von archiveorgbot verwendet:
204.62.248.253
34.182.151.215
User Agents
Mit diesen User-Agent-Strings identifiziert sich archiveorgbot:
Mozilla/5.0 (compatible; archive.org_bot +http://archive.org/details/archive.org_bot) Zeno/d3712ae warc/v0.8.99Mozilla/5.0 (compatible; archive.org_bot +http://www.archive.org/details/archive.org_bot)Mozilla/5.0 (compatible; archive.org_bot; Wayback Machine Live Record; +http://archive.org/details/archive.org_bot)