Robots sind Maschinen, die zu Suchmaschinen im Internet gehören, wie z. B. Google, Yahoo oder Bing. Diese Robots rufen Webseiten auf, um darin nach Informationen zu suchen, und fügen diese Informationen in Suchmaschinen ein, was wir allgemein als Indizierung oder Positionierung einer Website im Internet bezeichnen.
Wenn Sie eine gut konfigurierte Datei haben, können Sie diesen Robots helfen, die richtigen Informationen schneller auszuwählen, was zu einer besseren Web-Durchsuchbarkeit, einer besseren Positionierung in Suchmaschinen führt und auch einige Nachteile reduzieren kann.
Diese Robots werden auch "Spider", "Crawler", Spinnen, "Bots" oder Indexer genannt.
1.- Was ist die robots.txt-Datei und wofür wird sie verwendet?
Die robots.txt-Datei ist eine reine Textdatei, die vom Benutzer erstellt wird, um den Zugriff von Robots auf das Hosting zu kontrollieren. Diese Datei enthält Empfehlungen, die Suchrobots einhalten müssen. Das heißt, Sie teilen ihnen mit, was Sie nicht indizieren möchten. Auf diese Weise können sie die Informationen Ihrer Website besser auswählen und die Positionierung verbessern.
Die robots.txt-Datei muss im Stammverzeichnis des Hostings hochgeladen werden, um den Robots mitzuteilen, welche Seiten oder Verzeichnisse Sie nicht indizieren möchten. Es darf nur eine robots.txt-Datei pro Website geben.
Die Einrichtung dieser Datei ist wichtig, da sie Vorteile mit sich bringt, z. B.:
Sie hilft, eine reibungslosere Indizierung wichtiger Webinhalte zu erreichen und verbessert so die Internet-Positionierung. Sie kann auch die Robot-Verfolgung beschleunigen und die Nutzung des Webs verbessern.
Sie verhindert den Zugriff bestimmter Robots, da einige von ihnen nur Probleme im Web verursachen, weil sie keine Suchmaschinen sind. Außerdem schränkt sie die Informationen ein, die Sie anzeigen möchten, sodass private persönliche Daten nicht bei Google gefunden werden können.
Sie reduziert die Serverüberlastung, da die Zugriffszeit einiger Robots kontrolliert werden kann. Einige dieser Robots führen eine hohe Anzahl von Anfragen durch, die den Server überlasten und die Navigation für den eigentlichen Benutzer verlangsamen können.
2.- Wie erstelle ich eine robots.txt-Datei?
Die Robots-Datei wird mit zwei Befehlen erstellt.
User-Agent: (Spider-Name)
Disallow: (Pfad)
Der Spider-Name ist der Name des Suchmaschinen-Robots. Wenn Sie angeben möchten, dass die Verbote für alle Suchmaschinen gelten, müssen wir anstelle des Namens der Suchmaschine "*" setzen.
Der "Pfad" ist der Name der Datei oder des Ordners, den Sie nicht indizieren möchten. Um die Indizierung aller Dokumente in einem Verzeichnis zu verbieten, muss der Pfad das Zeichen "/" am Ende des Verzeichnisnamens enthalten. Das Format lautet also:
Disallow: /verzeichnis/
Beispiele:
Disallow: / verbietet den Zugang zum gesamten Hosting.
Disallow: /forum/ verbietet den Zugang zum Forum-Verzeichnis.
Disallow: erlaubt den Zugang zum gesamten Hosting.
3.- Wie füge ich Kommentare in eine Datei ein?
Wenn Sie Kommentare in die Datei einfügen möchten, müssen Sie die Zeile mit dem Zeichen "#" beginnen. Das bedeutet, dass diese Zeile ein Kommentar ist und nicht berücksichtigt werden sollte.
Beispiel:
#Wir gewähren Webcrawler vollen Zugriff, da Disallow leer ist.
User-agent: webcrawler
Disallow:
4.- Was ist der "Crawl-delay"?
Wenn Statistiken überprüft werden, kann man sehen, dass manche Robots, die das Web durchsuchen, eine Vielzahl von Anfragen an den Server stellen, bis er überlastet ist. Um diese Überlastung zu vermeiden, gibt es die Direktive "Crawl-delay", die die Zeit zwischen jedem Robot-Zugriff angibt.
Beispiel:
User-agent
Crawl-delay: 60
Dies gibt an, dass Robots 60 Sekunden zwischen jedem Zugriff warten müssen. Der Nachteil dieser Direktive ist, dass sie nicht alle Robots betrifft. Einige, die sie betreffen, sind:MSNBot,Slurp und Googlebot.
5.- Andere Direktiven zur Kontrolle der Zugriffszeit.
Um die Zeit zu überwachen, in der Robots Seiten indizieren, können einige dieser Direktiven verwendet werden:
# Suchmaschinen von 2 bis 7:45 Uhr erlauben (Uhrzeiten sind immer in Greenwitch)
Visit-time:0200-0745
# Ein Dokument alle 30 Minuten
Request:1/30m
# Kombiniert: 1 Dokument alle 10 Minuten und zwischen 13 und 17 Uhr
Request:1/10m 1300-1659
Es ist wichtig, die Datei zu überprüfen, bevor sie auf das Hosting hochgeladen wird, da unerwünschte Robots das Web falsch indizieren können, wenn sie Fehler enthält. Es könnte auch passieren, dass keiner der Robots, die Sie indizieren möchten, dies korrekt tut.
6.- Wie sollte eine robots.txt-Datei aussehen?
Um allen Robots Zugang zum Hosting zu gewähren:
User-agent
Disallow:
Crawl-delay: 60
Um allen Robots den Zugang zum Hosting zu verwehren:
User-agent
Disallow: /
Crawl-delay: 60
Um Robots den Zugang zu einer bestimmten Seite zu verwehren:
User-agent
Disallow: / datei.html
Request-rate: 1/10m 1300-1659
Um den Zugang zu bestimmten Verzeichnissen einzuschränken:
Diese Einstellung wird empfohlen, da sie allen Robots den Zugang zu den von Ihnen angegebenen Ordnern verbietet und auch die Zugriffszeit der Robots einschränkt, um Überlastungen des Servers zu vermeiden.
User-agent
Disallow: / Ordner1/
Disallow: / Ordner2/
Crawl-delay: 60
7.- Wie richtet man eine robots.txt-Datei in einem bestimmten CMS ein?
Viele Content-Manager wie Joomla, Drupal, WordPress usw. haben wahrscheinlich bereits ihre eigene robots.txt-Datei zusammen mit der Anwendung installiert. Sie müssen lediglich die Direktive "crawl-delay" hinzufügen, um die Seite nicht zu überlasten, und auch die Verzeichnisse oder Artikel angeben, die indiziert werden sollen.
Beispiele für robots.txt:
Für WordPress:
User-agent
Crawl-Delay: 60
Disallow: /wp-content/
Disallow: /wp-icludes
Disallow: /trackback/
Disallow: /wp-admin/
Disallow: /files/
Disallow: /category/
Disallow: /tag/*
Disallow: /tag/
Disallow: /wp-*
Disallow: /login/
Disallow: /*.js$
Disallow: /*.inc$
Disallow: /*.css$
Disallow: /*.php$
User-agent:
Allow:/
User-agent: Googlebot-Image
Disallow: /
User-agent: Jennifer
Disallow: /
User-agent: duggmirror
Disallow: /
Für Drupal:
User-agent
Crawl-delay: 60
# Verzeichnisse
Disallow: /includes/
Disallow: /misc/
Disallow: /modules/
Disallow: /profiles/
Disallow: /scripts/
Disallow: /sites/
Disallow: /themes/
# Dateien
Disallow: /changelog.txt
Disallow: /cron.php
Disallow: /install.mysql.txt
Disallow: /install.pgsql.txt
Disallow: /install.php
Disallow: /inxt
Disallow: /license.txt
Disallow: /maintaners.txt
Disallow: /update.php
Disallow: /upgrade.txt
Disallow: /xmlrpc.php
# Pfade (saubere URLs)
Disallow: /admin/
Disallow: /comment/reply/
Disallow: /contact/
Disallow: /logout/
Disallow: /node/add/
Disallow: /search/
Disallow: /user/register/
Disallow: /user/password
Disallow: /user/login
# Pfade (nicht saubere URLs)
Disallow: /?q=admin/
Disallow: /?q=comment/reply
Disallow: /?q=contact
Disallow: /?
Disallow: /?
Disallow: /?
Disallow: /?
Disallow: /?
Disallow: /?
Disallow: /?
# Extras auf drupal.org
# Kein Zugriff für Tabellensortierungspfade oder Pfade mit Parametern
Disallow: /*
Disallow: /*&sort*
Disallow: /*solrsort*
Disallow: /*&solrsort*
# Kein Zugriff auf Profile, die oft von Spammern ins Visier genommen werden.
Disallow: /profile/interest/*
Disallow: /profile/industries/*
Disallow: /profile/companies/*
# Unechte Aggregator-Seiten verbieten
Disallow: /aggregator
# Projekt-Suche verbieten
Disallow: /project/issues/search/*
Disallow: /project/issues/*
# Buchexport verbieten
Disallow: /book/export/*
# Pift-Tests verbieten
Disallow: /pift/retest/*
# Projekt-Abonnement verbieten
Disallow: /project/issues/ subscribe-mail/*
Für Joomla:
User-agent
Crawl-delay: 60
Disallow: /administrator
Disallow: /cache/
Disallow: /components/
Disallow: /images/
Disallow: /includes/
Disallow: /installation/
Disallow: /language/
Disallow: /libraries/
Disallow: /media/
Disallow: /modules/
Disallow: /plugins/
Disallow: /templates/
Disallow: /tmp/
Disallow: /xmlrpc/
Für PrestaShop:
User-agent
Crawl-delay: 60
Disallow: /cgi-bin/
Disallow: /img/
Disallow: /js/
Disallow: /mails/
Disallow: /modules/
Disallow: /themes/
Disallow: /translations/
Disallow: /tools/
Disallow: /override/
Disallow: /classes/
Disallow: /config/
Disallow: /controllers/
Disallow: /download/
Disallow: /localization/
Disallow: /log/
Disallow: /mails/
Disallow: /override/
Disallow: /tests/
Disallow: /translations/
Disallow: /upload/
Disallow: /webservice/
Disallow: /404.php
Disallow: /address.php
Disallow: /addresses.php
Disallow: /authentication.php
Disallow: /best-sales.php
Disallow: /cart.php
Disallow: /category.php
Disallow: /cms.php
Disallow: /contact-form.php
Disallow: /discount.php
Disallow: /guest-tracking.php
Disallow: /history.php
Disallow: /identity.php
Disallow: /images.inc.php
Disallow: /init.php
Disallow: /my-account.php
Disallow: /order.php
Disallow: /order-detail.php
Disallow: /order-follow.php
Disallow: /order-opc.php
Disallow: /order-slip.php
Disallow: /order-history.php
Disallow: /pagination.php
Disallow: /password.php
Disallow: /pdf-invoice.
Disallow: /pdf-order-return.php
Disallow: /pdf-order-slip.php
Disallow: /product-sort.php
Disallow: /product-comparison.php
Disallow: /product.php
Disallow: /search.php
Disallow: /statistics.php