Crawler

ptai-audit

ptai-audit ist der Crawler, mit dem ich, Yves Schleich, für den E-Commerce-Audit von Path to AI die öffentlichen Seiten eines Shops abrufe. Aus diesen Seiten lese ich ab, wie der Shop technisch dasteht: Statuscodes, Weiterleitungen, Titel und Meta-Angaben, Canonicals und die interne Verlinkung.

Betreiber
Yves Schleich, Path to AI
User-Agent
Mozilla/5.0 (compatible; ptai-audit/1.0; +https://path-to-ai.com/crawler)
Kontakt
yves@path-to-ai.com

Was der Crawler abruft

Der Crawler beginnt auf der Startseite und folgt von dort den internen Links und den Einträgen eurer Sitemap. Dabei lädt er nur die HTML-Seiten selbst, dazu die robots.txt und die Sitemap. Bilder, Skripte und Stylesheets lädt er nicht mit.

Jeder Abruf ist eine einfache GET-Anfrage auf eine Seite, die jeder Besucher ohne Anmeldung sieht. Der Crawler schickt keine Formulare ab, meldet sich nirgends an und führt kein JavaScript aus. Je Lauf ruft er höchstens eine vorher festgelegte Zahl von Seiten ab.

Crawl-Rate

Der Crawler ruft eine Seite nach der anderen ab, nie mehrere gleichzeitig, und legt zwischen zwei Abrufen eine Pause ein. Antwortet euer Server mit HTTP 429, verlängert der Crawler die Pause und holt die Seite später noch einmal. Weist eure Bot-Erkennung einen Abruf ab, vermerkt der Crawler die Seite als nicht abrufbar und versucht es dort kein zweites Mal.

robots.txt

Vor dem ersten Seitenabruf liest der Crawler eure robots.txt. Steht dort eine eigene Gruppe User-agent: ptai-audit, gelten für den Crawler nur deren Disallow-Regeln, ansonsten die Regeln unter User-agent: *. Jede Adresse prüft der Crawler vor dem Abruf gegen diese Regeln und ruft eine gesperrte Adresse nicht ab. Gelten die Regeln unter User-agent: *, ruft der Crawler die Startseite trotzdem immer ab, weil sie der Einstieg in den Crawl ist.

Wollt ihr ptai-audit ganz von eurem Shop fernhalten, reicht diese Gruppe in eurer robots.txt:

User-agent: ptai-audit
Disallow: /

Dann ruft der Crawler nur noch die robots.txt ab und keine einzige Seite. Ihr könnt mir auch kurz schreiben, dann nehme ich euren Shop aus allen weiteren Läufen raus.

Wann der Crawler läuft

Der Crawler läuft für den Audit, und einen Audit starte ich, wenn jemand aus dem Unternehmen ihn angefragt oder beauftragt hat oder wenn ich mir einen Shop auf eigene Initiative ansehe.

Freigabe in eurer Firewall

Habt ihr den Audit beauftragt und betreibt vor eurem Shop eine Bot-Erkennung wie Cloudflare, bitte ich euch für den Tag des Laufs um eine Ausnahme in eurer Firewall. Die Ausnahme hängt an meinen IP-Adressen und nicht am User-Agent, weil ich für die Screenshots zusätzlich einen normalen Browser einsetze, der sich nicht als ptai-audit meldet.

Die Adressen und die Anleitung dazu schicke ich euch zusammen mit den übrigen Zugängen für den Audit. Nach dem Lauf sage ich euch Bescheid, dann könnt ihr die Ausnahme wieder löschen.

Kontakt

Fragen zum Crawler oder zu einem Lauf auf eurem Shop beantworte ich direkt per Mail an yves@path-to-ai.com. Die vollständigen Anbieterangaben stehen im Impressum.