Checkliste

Checkliste Maschinenlesbarkeit.

Zwanzig Fragen in vier Bereichen. Die meisten lassen sich an einem Nachmittag mit Browser, Logs und Edge-Einstellungen beantworten.

Suchmaschinen, KI-Crawler und Assistenten lesen Ihre Website, bevor sie sie zitieren, zusammenfassen oder jemanden dorthin schicken. Diese Checkliste umfasst die vier Bereiche, die wir in einer Bewertung der Maschinenlesbarkeit bewerten. Nutzen Sie sie für Ihre eigene Website. Jede Frage, die Sie nicht beantworten können, lohnt einen Blick. Wir haben sie auch auf unsere eigene Website angewendet.

Auffindbar

Können Crawler und Assistenten Ihre Seiten finden, und dürfen sie sie abrufen?

  1. Welche KI-Crawler erlaubt Ihre robots.txt, und war das eine bewusste Entscheidung?Viele Websites blockieren oder erlauben sie aus Versehen, über eine alte Voreinstellung oder eine Edge-Einstellung ohne klare Zuständigkeit.
  2. Blockiert Ihre Edge oder Firewall Bots, die robots.txt erlaubt?Bot-Schutz vor der Website kann robots.txt unbemerkt aushebeln. Prüfen Sie diese Regeln ebenso wie die Datei.
  3. Gibt es eine Sitemap, und enthält sie nur Seiten, die 200 liefern?Weiterleitungen, fehlende und als noindex markierte Seiten in der Sitemap verschwenden Crawl-Budget und verwischen, was gelesen werden soll.
  4. Haben wichtige Seiten eine kanonische Adresse, die auf sie selbst zeigt?Sprachversionen, Kampagnenparameter und Varianten mit oder ohne Schrägstrich machen für eine Maschine aus einer Seite mehrere.
  5. Sehen Sie in Ihren Logs, welche Maschinen Ihre Website lesen und wie oft?Ohne das lässt sich der Rest der Liste nicht messen.

Darstellbar

Steht der Inhalt im HTML, das eine Maschine erhält, oder erscheint er erst nach dem Ausführen von Skripten?

  1. Rufen Sie eine wichtige Seite ohne JavaScript ab. Ist der Haupttext da?Viele Crawler führen keine Skripte aus. Was sie nicht erhalten, können sie nicht lesen.
  2. Stehen Preise, Spezifikationen und Verfügbarkeit in der ersten HTML-Antwort?Produktdaten, die erst nach dem Rendern geladen werden, sehen Crawler ohne Skriptausführung nicht, darunter mehrere KI-Crawler.
  3. Sind Tabs, Akkordeons und „Mehr lesen“-Bereiche im HTML enthalten?Inhalte dürfen optisch verborgen sein und trotzdem gelesen werden; Inhalte, die erst nach einem Klick laden, meist nicht.
  4. Wie lange dauert das erste Byte für einen Crawler von einem anderen Kontinent?Langsame Server werden seltener gecrawlt. Messen Sie außerhalb Ihrer eigenen Region und Ihres Caches.
  5. Verdecken Cookie-Banner oder Login-Sperren Inhalte, die öffentlich sein sollten?Ein Overlay, das ein Mensch wegklicken kann, ist womöglich das Einzige, was eine Maschine je sieht.

Strukturiert

Kann eine Maschine erkennen, was jeder Teil einer Seite bedeutet?

  1. Hat jede Seite genau eine h1 und eine Überschriftenfolge, die zum Inhalt passt?Überschriften sind die günstigste Struktur, die es gibt, und Assistenten zerlegen Seiten anhand davon in Antworten.
  2. Veröffentlichen Sie schema.org-Daten für Ihre Haupttypen: Organisation, Produkt, Artikel, FAQ?Prüfen Sie sie mit einem Validator. Falsche strukturierte Daten können mehr irreführen als gar keine.
  3. Sind Tabellen echte Tabellen und Listen echte Listen?Layouts aus beliebigen Boxen verlieren die Zusammenhänge, die eine Maschine braucht, um eine Spezifikation zu lesen.
  4. Haben Bilder, die Information tragen, Textalternativen?Ein Diagramm ohne Alternativtext oder Bildunterschrift ist für ein Sprachmodell leer.
  5. Wird dieselbe Tatsache überall gleich angegeben?Zwei Preise oder zwei Namen für ein Produkt zwingen Maschinen zum Raten, und sie raten oft falsch.

Adressierbar

Lässt sich ein einzelnes Element über eine stabile Adresse abrufen, ohne den Rest der Website?

  1. Hat jedes Produkt, jedes Dokument und jeder Artikel eine dauerhafte Adresse?Inhalte, die nur in einem Suchergebnis oder einem Filterzustand existieren, lassen sich nicht zitieren.
  2. Leiten alte Adressen nach einem Relaunch oder einer Migration auf ihre Nachfolger weiter?Defekte Links werfen weg, was Crawler über Jahre über Ihre Website gelernt haben.
  3. Kann eine Maschine Ihre Inhalte neben HTML auch über eine API oder einen Feed abrufen?Eine Content-API, RSS oder ein Produktfeed ist oft die sauberste Quelle für einen Assistenten.
  4. Legen Sie fest, welche Inhalte Maschinen wie nutzen dürfen?Lizenz- und Nutzungssignale sind neu und nicht abschließend geregelt. Legen Sie Ihre Position fest, bevor andere es für Sie tun.
  5. Gelten Berechtigungen überall, wohin Ihre Inhalte kopiert werden?Prüfen Sie Suchindizes, Feeds und APIs, nicht nur die Seite selbst.

Lieber messen lassen?

Wir führen diese Prüfungen an Ihrer Website durch, bewerten jeden Bereich und sagen Ihnen, was zuerst zu ändern ist.