In diesem Artikel 5
Kurze Antwort
Eine generative KI liefert kein gespeichertes Ergebnis wie eine klassische Suchmaschine; sie erzeugt jedes Mal eine neue Antwort, mit einem gewissen Zufall, mit dem Index, den sie an diesem Tag hat, mit dem Kontext deiner Sitzung und auf manchen Plattformen mit deinem Standort. Deshalb sehen zwei Personen verschiedene Listen, und deshalb siehst du am Dienstag eine andere Liste. Das macht die Messung nicht nutzlos: Es macht Wiederholung zur Pflicht. Du misst mit denselben Fragen an verschiedenen Terminen und kennzeichnest jede Kombination als stabil, schwankend oder nicht auswertbar.
Fünf Gründe, warum sich die Antwort ändert
- Zufall im Modell. Modelle erzeugen Text, indem sie aus wahrscheinlichen Fortsetzungen auswählen. Zwei identische Durchläufe können zwei Formulierungen ergeben und manchmal zwei Listen.
- Der Suchindex. Sucht die Plattform im Web, ruft sie ab, was an diesem Tag da ist. Eine neue Seite, ein aktualisierter Eintrag oder eine Nachricht ändern, was abgerufen wird.
- Sitzung und Erinnerungen. ChatGPT kann frühere Unterhaltungen und Erinnerungen zur Personalisierung nutzen. Hast du schon nach deinem Unternehmen gefragt, misst du nicht mehr deinen Markt, sondern dich selbst.
- Standort und Sprache. Eine Frage auf Deutsch aus München und dieselbe Frage auf Englisch aus Dublin sind zwei verschiedene Anfragen. Die AI Overviews von Google („Übersicht mit KI“) hängen davon besonders stark ab.
- Formulierung. „Beste Online-Steuerberatung“ und „Welche Online-Steuerberatung empfiehlst du mir?“ können verschiedene Listen ergeben. Deshalb wird der genaue Wortlaut jeder Frage eingefroren und versioniert.
Was das für dich bedeutet
- Ein einzelner Screenshot beschreibt einen Moment. Mit ihm kannst du weder sagen „Wir tauchen nicht auf“ noch „Jetzt tauchen wir auf“.
- Ein Unterschied zwischen zwei Screenshots beweist keine echte Veränderung, solange er sich nicht wiederholt.
- Eine Gesamtrate („Wir tauchen in 40 % der Antworten auf“) verbirgt, welche Zeilen sich geändert haben. Die vollständige Matrix zählt mehr als die Zusammenfassung.
Wie du trotzdem misst
Friere die Fragen ein. Genauer Wortlaut, Version, Datum. Änderst du ein Wort, ist es eine andere Frage.
Nutze einen sauberen Chat. Einen temporären Chat oder eine Sitzung ohne Verlauf und ohne Erinnerungen. Notiere, ob die Websuche aktiviert war.
Leg Plattform, Sprache und Standort fest. Und halte sie bei jeder Beobachtung fest.
Wiederhole mit Abstand. Zwei Runden im Abstand von sieben Tagen sind das Minimum, um über Stabilität zu sprechen. Mit drei oder vier Runden lässt sich allmählich ein Trend vom Rauschen unterscheiden.
Kennzeichne jede Kombination aus Frage und Plattform:
| Kennzeichnung | Bedeutung |
|---|---|
| Stabil | Gleiche Erwähnung (oder gleiches Fehlen) und ähnliche Hauptquellen in allen Runden |
| Schwankend | Erwähnung, Reihenfolge oder Hauptquelle ändern sich zwischen den Runden |
| Nicht auswertbar | Fehler, Sperre oder unzureichende Antwort in mindestens einer Runde |
Erfasse Fehler als Fehler. Eine Zeitüberschreitung ist keine Null. Sie ist eine fehlgeschlagene Beobachtung, die du wiederholst.
Wie du ein schwankendes Ergebnis liest
Schwankt deine Marke bei der Hälfte der Fragen, gibt es zwei mögliche Lesarten: Die Kategorie ist in der KI noch nicht „entschieden“, oder deine Präsenz hängt von Quellen ab, die mal abgerufen werden und mal nicht. In beiden Fällen ist die Maßnahme dieselbe: stärken, was du steuerst (Seiten, die antworten, eine stimmige Entität), und weiter messen, bevor du in externe Quellen investierst.
Was die Schwankung nicht rechtfertigt
Sie rechtfertigt weder, das Messen aufzugeben („Es ändert sich ja sowieso ständig“), noch, jemanden zu beauftragen, der dir Stabilität verspricht. Sie rechtfertigt genau das Gegenteil: mit Methode messen und jedem misstrauen, der dir einen einzigen Screenshot zeigt.