Methodik v0.2.1 · Korrigendum vor dem ersten Run

AI Visibility Index Deutschland: Das Messprotokoll steht. Die Rangliste wartet auf echte Antworten.

Wir veröffentlichen bereits vor dem ersten Run den vollständigen Prompt-Satz und das Laufregister. So kann später niemand Fragen, Oberflächen oder Wiederholungen passend zum gewünschten Ergebnis verschieben.

Geplante Antwortoberflächen
  • ChatGPT
  • Gemini
  • Perplexity
  • Google AI Mode

Studiendesign

Nicht Marken in Prompts drücken, sondern ungestützte Auswahl beobachten.

Die Prompts nennen keine Testmarken. Sie fragen entlang fünf festgelegter Entscheidungsstufen nach Problemen, Kategorien, Vergleichen, Vertrauen und Shortlists. Dadurch wird gemessen, welche Marken ein System selbst in den Antwortkontext einführt.

Jede der sechs Branchen erhält dieselben 30 Fragefunktionen mit branchenspezifischem Wortlaut. Pro Prompt sind vier Antwortoberflächen und drei Wiederholungen vorgesehen. Das ergibt 6 × 30 × 4 × 3 = 2.160 geplante Antwortbeobachtungen.

Das Verfahren produziert keinen universellen Marktanteil. Es beschreibt Sichtbarkeit in genau diesem deutschen Prompt-Satz, in den dokumentierten Oberflächen und im angegebenen Messfenster.

Geplantes 2.160-Run-Ledger herunterladen →

Messdimensionen

Vier getrennte Ergebnisse statt eines undurchsichtigen Scores.

Ein zusammengesetzter Indexwert würde Gewichtungen verstecken. Deshalb werden die Dimensionen zunächst separat veröffentlicht.

DimensionZählerNennernotwendige Grenze
Mention Coveragegültige Antworten mit Markennennungalle gültigen und transparent ausgeschlossenen Runs der Brancheeine Nennung ist noch keine Empfehlung
Citation CoverageAntworten mit verlinkter Markendomainalle gültigen Runs der BrancheQuelle muss den zugeordneten Claim tragen
Shortlist PresenceShortlist-Prompts mit Marke in der Auswahlgültige Entscheidungs-PromptsPosition und Tonalität separat erfassen
Brand Accuracymanuell als korrekt bewertete Markenaussagenbewertete Antworten mit Markenclaimnicht aus Sentiment oder Erwähnung ableiten

Erhebungsablauf

Vom eingefrorenen Prompt bis zum öffentlichen Rohdatensatz.

01

Kontext festhalten

Oberfläche, sichtbare Modellbezeichnung, Login-, Memory-, Sprach- und Standortkontext werden vor jedem Run gespeichert.

02

Antwort archivieren

Wortlaut, sichtbare Quellen, Zeitstempel und technische Fehler erhalten eine eindeutige Run-ID.

03

Manuell codieren

Marken, Rolle, Citation, Quellendomain und sachliche Richtigkeit werden nach einem festen Codebuch geprüft.

04

Vollständigkeit prüfen

Erst wenn Ledger, Rohbelege und Reviews zusammenpassen, werden Aggregationen und Daten veröffentlicht.

Beobachtungseinheit & Nenner

Jeder geplante Run behält seinen Platz – auch wenn die Oberfläche scheitert.

Die kleinste Beobachtungseinheit ist eine Antwort auf eine festgelegte Kombination aus Branche, Prompt-ID, Oberfläche und Wiederholung. Eine Markennennung innerhalb dieser Antwort zählt zunächst nur als Vorkommen. Mehrere Nennungen derselben Marke in einem Text erhöhen die Mention Coverage nicht mehrfach. Eine sichtbare Verlinkung wird getrennt erfasst, weil eine Erwähnung ohne Quelle etwas anderes aussagt als eine belegte Citation.

Für jede Aggregation werden Zähler und Nenner gemeinsam veröffentlicht. Regulär abgeschlossene Antworten bilden den gültigen Nenner. Technische Fehler, Blockaden, leere Ausgaben oder nicht reproduzierbare Oberflächenzustände erhalten einen Fehlercode und bleiben im Laufregister sichtbar. Sie dürfen nicht nachträglich gelöscht werden, nur weil ihr Ausschluss eine Kennzahl verbessert. Neben der Kennzahl wird deshalb die Zahl geplanter, gültiger, fehlgeschlagener und noch ungeprüfter Runs ausgewiesen.

Wiederholungen werden nicht zu einer vermeintlich sicheren Einzelantwort zusammengezogen. Sie zeigen, wie stabil oder variabel die Beobachtung innerhalb desselben Messfensters ist. Eine Marke, die in einer von drei Wiederholungen erscheint, wird anders dokumentiert als eine Marke, die in allen drei vorkommt. Daraus folgt trotzdem keine Aussage über sämtliche Nutzer, Sessions oder zukünftige Modellversionen.

Keine stillen Ersetzungen

Wenn ein Run technisch scheitert, wird nicht spontan ein zusätzlicher Versuch an seine Stelle gesetzt. Ein Nachlauf erhält eine eigene Kennzeichnung, einen neuen Zeitstempel und einen begründeten Status. Prompt-Wortlaut, Reihenfolge und Systeme werden während eines Messzyklus nicht angepasst. Notwendige methodische Änderungen führen zu einer neuen Protokollversion, damit alte und neue Erhebung nicht unbemerkt vermischt werden.

Codebuch

Was Reviewer in einer Antwort tatsächlich markieren.

Die Kategorien verhindern, dass bloße Präsenz automatisch als Empfehlung oder korrekte Darstellung gilt.

FeldCodierregelhäufige Fehlinterpretation
Markennennungeindeutig identifizierbarer Marken- oder Unternehmensname im sichtbaren Antworttextein Kategoriename oder generischer Begriff wird nicht als Marke gezählt
RolleEmpfehlung, Beispiel, Quelle, Warnung oder bloße Randnennung getrennt erfassenjede Erwähnung als positive Empfehlung lesen
Citationsichtbarer Link und Ziel-Domain werden der konkreten Antwort zugeordnetMarkennennung ohne Link als Citation ausgeben
Shortlist-PositionPosition nur bei erkennbar geordneter Auswahl festhaltenAbsatzreihenfolge immer als Ranking interpretieren
Markenrichtigkeitprüfbare Claims mit der erreichbaren Markenquelle vergleichenpositive Tonalität mit sachlicher Richtigkeit gleichsetzen
Antwortsprachetatsächlich ausgegebene Hauptsprache dokumentierendeutschen Prompt automatisch als deutsche Antwort behandeln

Uneindeutige Fälle werden nicht durch Mehrheitsgefühl aufgelöst. Reviewer markieren den Konflikt, dokumentieren die Passage und lassen ihn vor der Aggregation klären. Stichproben mit zweiter Prüfung sollen zusätzlich zeigen, ob das Codebuch konsistent angewendet wird.

Grenzen der Aussage

Der Index misst eine definierte Stichprobe, nicht „die KI“.

Antwortoberflächen verändern sich. Sichtbare Modellnamen, Quellenfunktionen, Personalisierung, Login-Status, Memory, Standort und Rollouts können Resultate beeinflussen. Das Protokoll hält beobachtbare Kontexte fest, kann aber nicht jeden internen Systemzustand kontrollieren. Ergebnisse gelten deshalb für das veröffentlichte Messfenster und die dokumentierte Nutzungssituation.

Die 30 Prompts je Branche bilden fünf Entscheidungsstufen ab, sind aber keine repräsentative Befragung aller deutschen Nutzer. Eine hohe Coverage bedeutet Sichtbarkeit in diesem Set, keinen Marktanteil und keine Umsatzwirkung. Branchen mit unterschiedlichen Informationsgewohnheiten sind nur innerhalb der klar beschriebenen Dimensionen vergleichbar.

Auch Citations benötigen Kontext. Ein Link kann eine Marke stützen, kritisieren oder nur eine Nebeninformation belegen. Deshalb werden Domain, Rolle und zugeordneter Claim gespeichert. Brand Accuracy wird ausschließlich dort bewertet, wo eine überprüfbare Markenaussage vorliegt; fehlende Informationen werden nicht automatisch als falsch codiert.

Der erste Messlauf liefert eine Baseline, noch keinen Trend. Aussagen über Verbesserung oder Verschlechterung benötigen weitere Zyklen mit ausreichend ähnlichem Design. Modell- oder Oberflächenwechsel werden als mögliche Brüche der Zeitreihe dokumentiert. Ein späteres Korrigendum darf Rohantworten nicht rückwirkend umdeuten, sondern ergänzt die veröffentlichte Version nachvollziehbar.

Diese Grenzen reduzieren den Wert der Erhebung nicht. Sie definieren, welche Frage der Datensatz beantworten kann: Welche Marken, Quellen und Darstellungen traten in einem vorab festgelegten deutschen Entscheidungsprompt-Set auf – und wie stabil war diese Beobachtung über Systeme und Wiederholungen?

Publikationsgates

Eine Rangliste erscheint erst nach vier bestandenen Prüfungen.

Ein attraktives Ergebnis ist kein Ersatz für einen vollständigen Datensatz.

01

Vollständigkeit

Alle 2.160 Slots besitzen einen dokumentierten Status. Fehlversuche und Ausschlüsse sind mit Grund sichtbar.

02

Nachweis

Jede codierte Zeile verweist auf eine archivierte Rohantwort, Oberfläche, Prompt-ID und einen Zeitstempel.

03

Review

Uneindeutige Marken, Citations, Rollen und Richtigkeitsurteile sind vor der Aggregation geklärt.

04

Reproduzierbarkeit

Codebuch, Zähler, Nenner, Version, Einschränkungen und maschinenlesbare Daten werden gemeinsam veröffentlicht.

Aktueller Status

Methodik und Stichprobe sind öffentlich. Ergebnisse sind es noch nicht.

Stand 16. Juli 2026

01

Prompt-Set

180 Zeilen, eingefroren und als CSV herunterladbar.

02

Run-Ledger

2.160 geplante Slots mit stabiler Prompt-, System- und Wiederholungs-ID.

03

Rohantworten

Noch nicht vorhanden. Es gibt keine simulierten Markennennungen oder Citations.

04

Rangliste

Gesperrt, bis alle Publikationsgates mit echten Daten bestanden sind.

Korrigendum v0.2.1 vor dem ersten Run: Das Ledger enthält nun eigene Felder für Antwortsprache, Shortlist-Positionen und sachliche Markenrichtigkeit. Prompt-Wortlaut, Oberflächen, Wiederholungen und Nenner blieben unverändert.

Datenschema · Prompt-Set · Run-Ledger

Kostenlose Ersteinschätzung

Soll Ihre Marke oder Branche in einem späteren Messlauf geprüft werden?

30 Minuten, unverbindlich. Sie erhalten eine klare Einschätzung zu Technik, Inhalten, Entitäten und den sinnvollsten nächsten Schritten.

Verfügbare Termine ansehenLive-Zeiten im Kalender auswählen