Modul · Die Zahlen, denen Ihre KI nicht trauen sollte

The Data Quality Audit

KI lernt, was Ihre Daten sie lehren, einschließlich der Lügen. Manche Ihrer Quellen werden manipuliert, manche sind veraltet, und die meisten haben keine verantwortliche Person, der es auffiele. Dieses Modul findet heraus, welche Daten sich gefahrlos in ein Modell einspeisen lassen und welche ihm genau das Falsche beibringen.

Frage 1 von 5 · Manipulierte Quellen sind bekannt

Wissen Sie, welche Ihrer Datenquellen von den Menschen manipuliert werden, die sie befüllen?

Jede Kennzahl, an der jemand gemessen wird, wird irgendwann optimiert, nicht immer ehrlich. Sales-Pipelines, Ticket-Abschlussquoten, Auslastung: Die Zahlen, an denen Boni hängen, sind die Zahlen, die ein Modell am ehesten belügen.

Frage 2 von 5 · Daten sind eingestuft

Werden Ihre Daten auf Qualität eingestuft, bevor jemand ihnen für eine Entscheidung vertraut?

Nicht alle Daten verdienen dasselbe Vertrauen. Eine Einstufung (verifiziert, geschätzt, ungeprüft) reist mit der Zahl mit und sagt einem Modell oder einem Menschen, wie viel Gewicht sie sich verdient hat.

Frage 3 von 5 · Jeder Datensatz hat eine verantwortliche Person

Hat jeder Datensatz, der zählt, eine benannte Person, die für seine Qualität geradesteht?

Verantwortung ist der Unterschied zwischen einem Fehler, der behoben wird, und einem, der jedes Quartal neu entdeckt wird. Kein Verwahrer, der die Daten speichert: eine verantwortliche Person, die angerufen wird, wenn sie falsch sind.

Frage 4 von 5 · Wissen, was zuerst einfließt

Wissen Sie, welche Ihrer Daten vertrauenswürdig genug sind, um zuerst in ein KI-System einzufließen?

Der Instinkt ist, dem Modell alles zu geben. Die Disziplin ist, ihm zuerst die saubersten, am besten verantworteten, an der Realität geprüften Daten zu geben, damit es aus Ihrer besten Evidenz lernt, nicht aus Ihrer schlechtesten.

Frage 5 von 5 · Zahlen führen zur Realität zurück

Können Sie eine Schlüsselzahl bis zu ihrem Ursprung zurückverfolgen und gegen die Realität prüfen?

Herkunft ist der Unterschied zwischen einer Zahl, die Sie verteidigen können, und einer, die Sie nur wiederholen. Wenn niemand eine Zahl bis zur Quelle zurückverfolgen kann, merkt auch niemand, wenn sie still bricht.

Für die Statistik · je ein Klick

Drei Fragen für das Gesamtbild

Diese Fragen beeinflussen Ihr Ergebnis nicht. Sie fließen in die anonymisierten, aggregierten Statistiken ein; Gruppen unter 8 Teilnehmern werden nie ausgewiesen.

Hat Ihr wichtigster Datensatz eine benannte verantwortliche Person?

Ja, eine klar verantwortliche Person
Geteilt, unklar
IT verwahrt ihn
Keine verantwortliche Person
Wir wissen es nicht

Haben Sie je entdeckt, dass eine Schlüsselkennzahl manipuliert wurde?

Ja, und behoben
Ja, noch offen
Wir vermuten es
Nie eine gefunden
Wir wissen es nicht

Auf welchen Anteil Ihrer Entscheidungsdaten würden Sie eine echte Entscheidung stützen?

Auf die meisten
Auf etwa die Hälfte
Auf sehr wenige
Wir sind nicht sicher

Ihr Kontext

Kalibriert den Report. Unternehmensgröße und Sektor bleiben im anonymisierten Datensatz; Ihre E-Mail-Adresse nicht.

So sehen die fünf Stufen aus

Jede Dimension von The Data Quality Audit wird von 1 bis 5 bewertet. Das bedeuten die Stufen, Dimension für Dimension. Der benotete Report diagnostiziert, wo Ihre eigenen Antworten landen und was daraus folgt.

Manipulierte Quellen sind bekannt

  1. 1Nie hinterfragt
  2. 2Vermutet, ungeprüft
  3. 3Einige identifiziert
  4. 4Meiste kartiert
  5. 5Verzerrung wird verfolgt

Am unteren Ende: Sie behandeln jede Zahl als gleich wahr, also wandern die manipulierten direkt ins Modell. Listen Sie die fünf Kennzahlen auf, an denen ein Bonus hängt; beginnen Sie Ihr Misstrauen dort. So sieht gut aus: Sie verfolgen, wo Anreize Ihre Daten verzerren, und das ist selten. Halten Sie die Karte aktuell: Jeder neue KPI schafft einen neuen Grund, ihn zu manipulieren.

Daten sind eingestuft

  1. 1Keine Einstufung
  2. 2Nur Bauchgefühl
  3. 3Ad-hoc-Prüfungen
  4. 4Manuell eingestuft
  5. 5Systematische Einstufung

Am unteren Ende: Uneingestufte Daten zwingen alle, eine Schätzung und eine Messung als gleichwertig zu behandeln. Ergänzen Sie Ihren meistgenutzten Datensatz um eine Spalte, Konfidenz, und füllen Sie sie ehrlich aus. So sieht gut aus: Eingestufte Daten lassen Menschen wie Modelle Evidenz korrekt gewichten. Automatisieren Sie die Einstufung, wo Sie können, damit die Disziplin das Volumen überlebt.

Jeder Datensatz hat eine verantwortliche Person

  1. 1Niemand verantwortlich
  2. 2IT verwahrt sie
  3. 3Verantwortung unklar
  4. 4Benannte Verantwortliche
  5. 5Verantwortliche in der Pflicht

Am unteren Ende: Daten ohne Verantwortliche verrotten still, weil es niemandes Aufgabe ist, es zu bemerken. Benennen Sie in dieser Woche Verantwortliche für Ihre drei wichtigsten Datensätze; Verantwortung ist billiger als Aufräumen. So sieht gut aus: Benannte, rechenschaftspflichtige Verantwortliche sind der Grund, warum Ihre guten Datensätze gut bleiben. Machen Sie Qualität zu einem Teil dessen, woran sie gemessen werden, nicht zu einem Gefallen.

Wissen, was zuerst einfließt

  1. 1Alles einspeisen
  2. 2Keine Priorität
  3. 3Grobes Gespür
  4. 4Priorisierte Shortlist
  5. 5Kuratierter Feed

Am unteren Ende: Ein Modell mit allem zu füttern lehrt es Ihre Fehler neben Ihren Wahrheiten. Wählen Sie den einen Datensatz, auf den Sie eine Entscheidung stützen würden, und beginnen Sie dort. So sieht gut aus: Ein kuratierter, priorisierter Feed ist genau der Anfang guter KI-Programme. Halten Sie die Shortlist an Einstufung und Verantwortung gekoppelt, damit sie ehrlich bleibt.

Zahlen führen zur Realität zurück

  1. 1Keine Herkunft
  2. 2Nur Kopfwissen
  3. 3Teilweise dokumentiert
  4. 4Dokumentierte Herkunft
  5. 5Herkunft plus Realitätsabgleich

Am unteren Ende: Zahlen ohne nachvollziehbaren Ursprung lassen sich weder verteidigen noch korrigieren. Nehmen Sie Ihre meistzitierte Kennzahl und dokumentieren Sie ihren vollen Weg von der Quelle bis zum Dashboard. So sieht gut aus: Nachvollziehbare, an der Realität geprüfte Daten sind das Fundament, auf dem alles andere steht. Automatisieren Sie die Prüfungen, damit Abweichungen auffallen, bevor eine Fehlentscheidung sie aufdeckt.