4. Diskussion und Quiz#

Was wir gesehen haben: Eine Zusammenfassung#

Die vorherigen drei Kapitel haben jeweils eine andere Art gezeigt, wie ein Modell nicht durch einen Programmierfehler, sondern durch einen Mangel in den Daten oder im Analyseprozess danebenliegen kann. Die folgende Tabelle fasst die vier behandelten Arten von Verzerrungen zusammen.

Verzerrung

Kapitel

Was schiefgeht

Charakteristisches Symptom

Ausgelassene Variable

1

Ein wichtiger Prädiktor fehlt im Modell

Systematische Über- oder Unterschätzung für bestimmte Gruppen

Stichprobe

2

Trainingsdaten repräsentieren nicht die Zielpopulation

Große Fehler für unterrepräsentierte Gruppen zur Testzeit

Survivorship

3

Nur “erfolgreiche” Fälle erscheinen in den Daten; Fehlschläge sind unsichtbar

Modell performt gut bei Überlebenden, aber schlecht in der Gesamtpopulation

P-Hacking

3

Tests werden wiederholt, bis ein signifikantes Ergebnis erscheint

Veröffentlichte Befunde, die sich nicht replizieren lassen

Obwohl sie auf unterschiedliche Weise entstehen, haben alle vier eine gemeinsame Wurzel: Die Daten oder die Analyse bilden die Welt, die das Modell beschreiben soll, nicht getreu ab.


Auswirkungen in der Praxis#

Verzerrung durch ausgelassene Variablen#

Im ersten Kapitel führte das Weglassen des Geschlechts aus einem Lohnmodell dazu, dass das Modell die Löhne von Frauen um etwa 5 $/Std. überschätzte und die von Männern unterschätzte. Derselbe Mechanismus tritt immer dann auf, wenn eine relevante, aber unbequeme Variable ausgeschlossen wird.

Beispiele aus der Praxis:

  • Lohngerechtigkeits-Audits, die nach Berufsbezeichnung und Betriebszugehörigkeit kontrollieren, aber die Tatsache auslassen, dass Frauen sich in schlechter bezahlten Berufsfeldern konzentrieren, wodurch eine strukturelle Lücke verschleiert wird.

  • Kreditscoring-Modelle, die die ethnische Zugehörigkeit ausschließen (korrekt, wie gesetzlich vorgeschrieben), aber Postleitzahl oder Bildung einbeziehen, die stark mit ethnischer Zugehörigkeit korrelieren und die Verzerrung durch eine Hintertür wieder einführen.

  • Medizinische Risiko-Scores, die anhand der Behandlungskosten statt der Krankheitsschwere trainiert wurden; da Schwarze Patientinnen und Patienten historisch weniger Behandlung erhielten, unterschätzte das Modell systematisch ihren medizinischen Bedarf.

Stichprobenverzerrung#

Im zweiten Kapitel bedeutete das Training nur mit jungen Arbeitnehmern, dass das Modell nie lernte, dass Löhne mit der Erfahrung stark ansteigen. Angewendet auf eine 50-jährige Person sagte es einen Lohn wie für junge Arbeitnehmer voraus.

Beispiele aus der Praxis:

  • Gesichtserkennungssysteme, die überwiegend mit hellhäutigen Gesichtern trainiert wurden und bei dunkleren Hauttönen schlecht abschneiden — teilweise mit zehnmal höheren Falsch-Positiv-Raten.

  • Ergebnisse klinischer Studien, die überwiegend von männlichen oder westlichen Populationen stammen und dann auf Gruppen angewendet werden, die in der ursprünglichen Studie nicht vertreten waren.

  • Empfehlungssysteme, die auf Daten von Power-Usern beruhen (die viele Artikel bewerten) und gelegentlichen Nutzerinnen und Nutzern schlecht dienen.

Survivorship Bias#

Im dritten Kapitel fehlten in einem Personalarchiv genau die Arbeitnehmer mit kurzer Betriebszugehörigkeit und niedrigem Lohn, die das Unternehmen bereits verlassen hatten — genau die Gruppe, die am schwersten vorherzusagen ist. Ein auf dem Archiv trainiertes Modell schnitt bei langjährigen Mitarbeitenden gut ab, aber schlecht bei Neueinstellungen.

Beispiele aus der Praxis:

  • Gründungsforschung, die sich auf aktuell tätige Unternehmen stützt, ignoriert die Mehrheit der gescheiterten Start-ups und führt zu übertrieben optimistischen Schlüssen darüber, was Unternehmen erfolgreich macht.

  • Anlagestrategien, die aus heute noch existierenden Fonds abgeleitet werden und die vielen Fonds ignorieren, die nach schlechter Performance geschlossen wurden — ein bekanntes Problem beim Backtesting.

  • Historische Gehaltsvergleiche, die auf Beschäftigten beruhen, die im Unternehmen geblieben sind, und jene ausschließen, die für besseres Gehalt woanders hingewechselt sind, wodurch die tatsächliche Marktrate unterschätzt wird.

P-Hacking#

Im dritten Kapitel führten t-Tests auf 20 vollkommen zufälligen Ja/Nein-Merkmalen allein durch Zufall zu ein oder zwei “signifikanten” Ergebnissen. Würden nur diese berichtet, enthielte die Literatur eine falsche Aussage über Löhne.

Beispiele aus der Praxis:

  • Medikamentenstudien, die viele Dosierungen, Subpopulationen oder Endpunkte testen und nur diejenigen berichten, die die Signifikanzschwelle überschritten haben, was zu einer Replikationskrise in Medizin und Psychologie beiträgt.

  • Wirtschaftspolitische Analysen, bei denen Forschende viele Modellspezifikationen testen (unterschiedliche Kontrollvariablen, Stichprobeneinschränkungen, Zeitfenster) und die Spezifikation berichten, die eine bevorzugte Schlussfolgerung am besten unterstützt.

  • A/B-Tests in der Produktentwicklung, bei denen viele gleichzeitige Tests laufen und man auf den ersten reagiert, der p < 0,05 erreicht, was die Falsch-Positiv-Rate weit über die nominellen 5 % hinaus erhöht.


Wie man jede Verzerrung erkennt und abmildert#

Erkennung#

Verzerrung

Wichtige Diagnose

Ausgelassene Variable

Prüfe, ob die Residuen über eine Gruppe hinweg systematisch sind, die nicht als Variable einbezogen wurde

Stichprobe

Vergleiche die Verteilung wichtiger Variablen in den Trainingsdaten mit der Zielpopulation; bewerte RMSE oder Genauigkeit nach Untergruppe

Survivorship

Frage: Wer ist nicht in diesem Datensatz, und warum? Achte auf unplausibel niedrige Fehlschlags- oder Abbruchraten

P-Hacking

Prüfe, ob alle Tests und Modellspezifikationen berichtet wurden; stelle die vollständige Verteilung der p-Werte dar. Sie sollte unter der Nullhypothese annähernd gleichverteilt sein

Abmilderung#

Verzerrung

Praktische Abhilfe

Ausgelassene Variable

Alle theoretisch relevanten Variablen einbeziehen; Residuenplots nutzen, um verbleibende Muster auf Gruppenebene zu prüfen

Stichprobe

Repräsentative Daten erheben; falls unmöglich, die Lücke dokumentieren und Modelle an zurückgehaltenen Daten unterrepräsentierter Gruppen bewerten

Survivorship

Daten zu Nicht-Überlebenden suchen (geschlossene Fonds, gescheiterte Firmen, Abbrecher); überlebende Fälle explizit gewichten oder kennzeichnen

P-Hacking

Hypothesen vor der Datenerhebung vorab registrieren; Korrekturen für multiples Testen anwenden (z. B. Bonferroni); alle Tests berichten, nicht nur die signifikanten


Ethische Überlegungen#

Die in diesem Tutorial besprochenen Verzerrungen sind keine abstrakten statistischen Kuriositäten. Sie betreffen reale Menschen. Ein Lohnmodell, das das Geschlecht auslässt, kann zur Gehaltsfestlegung verwendet werden. Ein Kreditmodell, das mit nicht repräsentativen Daten trainiert wurde, kann qualifizierten Antragstellerinnen und Antragstellern Kredite verweigern. Eine veröffentlichte, p-gehackte Studie kann in die Politikgestaltung einfließen.

Ein paar Prinzipien, die man im Hinterkopf behalten sollte:

  • Transparenz: Dokumentiere klar, welche Variablen das Modell verwendet, mit welchen Daten es trainiert wurde und welche Gruppen unterrepräsentiert sind. Nutzerinnen und Nutzer eines Modells können Verzerrungen nicht korrigieren, von denen sie nichts wissen.

  • Verantwortlichkeit: Lege fest, wer dafür verantwortlich ist, die Modellleistung über die Zeit zu überwachen. Verzerrungen können entstehen oder sich verschieben, wenn sich die Welt verändert, selbst wenn das Modell selbst gleich bleibt.

  • Nach Gruppe bewerten, nicht nur insgesamt: Die Gesamtgenauigkeit oder der Gesamt-RMSE können akzeptabel aussehen, während sie schwere Ungleichheiten für bestimmte Untergruppen verschleiern. Schlüssle Leistungsmetriken immer nach den Gruppen auf, die dein Modell betreffen wird.

  • Alle Analysen berichten: Ob in der Wissenschaft oder in der Industrie — nur die Analyse zu berichten, die das attraktivste Ergebnis liefert, ist eine Form von P-Hacking. Ein transparenter Arbeitsablauf dokumentiert, was versucht und was gefunden wurde, einschließlich Nullresultaten.


Übungen#

Übung 1: Verzerrung durch ausgelassene Variablen#

In Kapitel 1 haben wir ein Lohnmodell erstellt, das die Variable Geschlecht ausgelassen hat. Was war die Hauptfolge?

Übung 2: Stichprobenverzerrung#

In Kapitel 2 wurde das verzerrte Modell nur mit jungen Arbeitnehmern trainiert. Warum schnitt es bei älteren Arbeitnehmern zur Testzeit so schlecht ab?

Übung 3: Survivorship Bias#

In Kapitel 3 fehlten im Unternehmensarchiv Arbeitnehmer mit kurzer Betriebszugehörigkeit und unterdurchschnittlichem Lohn. Was beschreibt die Auswirkung auf ein mit diesem Archiv trainiertes Modell am besten?

Übung 4: P-Hacking#

In Kapitel 3 haben wir 20 vollkommen zufällige Ja/Nein-Merkmale auf einen Lohneffekt getestet und ein oder zwei "signifikante" Ergebnisse (p < 0,05) gefunden. Was ist die richtige Interpretation?


Zusammenfassung#

In den drei vorangegangenen Kapiteln sind wir vier verschiedenen Wegen begegnet, auf denen ein Modell systematisch falsche Ergebnisse liefern kann:

  1. Verzerrung durch ausgelassene Variablen entsteht, wenn eine Variable, die das Ergebnis tatsächlich beeinflusst, im Modell fehlt. Das Modell kann Gruppenunterschiede, die es nicht sehen kann, nicht berücksichtigen, und seine Fehler werden systematisch statt zufällig.

  2. Stichprobenverzerrung entsteht, wenn die Trainingsdaten nicht die Population widerspiegeln, auf die das Modell angewendet wird. Gruppen, die im Training selten vorkommen, werden schlecht vorhergesagt, und die Gesamtgenauigkeit kann das vollständig verschleiern.

  3. Survivorship Bias ist ein Spezialfall der Stichprobenverzerrung: Nur die “Überlebenden” eines Auswahlprozesses erscheinen in den Daten. Das Modell lernt etwas über erfolgreiche oder stabile Fälle und kann nicht auf jene verallgemeinern, die nicht überlebt haben.

  4. P-Hacking ist keine Verzerrung in den Daten, sondern in der Analyse: Viele Tests durchzuführen und nur die signifikanten zu berichten, erhöht die Falsch-Positiv-Rate und führt zu Befunden, die sich nicht replizieren lassen.

Der gemeinsame Faden ist, dass das, was in den Daten oder im Bericht fehlt, genauso wichtig ist wie das, was vorhanden ist. Die Frage “Wer oder was fehlt hier, und warum?” zu stellen, ist eine der mächtigsten Fragen, die sich eine Forschungsperson oder Praktikerin oder Praktiker stellen kann, bevor sie der Ausgabe eines Modells vertraut.