Wie es entsteht

Ein Datensatz ist nie der Markt. Er ist eine Auswahl. Wenn die Auswahl systematisch verzerrt ist — nur große Unternehmen, nur amerikanische Emittenten, nur Unternehmen mit vollständigen Kennzahlen — dann lernt das Modell eine Welt, die kleiner ist als die, in der es eingesetzt wird.

Warum die Verallgemeinerung scheitert

Ein Modell, das aus einer einseitigen Stichprobe lernt, verallgemeinert schlecht. Es überschätzt die Bedeutung der Merkmale, die in der Stichprobe häufig sind, und unterschätzt die, die dort fehlen. In der Anwendung trifft es auf Unternehmen oder Situationen, die in dieser Form nicht im Training vorkamen — und wird unsicherer, ohne dass es das signalisiert.

Konkretes Beispiel

Ein Datensatz enthalte nur Unternehmen aus dem S&P 500. Das Modell lernt Zusammenhänge für große, etablierte US-Emittenten. Wird es auf mittelständische Emittenten aus Europa angewendet, sind die gelernten Zusammenhänge nicht ohne Weiteres übertragbar — die Struktur der Unternehmen, die Berichterstattung und die Saisonalitäten sind andere.

Was eine offene Dokumentation beitragen kann

  • Erfassungsbereich dokumentieren: welche Regionen, Größenklassen und Sektoren sind enthalten, welche nicht.
  • Abdeckung prüfen: Anteil der abgedeckten Marktkapitalisierung und der abgedeckten Emittenten offenlegen.
  • Auslassungen benennen: wenn kleine Emittenten oder bestimmte Sektoren fehlen, im Artikel sagen, dass sie fehlen.

Siehe auch

Survivorship Bias — wenn Aussteiger im Datensatz fehlen — und Look-Ahead Bias (Vorabblick auf später korrigierte Daten) sind zwei weitere Störfaktoren, die in Anlage-Datensätzen regelmäßig auftreten.