Wie es entsteht
Ein Datensatz, der heute zusammengestellt wird, enthält in der Regel nur die Unternehmen oder Fonds, die zum Zeitpunkt der Zusammenstellung noch existieren. Was in der Vergangenheit gescheitert ist — pleitegegangene Unternehmen, geschlossene Fonds, delistete Aktien — fehlt. Die überlieferte Vergangenheit ist damit keine Vergangenheit, die jemand je erlebt hat, sondern eine nachträglich bereinigte.
Warum das Modell es überschätzt
Ein Modell, das aus einem so bereinigten Datensatz lernt, lernt eine Rendite-Verteilung, die zu gut aussieht. Risiken, die zum Ausscheiden geführt haben, kommen im Training nicht vor. In der Anwendung trifft das Modell dann auf Situationen, die es nie gesehen hat — und überschätzt die Stabilität der Anlage.
Ein Beispiel aus dem Index
Stell dir vor, du bildest den Durchschnitt der Renditen aller heute existierenden Aktien eines Index über die letzten 20 Jahre. Die Unternehmen, die in diesen 20 Jahren aus dem Index geflogen sind, fehlen. Der Durchschnitt ist systematisch zu hoch. Jemand, der 2005 angelegt hat, hat eine andere Verteilung erlebt — mit den damals noch enthaltenen, später ausgeschiedenen Titeln.
Was Datenanbieter dagegen tun können
- Point-in-Time-Bestände nutzen: zum Stichtag t nur die Informationen, die zu t bekannt waren, und nur die Unternehmen, die zu t existierten.
- Delisting-Daten aufnehmen: Rendite bis zum Ausscheiden, dann Weiterbehandlung nach Austritt (z. B. Cash-Verwahrung).
- Auf den Index-Eintritt achten: Wer erst später in den Index kam, darf nicht so tun, als wäre er schon früher dabei gewesen.
Siehe auch
Look-Ahead Bias (Vorabblick auf Daten, die erst später da waren) und Sampling Bias (Verzerrung durch die Auswahl der Quelle) sind die beiden anderen häufigen Störfaktoren in Anlage-Datensätzen.