Methodik, gemessen

Model Calibration Lab

Ein Pick-Record sagt dir, was gewonnen hat. Kalibrierung sagt dir, ob die Wahrscheinlichkeiten überhaupt etwas bedeuten: Wenn wir 60% sagen, passiert es dann 60% der Zeit? Unten jede abgewickelte Prognose, auf zwei Arten bewertet — der sharp market (devigged) und unser eigenes Modell — mit dem unbequemen Vergleich im direkten Blick.

Abgewickelte Prognosen 4,538
Brier score 0.598

Unser Modell (Elo + Form): 0.617

Log-loss 1.001

Unser Modell (Elo + Form): 1.028

Kalibrierungsfehler 0.8pp

Unser Modell (Elo + Form): 0.4pp

Prognostizierte Wahrscheinlichkeit vs. beobachtete Häufigkeit

Jeder Punkt ist ein 10-Punkte-Wahrscheinlichkeitsband (mind. 30 Beobachtungen). Je näher an der Diagonalen, desto besser kalibriert. Jedes Spiel trägt zu seinen drei Ausgängen bei.

Sharp market (devigged) Unser Modell (Elo + Form) perfekte Kalibrierung
0% 0% 25% 25% 50% 50% 75% 75% 100% 100% Unser Modell (Elo + Form) · 0–10%: 7.5% → 7.1% (n=112) Unser Modell (Elo + Form) · 10–20%: 16.4% → 16.8% (n=1056) Unser Modell (Elo + Form) · 20–30%: 26% → 25.9% (n=6205) Unser Modell (Elo + Form) · 30–40%: 34.7% → 34.6% (n=2646) Unser Modell (Elo + Form) · 40–50%: 44.8% → 43.9% (n=2047) Unser Modell (Elo + Form) · 50–60%: 54.3% → 56% (n=1024) Unser Modell (Elo + Form) · 60–70%: 63.9% → 64.3% (n=381) Unser Modell (Elo + Form) · 70–80%: 74.1% → 75.2% (n=105) Unser Modell (Elo + Form) · 80–90%: 83% → 88.2% (n=34) Sharp market (devigged) · 0–10%: 7.4% → 5.6% (n=270) Sharp market (devigged) · 10–20%: 16.2% → 17.5% (n=1657) Sharp market (devigged) · 20–30%: 25.3% → 25.1% (n=5261) Sharp market (devigged) · 30–40%: 34.3% → 33.6% (n=2748) Sharp market (devigged) · 40–50%: 44.8% → 43.9% (n=1680) Sharp market (devigged) · 50–60%: 54.6% → 56.2% (n=1077) Sharp market (devigged) · 60–70%: 64.4% → 63.9% (n=598) Sharp market (devigged) · 70–80%: 74.6% → 79.2% (n=240) Sharp market (devigged) · 80–90%: 83.7% → 86.1% (n=72)
Band Sharp market (devigged) — Prognostiziert (Ø) Beobachtet Obs. Unser Modell (Elo + Form) — Prognostiziert (Ø) Beobachtet Obs.
0–10% 7.4% 5.6% 270 7.5% 7.1% 112
10–20% 16.2% 17.5% 1657 16.4% 16.8% 1056
20–30% 25.3% 25.1% 5261 26% 25.9% 6205
30–40% 34.3% 33.6% 2748 34.7% 34.6% 2646
40–50% 44.8% 43.9% 1680 44.8% 43.9% 2047
50–60% 54.6% 56.2% 1077 54.3% 56% 1024
60–70% 64.4% 63.9% 598 63.9% 64.3% 381
70–80% 74.6% 79.2% 240 74.1% 75.2% 105
80–90% 83.7% 86.1% 72 83% 88.2% 34

Niedriger Brier score und log-loss sind besser; der Kalibrierungsfehler ist die beobachtungsgewichtete durchschnittliche Abweichung zwischen prognostiziert und beobachtet. Die ehrliche Überschrift: Der devigged sharp market ist besser kalibriert als unser Modell — genau deshalb bepreist diese Seite alles gegen den Markt, statt dir Modellprognosen zu verkaufen. Methodik: Wahrscheinlichkeiten wie zum Zeitpunkt des Loggings angezeigt, kein Retro-Fitting; Ergebnisse aus offiziellen Resultaten.

Vollständige Methodik →
Nützlich? Sende es an einen Freund, der wettet.