Methodology, measured

Model Calibration Lab

Rejestr typów mówi, co wygrało. Kalibracja mówi, czy prawdopodobieństwa coś znaczyły: gdy mówimy 60%, czy dzieje się to w 60% przypadków? Poniżej każda rozliczona prognoza, oceniona na dwa sposoby — sharp market (odvigowany) i nasz model — z niewygodnym porównaniem na wierzchu.

Settled predictions 4,538
Brier score 0.598

Our model (Elo + form): 0.617

Log-loss 1.001

Our model (Elo + form): 1.028

Calibration error 0.8pp

Our model (Elo + form): 0.4pp

Predicted probability vs observed frequency

Każdy punkt to 10-punktowy przedział prawdopodobieństwa (min. 30 obserwacji). Im bliżej przekątnej, tym lepsza kalibracja. Każdy mecz wnosi swoje trzy wyniki.

Sharp market (devigged) Our model (Elo + form) perfect calibration
0% 0% 25% 25% 50% 50% 75% 75% 100% 100% Our model (Elo + form) · 0–10%: 7.5% → 7.1% (n=112) Our model (Elo + form) · 10–20%: 16.4% → 16.8% (n=1056) Our model (Elo + form) · 20–30%: 26% → 25.9% (n=6205) Our model (Elo + form) · 30–40%: 34.7% → 34.6% (n=2646) Our model (Elo + form) · 40–50%: 44.8% → 43.9% (n=2047) Our model (Elo + form) · 50–60%: 54.3% → 56% (n=1024) Our model (Elo + form) · 60–70%: 63.9% → 64.3% (n=381) Our model (Elo + form) · 70–80%: 74.1% → 75.2% (n=105) Our model (Elo + form) · 80–90%: 83% → 88.2% (n=34) Sharp market (devigged) · 0–10%: 7.4% → 5.6% (n=270) Sharp market (devigged) · 10–20%: 16.2% → 17.5% (n=1657) Sharp market (devigged) · 20–30%: 25.3% → 25.1% (n=5261) Sharp market (devigged) · 30–40%: 34.3% → 33.6% (n=2748) Sharp market (devigged) · 40–50%: 44.8% → 43.9% (n=1680) Sharp market (devigged) · 50–60%: 54.6% → 56.2% (n=1077) Sharp market (devigged) · 60–70%: 64.4% → 63.9% (n=598) Sharp market (devigged) · 70–80%: 74.6% → 79.2% (n=240) Sharp market (devigged) · 80–90%: 83.7% → 86.1% (n=72)
Band Sharp market (devigged) — Predicted (avg) Observed Obs. Our model (Elo + form) — Predicted (avg) Observed Obs.
0–10% 7.4% 5.6% 270 7.5% 7.1% 112
10–20% 16.2% 17.5% 1657 16.4% 16.8% 1056
20–30% 25.3% 25.1% 5261 26% 25.9% 6205
30–40% 34.3% 33.6% 2748 34.7% 34.6% 2646
40–50% 44.8% 43.9% 1680 44.8% 43.9% 2047
50–60% 54.6% 56.2% 1077 54.3% 56% 1024
60–70% 64.4% 63.9% 598 63.9% 64.3% 381
70–80% 74.6% 79.2% 240 74.1% 75.2% 105
80–90% 83.7% 86.1% 72 83% 88.2% 34

Niższy Brier score i log-loss są lepsze; calibration error to ważona liczbą obserwacji średnia różnica między prognozą a wynikiem. Uczciwy wniosek: odvigowany sharp market jest lepiej skalibrowany niż nasz model — i właśnie dlatego ta strona wycenia wszystko względem rynku zamiast sprzedawać Ci prognozy modelu. Metodologia: prawdopodobieństwa według stanu z czasu logowania, bez retro-fittingu; wyniki z oficjalnych rezultatów.

Full methodology →
Przydatne? Wyślij to znajomemu, który obstawia.