方法,已测量

模型校准实验室

选单记录告诉你什么赢了。校准则告诉你概率是否真有意义:当我们说 60% 时,是否真的有 60% 的发生率?下面对每个已结算预测都用两种方式评分——sharp 市场(去水)和我们自己的模型——不舒服的对比一目了然。

已结算预测 4,538
Brier score 0.598

我们的模型(Elo + 状态): 0.617

Log-loss 1.001

我们的模型(Elo + 状态): 1.028

校准误差 0.8pp

我们的模型(Elo + 状态): 0.4pp

预测概率 vs 实际频率

每个点代表一个 10 个百分点的概率区间(至少 30 个样本)。越接近对角线,校准越好。每场比赛都会贡献其三个结果。

Sharp 市场(去水) 我们的模型(Elo + 状态) 完美校准
0% 0% 25% 25% 50% 50% 75% 75% 100% 100% 我们的模型(Elo + 状态) · 0–10%: 7.5% → 7.1% (n=112) 我们的模型(Elo + 状态) · 10–20%: 16.4% → 16.8% (n=1056) 我们的模型(Elo + 状态) · 20–30%: 26% → 25.9% (n=6205) 我们的模型(Elo + 状态) · 30–40%: 34.7% → 34.6% (n=2646) 我们的模型(Elo + 状态) · 40–50%: 44.8% → 43.9% (n=2047) 我们的模型(Elo + 状态) · 50–60%: 54.3% → 56% (n=1024) 我们的模型(Elo + 状态) · 60–70%: 63.9% → 64.3% (n=381) 我们的模型(Elo + 状态) · 70–80%: 74.1% → 75.2% (n=105) 我们的模型(Elo + 状态) · 80–90%: 83% → 88.2% (n=34) Sharp 市场(去水) · 0–10%: 7.4% → 5.6% (n=270) Sharp 市场(去水) · 10–20%: 16.2% → 17.5% (n=1657) Sharp 市场(去水) · 20–30%: 25.3% → 25.1% (n=5261) Sharp 市场(去水) · 30–40%: 34.3% → 33.6% (n=2748) Sharp 市场(去水) · 40–50%: 44.8% → 43.9% (n=1680) Sharp 市场(去水) · 50–60%: 54.6% → 56.2% (n=1077) Sharp 市场(去水) · 60–70%: 64.4% → 63.9% (n=598) Sharp 市场(去水) · 70–80%: 74.6% → 79.2% (n=240) Sharp 市场(去水) · 80–90%: 83.7% → 86.1% (n=72)
区间 Sharp 市场(去水) — 预测(平均) 实际 观测数 我们的模型(Elo + 状态) — 预测(平均) 实际 观测数
0–10% 7.4% 5.6% 270 7.5% 7.1% 112
10–20% 16.2% 17.5% 1657 16.4% 16.8% 1056
20–30% 25.3% 25.1% 5261 26% 25.9% 6205
30–40% 34.3% 33.6% 2748 34.7% 34.6% 2646
40–50% 44.8% 43.9% 1680 44.8% 43.9% 2047
50–60% 54.6% 56.2% 1077 54.3% 56% 1024
60–70% 64.4% 63.9% 598 63.9% 64.3% 381
70–80% 74.6% 79.2% 240 74.1% 75.2% 105
80–90% 83.7% 86.1% 72 83% 88.2% 34

Brier 和 log-loss 越低越好;校准误差是按观测加权的预测与实际之间的平均差距。诚实的结论是:去水 sharp 市场的校准优于我们的模型——这正是本网站按市场定价、而不是向你出售模型预测的原因。方法:以记录时显示的概率为准,不做事后重拟合;结果来自官方赛果。

完整方法 →
有用吗?发给会下注的朋友。