Pick の記録は何が勝ったかを示す。Calibration は確率に意味があったかを示す。60%と言うとき、本当に60%起きるのか。以下では、清算済み予測を sharp market(デヴァギング済み)と自社モデルの2通りで採点し、不都合な比較もそのまま見せる。
自社モデル(Elo + form): 0.617
自社モデル(Elo + form): 1.028
自社モデル(Elo + form): 0.4pp
各点は10ポイント刻みの確率帯(最小30観測)。対角線に近いほど較正が良い。各試合は3つの結果すべてに寄与する。
| 帯 | Sharp market (devigged) — 予測(平均) | 実測 | 観測数 | 自社モデル(Elo + form) — 予測(平均) | 実測 | 観測数 |
|---|---|---|---|---|---|---|
| 0–10% | 7.4% | 5.6% | 270 | 7.5% | 7.1% | 112 |
| 10–20% | 16.2% | 17.5% | 1657 | 16.4% | 16.8% | 1056 |
| 20–30% | 25.3% | 25.1% | 5261 | 26% | 25.9% | 6205 |
| 30–40% | 34.3% | 33.6% | 2748 | 34.7% | 34.6% | 2646 |
| 40–50% | 44.8% | 43.9% | 1680 | 44.8% | 43.9% | 2047 |
| 50–60% | 54.6% | 56.2% | 1077 | 54.3% | 56% | 1024 |
| 60–70% | 64.4% | 63.9% | 598 | 63.9% | 64.3% | 381 |
| 70–80% | 74.6% | 79.2% | 240 | 74.1% | 75.2% | 105 |
| 80–90% | 83.7% | 86.1% | 72 | 83% | 88.2% | 34 |
Brier score と log-loss は低いほど良い。Calibration error は、予測と実測の差の観測加重平均。率直に言えば、デヴァギング済み sharp market の方が自社モデルより較正が良い。だからこそ、このサイトはモデル予測を売るのではなく、市場に対してすべてを価格付けする。手法: ログ時点の表示どおりの確率を使用し、後付けの再調整なし。結果は公式結果から取得。
手法全文 →