Polymarketの予測誤差はいつ縮小するのか――市場終了前30日間のBrier損失を追う
著者:安東 星琉(京都大学大学院経済学研究科)
JEL分類: G14、D83、C53、C58
キーワード: 予測市場、Polymarket、Brier損失、予測誤差、Murphy分解、Brier Skill Score
研究の問い
予測市場の価格が最終的にどれだけ正しかったかを見ても、いつ予測が改善したのかまでは分かりません。市場終了の何週間も前から精度が高まっていたのか、それとも終了間際に大きく改善したのか。本研究では、Polymarketの市場価格を終了30日前から12時間前まで同じ条件で追い、この点を検証しました。
予測誤差の指標にはBrier損失を使います。最終結果を0または1、市場価格を発生確率とみなし、その差を二乗した値です。値が小さいほど、価格は実際の結果に近い予測だったといえます。ただし、Brier損失から直接分かるのは予測の正確さです。世の中の不確実性がどれだけ減ったか、新しい情報がどれだけ届いたかを測る指標ではありません。
データと分析方法
対象期間は2020年10月25日から2026年7月3日までです。候補となる548,839市場(87,691イベント)を、分野、終了時期、取引量・流動性、上場期間、イベント構造によって468層に分け、そこから30,000市場を無作為に抽出しました。
時間の基準には、Gamma APIのclosedTimeを使いました。これは市場が取引を終えた時刻を表します。その30日前、14日前、7日前、3日前、1日前、12時間前を観測時点とし、各時点より前に記録された直近のYesトークン価格を取得しました。12時間より古い価格は使わず、欠けた価格の補間もしていません。最終結果はCLOBの公式勝者情報に基づいています。
一つのイベントに多くの関連市場があると、そのイベントだけで平均値が左右されかねません。そこで、まずイベントごとに市場の値を平均し、そのうえで各イベントを同じ重さで集計しました。信頼区間もイベント単位のクラスタ・ブートストラップで求めています。
| 標本選定の段階 | 市場 | イベント |
|---|---|---|
| 候補母集団 | 548,839 | 87,691 |
| 層化無作為標本 | 30,000 | 21,349 |
| 終了30日前の観測対象 | 1,912 | 1,432 |
| 6時点すべてで価格を確認できた市場 | 1,818 | 1,393 |
主分析では、この1,818市場をすべての時点で追いました。観測時点ごとに市場の顔ぶれが変わり、それだけで平均値が動いてしまうのを避けるためです。
主な結果
平均Brier損失は、市場終了30日前の0.088253から12時間前の0.034962まで下がりました。低下幅は0.053291(95%信頼区間:0.045783〜0.061038)です。30日前と比べると、予測誤差は60.384%縮小しています(95%信頼区間:54.248%〜66.110%)。
| 市場終了までの時間 | 平均Brier損失 | 95%信頼区間 |
|---|---|---|
| 30日 | 0.088253 | 0.080205〜0.096359 |
| 14日 | 0.064492 | 0.057513〜0.071742 |
| 7日 | 0.054552 | 0.047597〜0.061720 |
| 3日 | 0.044141 | 0.037857〜0.050781 |
| 1日 | 0.036863 | 0.031391〜0.042677 |
| 12時間 | 0.034962 | 0.029473〜0.040768 |
予測誤差の縮小は後半ほど速いのか
観測時点の間隔はそろっていないため、区間ごとの低下幅をそのまま比べることはできません。そこで探索的な分析として、30日前から14日前までの16日間と、14日前から12時間前までの13.5日間に分け、Brier損失が1日当たりどれだけ下がったかを比べました。
1日当たりの低下は、前半が0.001485、後半が0.002187でした。両者の差は0.000702(95%信頼区間:0.000138〜0.001275)です。
ただし、これはあくまで探索的な比較です。14日前という区切りは分析後に設定しており、境界の選び方や多重比較の影響は信頼区間に反映されていません。また、五つの隣接区間を個別に見ると、改善幅は一方向に増えているわけではなく、1日前から12時間前までの低下は統計的にゼロと区別できません。したがって、「市場終了に近づくほど改善が加速する」とまではいえません。
誤差の何が改善したのか
Murphy分解を用いると、Brier損失の変化をいくつかの要素に分けて確認できます。今回は同じ市場を追っているため、結果の構成から決まる不確実性項は、すべての時点で0.139128です。一方、予測確率の違いが実際の結果の違いにどれだけ結びついているかを示す「分解能(resolution)」は、30日前の0.058806から12時間前の0.107274まで上昇しました。Brier損失の改善は、主にこの分解能の上昇によるものです。
同じ市場の単純なベースレート予測と比べたBrier Skill Scoreも、30日前の0.365671から12時間前の0.748707まで上昇しました。つまり、12時間前のBrier損失はベースレート予測より約74.9%小さくなっています。ただし、分解能もBrier Skill Scoreも、あくまで予測精度を説明する指標です。市場が得た情報の量や、不確実性そのものが解消した速さを表すわけではありません。
集計方法を変えても結果は変わるか
30日前から12時間前までのBrier損失の縮小率は、イベントを同じ重さで集計すると60.384%、市場を同じ重さで集計すると61.214%でした。抽出確率を補正した場合は61.190%、価格を観測できる確率を補正した場合は59.809%、両方を補正した場合は60.640%です。集計方法を変えても、結果はおおむね60%前後に収まりました。
APIから取得した価格については、公開されている個別の約定価格との照合も行いました。対象は91市場です。両者から計算したBrier損失の平均差は統計的にゼロと区別できませんでしたが、対応する価格の記録時刻には中央値で95.1分のずれがありました。標本も小さく、Polymarket全体を代表するものではありません。この照合だけで、API価格と約定価格が同じだとは判断できません。
結果を読む際の注意点
第一に、本研究はPolymarketのAPIが返す価格履歴を使っています。fidelityで指定した時間幅のなかで価格がどのように集計されるかは、公開仕様だけでは確定できません。したがって、この価格は過去の最終約定価格、売り気配と買い気配の中間値、注文板が示す合意価格のいずれかを直接表すものではありません。
第二に、GammaのclosedTimeは取引上の終了時刻であり、結果が判明した時刻や決済が完了した時刻とは限りません。さらに、分析対象は30日前から上場され、六つの観測時点すべてで価格を取得できた比較的長期の市場に限られます。短期市場を含むPolymarket全体の平均として読むことはできません。信頼区間も、最初に抽出した30,000市場を所与として計算しており、第一段階の標本抽出による不確実性は含んでいません。
この研究の意味
予測市場の精度は、単一の数字だけでは評価できません。どの時刻を基準にするか、同じ市場を継続して追うか、イベントと市場のどちらを均等に扱うか、何時間前までの価格を許容するかによって推計値は変わります。
本研究は、Polymarketがほかの予測手法より優れている、あるいは劣っていると結論づけるものではありません。予測市場の精度が時間とともにどう変わるかを検証するには、どの条件をそろえ、何を明示しなければならないか。その測定手順を具体的に示した点に意義があります。
論文情報
The Temporal Structure of Forecast Error on Polymarket: A Decomposition of Brier Loss over the 30 Days before Operational Market Closure
- SSRN掲載日:2026年7月24日
- 最終改訂日:2026年8月15日
関連書籍
本研究の問題意識を、予測だけでなくヘッジや市場設計まで広げて解説する書籍『予測市場 未来を知り、未来に備える』を執筆しています。
