非復元ランダムサンプリングにおける公平性
Abstract
利益配分や機会の割り当て手段において公平性 (fairness) を保証する設計は必須の要件である。これは分散システムでの役割分担や負荷分散でも同様に考慮しなければならない。現実世界の抽選をモデルとしたスキームはランダムな事象を用いて公平性を実装している一方で、重み付きの非復元ランダムサンプリング (weighted random sampling without replacement; WRSwoR) においては既に選択された対象が候補から除外されるという特性によって公平さが欠落している。
この文書では重み付き非復元ランダムサンプリングにおける公平さ欠如を機会損失のモデルで説明し、WRSwoR に公平性をもたらす調整パラメータを算出する方法を示す。
Table of Contents
Introduction
復元サンプリングと非復元サンプリング
ある
において選択した要素を再び壺に戻して (状態を復元して) 次の抽選を行う方法と同等であるため復元サンプリング (random sampling with replacement) と呼ばれている。
復元サンプリングでは要素が選択された後も母集団
しかし現実問題としては物理的な制約を理由に標本集合
このような状況では既に選択された要素を母集団
非復元サンプリングにおける選択の非独立性は、すべての要素が同じ確率で選択されるケースでは問題視されないが、それぞれの要素に選択の優先度となる重みや優先度を設定されている場合に、要素の選択頻度がその重みと一致しないという形で顕在化する。
問題のシミュレーション
重み付き非復元サンプリングではどのような問題が起きるのかを先にシミュレーションで見てみよう。以下のデモは各要素の重みの分布と、重み付き非復元ランダムサンプリングを繰り返し行ったときの実際の選択頻度を比較している。
Inverse (逆数) の重み分布に対して ×1,000 を実行してみれば明らかなように、それぞれの要素の選択頻度の分布 (Actual Win Rate) は重みの分布とはかけ離れた挙動となる。唯一一致する分布は Flat だけだが、これはすべての要素の重みが等価であることから一様ランダムサンプリングと同じ意味である。つまり、この重みと選択頻度の分布が一致しない現象は重み付き非復元ランダムサンプリング固有の特徴と言える。
このシミュレーションでは累積和法 (cumulative sum) のケースに対してのみ、この文書で示している補正を行った Corrected Win Rate の曲線を追加している。
機会損失モデル
重み付き非復元サンプリングにおいてなぜこのような現象が起きるのかを考えてみよう。元となる母集団の重みの総和を
これが重み付きとなるとより重みの大きい要素は早期の抽選で選択されやすい傾向が加わる。したがって、直感的には、より大きな重みを持つ要素は実際の重みよりも低い頻度で、より小さな重みを持つ要素は実際の重みよりも高い頻度で選択される傾向となって現れる。実際に前述のシミュレーションではそのような傾向が見て取れる。
以降はこの現象に関する文献や研究が見つからなかったため作成した自論のモデルです。もし先行研究に心当たりがあればコメントに残しておいてもらえるとありがたいです。
この現象は機会損失を使って説明することができる。機会損失と期待値の理解を助けるためにいくつかの例を見てみよう。
例 1 . 20 人に一人の確率で 10,000 円が当たるスクラッチくじが 550 円で売っていた。あなたはこのスクラッチくじを買うべきだろうか?
スクラッチくじを 1 回引いたときの報酬の期待値は
例 2 . あなたは 20 人に一人の確率で 10,000 円が当たるスクラッチくじを所有している。しかし、いざ削ってみると印刷ミスで結果が記載されておらず抽選は無効となってしまった。あなたが受けた損失はいくらだろうか?
このスクラッチくじの抽選に参加すること自体に 500 円の価値があることは例 1 で述べた。したがって、権利があるにも拘らず何らかの理由で抽選に参加できなかったことは 500 円分の機会損失に相当する。これは券を紛失した場合や削らないまま有効期限を過ぎてしまった場合でも同様の損失額である。
印刷ミスはくじ運営者側の不備であるため一般的にこのようなケースでは返金処理になるだろう。通念としてはスクラッチくじの購入額 (例1で言えば 550 円) を返金することになるが、もし「他の購入者との機会の公平さ」を重視するのであれば期待値である 500 円が妥当な金額である。例えば「株主優待で 250 円で手に入れた報酬期待値 500 円のくじ」の不備で 250 円を返金することは、他の 250 円で手に入れた株主と比べて優待の権利を得られていないことになる。
例 3 . あなたは 20 人の部署に属している。会社の忘年会で部署ごとに一名 10,000 円が当たるゲームを開催することとなった。しかし、あなたの部署では年末進行の業務が残っており、これを担当する一名は必然的にゲームに参加することができない。この年末業務の担当者が被る損失はいくらだろうか?
これも前の例と同様に 500 円となるだろうか? 答えはノーである。
このケースでは「20 人の部署」という母集団の前提があることに注意しなければならない。担当者一名が参加できなくなることで母集団のサイズは 19 人となり、ゲームの報酬期待値は
会社は同一部署内でのこの不公平さを正すために、年末業務の担当者には機会損失分の 526 円を補填するべきであろう。
期待値による公平性の導入
非復元ランダムサンプリングについて注意深く考えると「選択された要素がそれ以降の抽選に参加することができない」という暗黙の機会損失を前提としていることに気づくだろう。これを Fig 1 の例としてサイズ 7 の母集団から 3 つの要素を選択する課程で説明しよう。
一回目の抽選は 7 個の母集団から要素
二回目の抽選は
- 一回目の抽選で選択された要素
は二回目の抽選に参加できておらず、抽選に参加できた他の要素と比較して機会損失を被っている。 - 抽選は母集団から
が除外された状態で行われたことから、母集団全体の重みが に減少し、それに伴い各要素の選択期待値が一回目より上昇している。
結果的に、一回目の抽選で選択された
三回目の抽選は
この例により早期に選択された要素は抽選が進むにつれて機会損失が加算されてゆくことが分かるだろう。ここで紹介する方法は、選択済みの要素が被った機会損失分を期待値に換算し加算することによって公平化するという考え方に基づいている。
機会損失モデルにおける公平性の定式化
ここで
選択された要素は
実際の選択回数 1 に加算される、残り抽選での選択回数期待値の項を補正項
この選択回数期待値
選択回数期待値
重みのない一様ランダムサンプリングでもこのような機会損失による偏りは発生している。ただし、選択されやすさに偏りがないことから、どの要素も一様に先にも後にも選択され、繰り返し実行することで均等に機会損失が累積されて現象として現れていなように見えるだけである。
この方法は当選頻度そのものには偏りを持ったままであることに注意。この偏りを報酬 (または責務、作業負荷、発言力、プライオリティとも表現できる) によって公平となるように補正する方法である。
