施策の効果検証の王道、A/Bテスト。設計を間違えると結論が信頼できなくなります。
新しいバナーデザインの効果を測りたいんだけど、どう設計すればいい?
それはA/Bテストの出番。
ユーザーをランダムに2群(A群: 既存・B群: 新規)に分けて、結果の差を統計的に比較するの。
重要なのは(1)ランダム割付、(2)十分なサンプルサイズ、(3)同時期に行う、の3点。
これが守られないと結論が歪むわ。
ランダムに分けないとどうなるんですかぁ?
例えば男性にだけ新しいバナーを見せていたら、効果差が『バナー』ではなく『男女差』を測ってしまうわ。
これを交絡と呼ぶの。
なるほど、変数が混ざっちゃうんだね。
そしてサンプルサイズ。
少なすぎると差が偶然なのか本物なのか判別できないし、多すぎると微小な差まで有意になってしまう。
検出力と有意水準から計算するのが定石よ。
わぁ、A/Bテストって統計検定とつながってるんですねぇ♪
そう。
さらに『同時期に』も大事。
A群を1月、B群を2月に分けると、季節要因や曜日要因が入って交絡するの。
じゃあ朝にA、夜にBもダメだね。
同じ時刻・同じ条件で、ってことか。
その通り。
最後に、A/Bテストの目的指標(KPI)を事前に決めることも重要。
後から指標を選ぶとp値ハッキングの温床になるわ。
DS検定では、A/Bテストの設計上の問題点を指摘する設問が出るので、(1)ランダム割付・(2)サンプルサイズ・(3)同時期・(4)指標事前決定 の4点をチェックリストにしておくのがおすすめよ。
覚えますぅ♪
確認クイズ
A/Bテストで最も避けるべき設計はどれか。
- ユーザーIDの末尾偶数/奇数で群を分ける
- A群は1月にテスト、B群は2月にテストする
- 同時期に同じトラフィックの中でランダム割付する
- 事前に必要サンプルサイズを統計的に算出する
こたえを見る
正解: 2. A群は1月にテスト、B群は2月にテストする
A群は1月にテスト、B群は2月にテストするのは時期による交絡が発生し、効果差を正しく測れません。A/Bテストでは同時期にランダム割付するのが鉄則です。