広告A/Bテストの判断基準|偶然のブレに振り回されない見方とやめどき
広告やLPのA/Bテストで、偶然のブレを実力差と見誤らないための判断基準を解説します。サンプルが少ないときの考え方、テスト期間と曜日変動、同時に複数を変えない理由、やめどきの決め方を、統計用語を噛み砕いて整理します。
コインを10回投げて、表が7回出たとします。このコインは表が出やすい、と結論づける人はいないはずです。ところが広告のテストになると、「Aは10件、Bは7件だからAの勝ち」という判断が、ごく普通に行われています。
A/Bテストでいちばん難しいのは、設定ではなく判定です。差が出たように見える数字のうち、どこまでが実力で、どこからが偶然なのか。この記事では、難しい数式を使わずに、現場で判断を誤らないための考え方を説明します。
偶然のブレに振り回されない
まったく同じ広告を2本並べて配信しても、結果はぴったり同じにはなりません。どのユーザーにいつ表示されたかという巡り合わせで、数字は上下します。これが偶然のブレです。テストの判定とは、「観測された差が、このブレの範囲を超えているか」を見極める作業だと言えます。
よく使われる統計の言葉を、噛み砕いておきます。
- 有意差: 「本当は差がないのに、偶然だけでこれほどの差が出ることはめったにない」と言える状態のことです。差が大きいという意味ではありません。
- 信頼区間: 本当の実力がありそうな範囲のことです。コンバージョン率を一つの点ではなく、幅で捉えます。
- サンプルサイズ: 判定に使えるデータの量です。広告のテストでは、表示回数やクリック数よりも、コンバージョンの件数が効いてきます。
現場で持っておきたい感覚は、信頼区間の考え方です。データが少ないうちは幅が広く、AとBの幅が大きく重なっています。重なっている間は、順位が入れ替わっても不思議ではありません。データが増えると幅は狭まり、重なりがなくなってくると、ようやく差があると言えるようになります。
もう一つの落とし穴が、途中経過を何度も見て、差が付いた瞬間に止めてしまうことです。ブレは上にも下にも振れるので、見る回数が多いほど、たまたま差が開いた瞬間に出会いやすくなります。そこで止めると、偶然を勝ちとして拾ってしまいます。
サンプルが少ないときの考え方
必要なデータ量は、「何件あれば十分」と一律には決まりません。元のコンバージョン率がどのくらいか、どの程度の差を見つけたいのか、判断を誤ったときの損失をどこまで許容するかによって変わるからです。原則は一つで、見つけたい差が小さいほど、必要なデータは急激に増えるということです。自社の条件での目安は、公開されているサンプルサイズの計算ツールに数値を入れて確認するのが近道です。
とはいえ、予算が限られたアカウントでは十分な件数が集まらないことも多いものです。その場合は次のように考えます。
- 大きな差が出そうなテストを選ぶ: ボタンの色や語尾の違いではなく、訴求の軸、ターゲット、オファーなど、結果が大きく変わりうる要素を試します。小さな差は、少ないデータでは検出できません。
- 手前の指標も参考にする: クリック率やフォーム到達率は、コンバージョンよりも早くデータが集まります。ただし、クリック率が高い広告が成約も多いとは限らないため、最終成果の傾向と矛盾していないかを合わせて見ます。
- 「分からない」を結論として認める: 差が確認できなかったなら、それも結果です。無理に勝者を決めず、既存案を継続する、あるいは制作や運用の手間が少ないほうを選ぶ、という判断で構いません。
- 判断の重さで基準を変える: いつでも元に戻せるクリエイティブの入れ替えなら、やや緩い基準で進めても損失は限定的です。サイト全体の改修のように戻しにくい判断ほど、慎重に確かめます。
FIG.サンプルが少ないときの4つの考え方
- 大きな差が出そうなテストを選ぶ
- 手前の指標も参考にする
- 「分からない」を結論として認める
- 判断の重さで基準を変える
テスト期間と曜日変動
多くの商材で、ユーザーの行動は曜日によって変わります。企業向けの商材は平日に、個人向けの商材は週末や夜に動きやすい、といった傾向です。
このため、テスト期間は1週間を単位にして、できれば複数週取ります。数日で件数が集まったとしても、月曜から水曜だけのデータでは、週末のユーザーにどう効くかが分かりません。
比べ方にも注意が必要です。「先週はA、今週はB」という前後の比較は、時期の違いがそのまま結果に混ざるため、テストとは呼べません。同じ期間に並行して配信し、条件をそろえます。
また、配信を始めた直後は媒体の機械学習が安定せず、成績が揺れやすくなります。媒体のテスト用機能を使うと配信を均等に分けやすくなりますが、仕様は変わるため公式ヘルプで確認してください。
同時に複数を変えない
画像も見出しもリンク先も変えたB案が勝ったとします。この結果から学べることは、ほとんどありません。何が効いたのかが分からず、次のテストに知見を持ち越せないからです。
基本は、1回のテストで変える要素を1つに絞ることです。ただし、これは細かい部分だけを変えるという意味ではありません。「価格の安さを訴える案」と「手間のなさを訴える案」のように、訴求の軸を丸ごと比べるテストは、コンセプトを1つの変数として扱っていると考えれば成り立ちます。その後、勝った軸の中で要素を絞って試していきます。
見落としやすいのが、テストの外側の変更です。テスト期間中に予算や入札の設定、ターゲティングを変えたり、ランディングページを修正したりすると、結果が何によるものか判別できなくなります。期間中は、テスト対象以外を動かさないのが原則です。
やめどきを先に決める
結果を見てからやめどきを考えると、人は自分の期待に合う時点で止めたくなります。そこで、テストを始める前に次の項目を書き出しておきます。
- 仮説を1文で書きます。何を変えると、どの数字が、なぜ良くなると考えるのかを明確にします。
- 勝敗を判定する指標を1つに決めます。後から都合の良い指標に乗り換えないためです。
- 最短の期間と、目安にするデータ量を決めます。
- 最長の期間を決めます。そこまで続けても差が見えなければ、「差は小さい」と結論づけて終了します。
- 途中で打ち切る条件を決めます。片方の成績が極端に悪く、損失が許容できない水準になった場合などです。
- 結果が出たら、勝敗だけでなく「何が分かったか」を記録し、次のテストの仮説につなげます。
勝った案を本採用した後も、しばらくは数字を追います。テスト中は良かったのに、全体に広げたら差が消えた、ということは起こります。差が続いて初めて、その勝ちは本物だったと言えます。
まとめ
A/Bテストの判定は、観測された差が偶然のブレを超えているかを見る作業です。数字を点ではなく幅で捉え、幅が重なっているうちは結論を急がないでください。
必要なデータ量は条件によって変わるため、少ないデータしか集まらない場合は、大きな差が出そうな要素を試す、手前の指標を併用する、分からないという結論を認める、といった対応を取ります。期間は週単位で取り、変える要素は1つに絞り、やめどきは始める前に決めておきます。
この記事へのリンクと、出典を明記した引用は自由です。連絡も不要です。くわしくは引用・転載についてをご覧ください。