「ABテストで有意差+8%を叩き出した施策を100%ロールアウトしたのに、翌月の事業全体の売上が前月比マイナスになった」
もしあなたがマーケットプレイス、マッチングアプリ、SNS、あるいはオンデマンドデリバリーなどのプラットフォームビジネスに携わっているなら、一度はこの怪奇現象に頭を抱えたことがあるはずです。PdMは「テスト結果はp値0.01未満で有意だった。ダッシュボードの数字に嘘はない」と主張し、マーケは「季節性の要因ではないか」と言い訳を探し、経営陣は「あのABテストは何だったんだ」と詰め寄る。
データが改ざんされたわけでも、集計ミスがあったわけでもありません。原因はもっと根本的なところにあります。「局所のABテストが勝った」のではなく、「テスト群が対照群のパイを強奪していただけ」だったのです。
統計学と計量経済学において、この現象はSUTVA(Stable Unit Treatment Value Assumption:安定的単位処理値の仮定)の破綻と呼ばれます。
架空の事例:フードデリバリー「クイックイーツ」の悲劇
ある都市型フードデリバリーアプリ「クイックイーツ」の事例で考えてみましょう。ある日、グロースチームのPdMが画期的な施策を思いつきました。
「注文確度の高いユーザーに、30分限定の『配達料無料クーポン』を配れば注文件数が伸びるのではないか?」
ユーザーの50%をランダムに「介入群(クーポンあり)」、残り50%を「対照群(クーポンなし)」に割り振り、2週間のABテストを実施しました。結果は目覚ましいものでした。
介入群(クーポンあり): 注文率 15%
対照群(クーポンなし): 注文率 7%
リフト値: +8pt(統計的に極めて有意)
「大成功だ!」と歓喜したチームは、翌週から全ユーザーに向けてこのクーポン施策を恒常的にロールアウトしました。
しかし、翌月に待っていたのは悪夢のような数字でした。全社適用後の注文率は、目標だった15%に届くどころか、施策前のベースライン(10%)を割り込んで9%へと悪化。売上は伸びず、配ったクーポンのコストだけが重くのしかかり、ユニットエコノミクスが急激に悪化したのです。
なぜ、美しいABテストの結果が、全体に広げた瞬間に蒸発してしまったのでしょうか?
犯人は「奪われた配達員」:干渉効果のメカニズム
この失敗の裏で起きていたのは、物理的なリソース(配達員)の共食いです。都市内の稼働配達員数には上限があります。テスト期間中、クーポンをもらった「介入群」のユーザーは、猛烈に注文を入れました。その結果、何が起きたか。街中の配達員が介入群の注文に総動員され、「対照群(クーポンなし)」のユーザーがアプリを開いたときには、画面に「現在、近くに配達員がいません(お届けまで60分以上)」というバナーが表示されていたのです。対照群のユーザーは、クーポンがなかったから注文しなかったわけではありません。「注文したかったのに、配達員を介入群に奪われて注文できなかった」のです。介入群は、施策の効果で伸びたのではない。対照群の注文機会を物理的に奪って伸びた。
対照群の注文率が7%へ落ち込んだのは、施策がない通常状態(ベースライン10%)ではなく、配達員不足という「トバッチリ(負の外部性)」を食らった結果だった。テスト結果の「+8%ptの差」の正体は、純粋な需要喚起(成長)ではなく、「介入群のゲイン」と「対照群への嫌がらせ被害」の合算だったのです。この施策を全ユーザーに開放した瞬間、何が起きるかは自明です。
全員が一斉に注文しようとしても、配達員の総数は1人も増えていません。街中でマッチングの目詰まりと配達遅延が多発し、注文キャンセルが激増。結果として、アプリ全体の注文率がベースラインを割って崩壊しました。SUTVAという「Web業界が最も忘れがちな前提」多くのウェブ施策(SaaSのLP改善や、メディアのクリック率改善)では、次のような暗黙の前提が成り立っています。「ユーザーAに施策を打った影響は、ユーザーBの行動に何ら影響を与えない」これが因果推論の根幹にあるSUTVA(安定的単位処理値の仮定)です。
あなたがSaaSの料金ページで「緑のボタン」を見ようが「青いボタン」を見ようが、別の会社の見込み顧客が問い合わせを諦める理由にはなりません。この世界では、SUTVAは概ね成立し、通常のABテストが綺麗に機能します。しかし、以下の要素が1つでも絡む事業では、SUTVAは初手で粉々に砕け散ります。
・有限なリソースの奪い合い(ECの在庫、デリバリーの配達員、ホテルの空室、Uberのドライバー)
・双方向のマッチング(マッチングアプリの異性、フリマの出品物、求人媒体の応募枠)
・ソーシャル・ネットワーク効果(SNSのタイムライン、招待キャンペーン、ゲームの協力プレイ)
マッチングアプリで一部の男性会員を「検索上位にブースト」すれば、テスト群のいいね数は跳ね上がりますが、それは対照群の男性が画面外へ押し出されただけです。フリマアプリで一部の出品者の露出を増やせば、限定1個の中古スニーカーはテスト群の客に買われ、対照群の客は「売り切れ」に直面します。
「ネットワークや需給が繋がっている空間で、個々のユーザーをサイコロ振って分けるABテスト」は、構造的に嘘の結果を吐き出すようにできているのです。
処方箋:外部性を織り込んだ実験プロトコル
では、プラットフォームビジネスにおいて、私たちはどうやって施策の「真の因果効果」を測ればよいのでしょうか。現場で使える3つのアプローチを紹介します。
1. クラスター無作為化(地域や市場で切る)
ユーザー単位で分けるのをやめ、「干渉が起きない単位(クラスター)」で実験を設計します。例:デリバリーや配車アプリなら、「渋谷・新宿エリア(介入群)」と「池袋・上野エリア(対照群)」に地域ごと分ける。
渋谷のユーザーがクーポンを使っても、池袋の配達員が渋谷に吸い寄せられることは(距離的に)ありません。空間的な独立性を確保することで、SUTVA違反を回避します。
2. スイッチバック実験(時間軸で切る)
地域を分けられない(流動性が高すぎる)場合、「時間帯」で介入をオン・オフします。例:「月曜の11:00〜13:00は都市全体でクーポンON」「火曜の11:00〜13:00はクーポンOFF」といったように、1〜2時間単位のブロックをランダムに切り替える。
時間軸で市場全体に一括適用するため、同じ瞬間における「ユーザー同士の奪い合い」は発生しません。時系列の自己相関や持ち越し効果(前の時間の注文が残る問題)を統計的にコントロールしながら、全体の総量を計測します。
3. 2段階無作為化(干渉効果そのものを定量化する)
「他者へのスピルオーバー(波及効果)がどれくらいあるか」をあえて測りに行く設計です。まず市場(クラスター)全体を「高介入エリア(例:ユーザーの80%に配布)」と「低介入エリア(例:ユーザーの20%に配布)」に分ける。それぞれのエリア内で、さらにランダムに配布・非配布を決める。「低介入エリアの非配布者」と「高介入エリアの非配布者」の差を見ることで、「周りが施策を受けたせいで、どれだけ割を食ったか(干渉の大きさ)」を直接推定します。
プラットフォームのアナリティクスは「物理学」である
ウェブサイトのボタンの色を変えるABテストは「生化学の試験管実験」のようなものです。互いに干渉しない分子の反応を見ていればよかった。しかし、プラットフォームやマーケットプレイスのデータ分析は「生態系や物理学のシミュレーション」です。一箇所の重力を歪めれば、必ず別の場所に歪みが波及し、全体の生態系バランスが変化します。「局所で勝ったのに、全体で負ける」この違和感に気づかず、単純なp値やダッシュボードの勝敗表だけを信じて突き進む組織は、無駄な機能追加と無意味なクーポンで自らのエコシステムをすり潰していきます。
必要なのは、ツールの使い方を知っているデータ集計係ではありません。「その数字の裏で、誰が誰の機会を奪っているのか」という市場の力学を因果推論のレベルでモデル化できる知性です。
「ABテストでは連戦連勝なのに、なぜか事業のトップラインが伸びない」
もし貴社のダッシュボードがそんな不気味なシグナルを発しているなら、一度生データを見せてください。数字の背後に潜む「共食いのネットワーク」を診断します。