検索ブランド相談室 | 検索と評判の専門メディア

Google口コミ依頼のA/Bテスト設計|QR・SMS・メール・タイミング別に投稿率を比較する方法

部署:マーケティング担当者部署:経営者・責任者レベル:実践Googleビジネスプロフィール、MEO、口コミ分析口コミ対策
QRコード、メール、SMSによる口コミ依頼をA/Bで比較する店舗担当者のデスクと「感覚で決めない。1つだけ変えて比べる。」の文字

Google口コミを増やすために、QR、メール、SMS、依頼文、送信タイミングを試していても、複数の条件を同時に変えると「何が効いたのか」は判断できません。

口コミ依頼のA/Bテストで重要なのは、1回の実験で変える要素を1つに絞り、同じ条件の顧客をAとBへ分け、依頼数・到達数・クリック数・新規口コミ数を同じ定義で比較することです。

さらに、途中経過だけを見て勝者を決めず、必要な母数と停止条件を先に決めておく必要があります。

この記事では、Googleの口コミポリシーを守りながら、店舗担当者が実際にQR・SMS・メール・文面・タイミングを比較できるA/Bテストの設計方法を整理します。

結論:口コミ依頼のA/Bテストは「1変数・同じ母集団・同じ分母」で行う

口コミ依頼のA/Bテストでは、単に「今月はQR、来月はSMS」と比べるだけでは十分ではありません。

季節、曜日、店舗、客数、顧客属性などが変われば、口コミ数の差がチャネルによるものなのか、別の条件によるものなのか分からなくなるからです。

基本ルールは次の3つです。

  • 1回のテストで変える要素は原則1つ
  • 比較するA・Bはできるだけ同じ条件の顧客から割り付ける
  • 成果指標とテスト終了条件を開始前に決める

たとえばメールとSMSを比較するなら、メールを受け取れる顧客だけとSMSを受け取れる顧客だけを後から比較するのではなく、両方の方法で連絡でき、依頼対象として同じ条件を満たす顧客をA・Bへ分けます。

テストする項目 A B 原則固定する項目
チャネル メール SMS 対象顧客、依頼文、送信タイミング
文面 短文 説明付き チャネル、対象、送信時間、リンク
タイミング 利用翌日 利用3日後 対象、文面、チャネル
QR設置場所 会計時カード レシート 店舗、依頼文、対象期間
CTA表現 「口コミを投稿する」 「ご感想をお聞かせください」 その他の文面、送信条件

口コミ依頼のA/BテストでメールとSMSだけを変更し、顧客条件・文面・送信タイミングを同じにする比較図

A/Bテストでは、比較したい要素だけを変更し、それ以外の条件をできるだけそろえます。

複数要素を一度に変えると、結果が良くても原因を特定できません。

Google口コミでA/Bテストしてよい項目と避けるべき項目

Googleは、実際の顧客体験に基づく口コミを、評価や内容へ影響を与えずに依頼すること自体を認めています。また、Googleビジネスプロフィールでは、口コミ依頼用のリンクやQRコードを作成し、領収書、感謝メール、チャット終了時、店頭などで共有できます。

口コミ依頼の対象、タイミング、導線、規約リスクを含む全体設計は、口コミ獲得・増加施策の全体設計で確認できます。

一方で、Googleは、インセンティブとの交換、否定的な口コミの抑制、肯定的な顧客だけを選んだ依頼、その場での投稿の強要、口コミへ特定内容を含めるよう求める行為を禁止しています。

したがって、A/Bテストで比較するのは「規約内で許容される依頼方法」に限定します。

比較対象 A/Bテスト 理由
メール vs SMS 中立的な依頼方法の比較
QRの設置場所 導線上の摩擦を比較できる
利用翌日 vs 3日後 依頼タイミングの比較
短文 vs 説明付き文面 評価を誘導しない範囲なら比較可能
CTAの位置 導線改善として比較可能
満足顧客だけ依頼 vs 全顧客へ依頼 × 肯定的な口コミの選択的な募集につながる
特典あり vs 特典なし × Googleは口コミとの引き換えのインセンティブを禁止
「星5をお願いします」vs 中立文 × 評価を誘導するテストになる
特定のキーワード記載あり・なし × 特定内容を含めるよう依頼する行為になる
店頭でその場投稿を求める × 投稿の要求・強要につながる

また、口コミ投稿を条件とする割引や、事業者が投稿内容の決定へ関与する施策では、Googleのポリシーだけでなく、日本の景品表示法上のステルスマーケティング規制も別途確認する必要があります。消費者庁も、事業者が表示内容の決定に関与したかどうかを重要な判断要素として示しています。

口コミ依頼のA/Bテストを設計する6ステップ

1.最初に「何を改善したいのか」を1つ決める

最初に中心となる問いを1つだけ決めます。

たとえば、

  • QRとSMSでは、どちらが口コミページまで進みやすいか
  • SMSは利用翌日と3日後のどちらが反応されやすいか
  • 同じメールでも短文と説明付き文面のどちらがクリックされやすいか

といった形です。

「メールとSMSを比較しながら、SMSだけ送信時間と文面も変える」といった設計では、原因を切り分けられません。

2.比較対象となる顧客を先に決める

AとBの顧客条件をそろえることが重要です。

たとえばメールとSMSを比較する場合、

「メールアドレスしか保有していない顧客」と「電話番号しか保有していない顧客」を比較しても、チャネルの効果だけを比較したことにはなりません。

顧客層そのものが違う可能性があるからです。

可能であれば、

  1. 同じ期間に利用した
  2. 同じ店舗を利用した
  3. 同じ依頼対象基準を満たす
  4. メール・SMSのどちらでも連絡できる
  5. 既存の連絡同意・配信ルールを満たす

顧客を母集団とし、そこからA・Bへランダムに分けます。

多店舗で実施する場合も、「A店はメール、B店はSMS」と店舗ごとに完全分離するより、各店舗の中でA・Bへ分ける方が店舗差を抑えやすくなります。

3.依頼数から投稿までのファネルを統一する

口コミ依頼では、クリック数と口コミ投稿数を同じ指標として扱わないことが重要です。

最低でも次の段階を分けます。

段階 指標 計算例
対象 依頼対象者数 テスト対象となった顧客
依頼 送信・配布数 実際にSMS・メール等を送った数
到達 配信成功・QR接触 配信成功数など
反応 QR読取・リンククリック ユニーククリック数など
投稿 新規口コミ 対象期間中に増えたGoogle口コミ

口コミ依頼を対象、依頼、到達、反応、投稿の5段階に分け、クリックと投稿完了は同じではないことを示すフロー図

QRの読取やリンククリックは投稿完了ではありません。依頼から新規口コミまでを別々の指標として管理します。

メールやSMSなら、

クリック率=ユニークリンククリック数 ÷ 配信成功数

のように比較できます。

一方、Google上の新規口コミ数には、依頼を受けず自発的に投稿した口コミが混ざる可能性があります。

そのため、依頼経由の投稿完了を個別に確認できない計測環境では、

新規口コミ数 ÷ 依頼対象数

を「依頼経由の正確な投稿率」と断定せず、期間全体の口コミ増加を見る参考指標として扱います。

A/Bテストでは、計測可能なクリック率などを主指標にし、新規口コミ数を最終成果の補助指標として組み合わせる方法も現実的です。

4.AとBへの割り付け方法を決める

個人へ直接送信できるメールやSMSでは、顧客単位でのランダム割り付けが基本です。

たとえば対象者2,000人なら、乱数などを使って約1,000人ずつAとBへ分けます。

QRのように店舗内へ設置する施策は、個人単位で分けにくい場合があります。

その場合は、

  • 店舗×曜日
  • 店舗×週
  • レジ単位
  • 同条件の店舗ペア

などを実験単位として割り付けます。

ただし、月曜をA、土曜をBと固定すると曜日差が混ざります。A・Bの曜日を入れ替える、複数週で比較するなど、曜日や季節による偏りを抑える設計が必要です。

5.必要な母数を実験前に決める

A/Bテストでは、10人対10人の結果が「1件対3件」だったからといって、Bが優れているとは判断できません。

もともとの投稿率が低い施策ほど、小さな改善差を確認するには多くの対象者が必要です。

【弊社算出】2群の比率差を比較する一般的な近似計算で、両側有意水準5%・検出力80%・A/B同数とした場合の目安は次のとおりです。

想定するA 検出したいB 必要数の目安
5% 7% +2pt 約2,213人/群
5% 8% +3pt 約1,059人/群
10% 13% +3pt 約1,774人/群
10% 15% +5pt 約686人/群

口コミ投稿率5%から8%への差を比較する場合に約1,059人ずつ必要になるという弊社算出の参考母数を示す図

基準5%から8%への改善を検出する場合、一般的な前提では約1,059人/群が必要になる参考計算です。実際の必要数は条件によって変わります。

※一般的な2群比率比較の近似式による参考値です。実際に必要な件数は、基準となる投稿率、検出したい最小差、割り付け方法、欠測などで変わります。

重要なのは「何人集まれば勝者を決めるか」を後から決めないことです。

6.停止条件と勝敗判定を先に固定する

A/Bテストを毎日確認し、「今日はBが勝っているから終了」とすると、一時的なばらつきを勝ちパターンと誤認しやすくなります。

開始前に、たとえば次のように決めます。

  • 最低1,100人/群まで実施する
  • 最低2週間は実施し、曜日差を含める
  • 最大6週間で終了する
  • 主指標はリンククリック率とする
  • 事前に決めた改善幅以上か確認する
  • 十分な母数に届かなければ「Bの勝ち」ではなく「判定保留」とする
  • 配信停止、苦情、規約上の問題が増えた場合は成果だけで採用しない

「差がなかった」と「判断できるだけのデータが集まらなかった」は別の状態です。

QR・SMS・メール・タイミング別に割り付け方法を変える

比較する施策によって、適した実験単位が変わります。

QR・メール・SMS・店頭案内それぞれの導線設計を先に整える場合は、口コミを増やす依頼導線の作り方を参照してください。

比較 推奨する割り付け 固定するもの 主な注意点
メール vs SMS 顧客単位 文面、対象、送信時点 両方の連絡条件を満たす顧客で比較
SMS文面A vs B 顧客単位 送信時刻、対象、リンク 評価誘導につながる表現は使わない
翌日 vs 3日後 顧客単位 チャネル、文面 曜日構成をそろえる
QR位置A vs B 店舗・レジ・店舗日 デザイン、文面、対象 店舗差・曜日差を混ぜない
店頭QR vs 後日SMS 顧客単位が理想 対象顧客 接点そのものが異なるため設計に注意

特に「QRとSMS」では、QRを見た人とSMSを受け取った人の属性が最初から違うケースがあります。

その場合、単純な投稿数比較ではなく、「同じ顧客をどちらへ割り当てるか」まで設計できるかを先に確認してください。

口コミ依頼のタイミングは感覚ではなく実験で確認する

口コミ依頼のタイミングについては、既に学術研究でも差が確認されています。

Jungらは、レビュー依頼タイミングを対象に2つのランダム化フィールド実験を行い、体験直後のリマインドがレビュー投稿確率を下げる場合がある一方、時間を置いたリマインドでは投稿確率が高まったと報告しています。研究者は、早すぎる依頼では心理的な反発が生じる可能性を指摘しています。

また、PoniatowskiらはTrusted Shopsの2,230万件のレビュー依頼と230万件のレビューを分析し、レビュー依頼の時間帯と回答率に関係があることを報告しています。

ただし、これらはGoogle口コミだけを対象にした日本国内店舗の実験ではありません。

したがって「翌日が必ず正解」「昼に送れば必ず増える」と一般化するのではなく、自社の顧客接点でA/Bテストするための仮説として使うのが適切です。

投稿数だけで勝者を決めない

口コミ依頼の目的は件数を増やすことですが、投稿数だけを最適化すると別の変化が生じる可能性があります。

GaoらによるTripAdvisorの自然実験では、レビュー依頼プログラムへの参加によってレビュー量が34.3%増えた一方、レビューの長さは16.9%減少しました。また、自然発生するレビュー量への負の波及も確認されています。

これはGoogle口コミで同じ結果になることを意味しませんが、「依頼数を増やせばすべての指標が良くなる」とは限らないことを示しています。

A/Bテストでは最低限、

  • クリック率
  • 新規口コミ数
  • 依頼対象者数
  • 配信停止・苦情などの運用上の問題
  • 口コミ内容や評価分布に不自然な偏りが出ていないか

を併せて確認します。

特に星評価が高くなるタイミングだけを意図的に選ぶような運用は、Googleが禁止する評価操作との境界を意識する必要があります。

母数が少ない店舗では「勝敗をつけない」という判断も必要

口コミ施策は、広告クリックのように大量のデータが短期間で集まるとは限りません。

Bayerlらの研究では、33のデータセット、約4億件のレビューを用いた大規模分析に加えて、レビューサイトの利用者1万2,500人を対象とした事前登録済みフィールド研究も行われています。大きな対象者数を用いた研究でも、実際に行動する人が少なければ、比較に必要な反応数は限られます。

月100件しか依頼できない店舗で、5%と7%のような小さな差を短期間で判定するのは現実的ではない場合があります。

その場合は、

  • テスト期間を延ばす
  • 複数店舗で同じ設計を行う
  • 投稿完了だけでなくクリック率を先行指標にする
  • 検出したい改善幅を事前に見直す
  • 十分な母数が集まらなければ判定を保留する

という選択肢を検討します。

小さな数字から無理に「勝ちパターン」を作るより、判断できない状態を正しく認識する方が、継続運用では重要です。

A/Bテスト結果は「勝者・保留・中止」の3つで判定する

A/Bテスト終了後は、単純にAかBの二択にしない方が実務で使いやすくなります。

判定 条件例 次の行動
勝者あり 必要母数を満たし、事前に決めた改善差を確認 勝者を標準化
判定保留 母数不足、差が小さい、結果が不安定 継続または再テスト
中止 規約、苦情、配信停止、運用負荷などに問題 採用しない

口コミ依頼A/Bテストの結果を勝者あり、判定保留、中止の3つに分け、母数不足と差がない状態を区別する判定フロー

A/Bテストは必ず勝者を決める必要はありません。十分なデータがなければ「判定保留」として再検証します。

たとえばBのクリック率がAより0.2ポイント高くても、運用コストが大幅に増えるのであれば、実務上の勝者とは限りません。

統計上の差だけでなく、事前に「何ポイント改善すれば切り替える価値があるか」を決めておくと判断しやすくなります。

口コミ依頼A/Bテストの実施前チェックリスト

実験開始前に、次の項目を確認してください。

  • テストで答えたい質問が1つに絞られている
  • AとBで変更する変数が原則1つだけになっている
  • AとBの対象顧客条件が同じである
  • 顧客を恣意的にA・Bへ振り分けていない
  • 店舗差・曜日差・新規客とリピーターの差を混ぜていない
  • 「依頼」「到達」「クリック」「新規口コミ」の定義が決まっている
  • QR読取やクリックを口コミ投稿完了として扱っていない
  • 必要母数を開始前に設定している
  • 最低期間と最大期間を設定している
  • 勝者とする最低改善幅を決めている
  • 母数不足の場合は「判定保留」にできる
  • 満足顧客だけを選んだ依頼になっていない
  • インセンティブを付けていない
  • 星数や口コミ内容を指定していない
  • 店頭で投稿を強要する設計になっていない

まとめ

Google口コミ依頼のA/Bテストでは、「今月はメール、来月はSMS」と施策を入れ替えるだけでは、正確な比較になりません。

口コミ依頼を継続運用する仕組みまで整えたい場合は、アンケートを起点にGoogle口コミ投稿を支援するクチコミ増えるくんも選択肢です。

重要なのは、同じ条件の顧客をA・Bへ分け、チャネル・文面・タイミングなど1つの要素だけを変更し、依頼数、到達数、クリック数、新規口コミ数を同じ定義で測定することです。

さらに、必要母数、最低期間、停止基準、勝敗判定をテスト開始前に決めます。データが足りなければ「差がない」ではなく「判定保留」としてください。

Google口コミでは、肯定的な顧客だけを選んだ依頼、インセンティブ、評価・内容の誘導、その場での投稿の強要は禁止されています。A/Bテストは、規約内のチャネル・タイミング・中立的な文面・導線を改善するために使います。

感覚で「口コミが増えた気がする」と判断するのではなく、比較条件と判定ルールを固定することで、自社に合った口コミ依頼の方法を継続的に検証できます。

参考文献・データ元

Google「リンクまたは QR コードを作成してクチコミをリクエストする」
発表元:Google ビジネス プロフィール ヘルプ
使用内容:口コミ依頼リンク・QRコードの共有方法、口コミとの引き換えのインセンティブ禁止
参考元URL:https://support.google.com/business/answer/16816815?hl=ja

Google「禁止または制限されているコンテンツ」
発表元:Google Maps User Contributed Content Policy
使用内容:インセンティブ、肯定的口コミの選択的募集、その場での強要、具体的内容の指定、評価操作に関する規定
参考元URL:https://support.google.com/contributionpolicy/answer/7400114?hl=ja

消費者庁「ステルスマーケティングに関するQ&A」
発表元:消費者庁
使用内容:口コミ・SNS投稿に対する事業者の関与と「事業者の表示」の考え方
参考元URL:https://www.caa.go.jp/policies/policy/representation/fair_labeling/faq/stealth_marketing/

Ask for Reviews at the Right Time: Evidence from Two Field Experiments
著者:Miyeon Jung, Sunghan Ryu, Sang Pil Han, Daegon Cho
掲載誌:Journal of Marketing
DOI:10.1177/00222429221143329
使用内容:レビュー依頼タイミングを比較した2つのランダム化フィールド実験
参考元URL:https://journals.sagepub.com/doi/10.1177/00222429221143329

When to ask for a review: An empirical analysis of online review request timing for different product types
著者:Martin Poniatowski, Janina Seutter, Sunghan Ryu, Dennis Kundisch
使用内容:2,230万件の依頼・230万件のレビューを使った依頼タイミング分析
参考元URL:https://ideas.repec.org/p/pdn/dispap/119.html

The Weekend Effect in Online Reviews
著者:Andreas Bayerl, Verena Schoenmueller, Jacob Goldenberg, Florian Stahl
掲載誌:Journal of Marketing Research
初回オンライン公開:2025年10月15日
DOI:10.1177/00222437251391808
使用内容:約4億件・33データセットのレビュー分析と1万2,500人を対象としたフィールド研究
参考元URL:https://journals.sagepub.com/doi/10.1177/00222437251391808

The Pitfalls of Review Solicitation: Evidence from a Natural Experiment on TripAdvisor
著者:Baojun Gao, Jing Wang, Xiaojie Ding, Yue Guo
掲載誌:Management Science
DOI:10.1287/mnsc.2023.01006
使用内容:レビュー依頼によるレビュー量・評価・レビュー長・自然投稿への影響
参考元URL:https://pubsonline.informs.org/doi/10.1287/mnsc.2023.01006

無料相談はこちら