AIO(AI検索最適化)の改善で難しいのは、「引用率が上がったか」だけを見ることではありません。重要なのは、何を変え、どの質問・AI・期間で確認し、どのような回答や引用の変化が起きたのかを後から追える状態にすることです。
AIOの表示・引用・流入・成果をどう測るかという全体設計から確認したい場合は、[AIOの効果測定とKPI設計|表示・引用・流入・成果の4段階で改善する方法](https://rebranding.co.jp/media/aio-measurement/)を参照してください。
AI検索の回答や引用元は同じ質問でも変動します。2026年の研究でも、単発の測定値を固定的な実力として扱うと、AI検索の可視性を実態以上に正確に見積もってしまう問題が指摘されています。
そのためAIO施策は、「施策を実行する→数字を見る」ではなく、仮説、変更点、測定条件、前後結果、学びを1つの実験ログとして残すことが重要です。
この記事では、マーケティング・AIO担当者が、施策の成功・失敗を再利用できるナレッジへ変えるための実験ログの作り方を、記録項目、測定方法、判断基準、テンプレートまで具体的に整理します。
AIO実験ログでは「何が変わったか」を結果とセットで残す
AIO実験ログとは、AI回答や引用率の測定結果だけではなく、その結果の前に何を変更したのかを施策単位で記録する履歴です。
たとえば引用率が15%から30%へ上がったとしても、その期間中にFAQ追加、本文リライト、タイトル変更、構造化データ追加を同時に実施していれば、どの変更が結果と関係したのか判断できません。
逆に、1つの主要変更について、
「なぜ実施したか」
「何を変更したか」
「どの質問で確認したか」
「変更前はどうだったか」
「変更後はどうなったか」
「他に結果へ影響しそうな変化はなかったか」
まで残しておけば、次の施策判断に利用できます。
AI検索では、この履歴管理が特に重要です。GoogleはAI OverviewsやAI Modeについて、通常のSEO基盤は引き続き重要である一方、条件を満たしてもクロール・インデックス・表示自体は保証されないと説明しています。
したがってAIO実験ログの目的は、「施策Aをやれば必ず引用率が上がる」と断定することではありません。
どの条件では改善が観測され、どの条件では観測されなかったのかを蓄積することが目的です。
最初に「1実験=1つの主要変更」を基本ルールにする
AIO施策の検証では、可能な限り1回の実験で変更する主要因を1つに絞ります。
2026年に公開されたAI回答の引用選択に関する研究では、比較する2つの情報源について1つの要素だけを変え、他の条件を揃えることで、どの要素が引用選択と関係しているのかを検証しています。252,000回の試行を行った研究でも、この「比較する要因を分離する」考え方が採用されています。
実際のWebサイト運用では完全な実験環境を作ることは困難ですが、考え方は同じです。
| 悪い検証例 | 改善した検証例 |
|---|---|
| FAQ・タイトル・本文・構造化データを同日に変更 | FAQ追加だけを主要変更として記録 |
| サイト全体を改修して引用率を見る | 対象ページと対象質問を固定 |
| 変更前を記録していない | 変更前の回答・引用状態を保存 |
| 1回質問して引用されたら成功 | 複数回・複数日で確認 |
| 成功した実験だけ保存 | 無変化・悪化も保存 |

複数の施策を同時に変えると原因を特定しにくくなります。AIO実験では主要変更をできるだけ1つに絞ります。
複数変更が避けられない場合は、「FAQ追加+FAQPage実装」のように1つの施策パッケージとして定義し、それ以上の変更を同じ検証期間に混ぜないようにします。
AIO実験ログで最低限残すべき12項目
AIO実験ログは、後から別の担当者が読んでも実験条件を再現できる状態を目指します。
最低限、次の情報を残します。
| 項目 | 記録内容 |
|---|---|
| 実験ID | EXP-202608-001など一意のID |
| 仮説 | 何を変えると何が改善すると考えたか |
| 対象ページ | 変更したURL |
| 対象質問 | 測定する質問・プロンプト |
| 対象AI | ChatGPT、Google AI Mode、Perplexityなど |
| 変更前状態 | 本文・構造・引用状況など |
| 変更内容 | 実際に行った施策 |
| 公開日時 | 変更を公開した日時 |
| 測定期間 | 変更前・変更後を測定した期間 |
| 結果 | AI回答、引用URL、引用率、言及率など |
| 外乱要因 | 同時期の別改修、モデル更新など |
| 学び・次の行動 | 採用、保留、再検証、撤回など |

AIO実験ログでは、結果だけでなく、実験条件・変更内容・外乱要因・次の行動まで一つの履歴として残します。
特に重要なのは「変更前状態」です。
実施後の数字だけ残しても、改善したのか悪化したのか比較できません。施策を公開する前に、対象質問に対するAI回答、引用元URL、ブランド言及、自社ページの状態を保存します。
測定単位は「1質問×1AI×1回の回答」で固定する
AIO実験ログでは、数字の分母を統一する必要があります。
おすすめは、
1観測=1つの質問 × 1つのAIサービス × 1回の回答
と定義する方法です。

AIOの測定では分母を揃えることが重要です。1質問×1AI×1回の回答を1観測として管理します。
たとえば5つの質問をChatGPTで4回ずつ確認した場合、観測数は20です。
引用率は次のように計算できます。
引用率=自社URLが引用された観測数 ÷ 有効な観測数 × 100
20回中6回で自社URLが引用された場合、引用率は30%です。
ブランド名だけが回答に登場したケースは、URL引用とは分けて「言及率」として残します。
言及率=自社ブランドが言及された観測数 ÷ 有効な観測数 × 100
「引用」と「言及」を混ぜないことが重要です。
また、引用元URLまで保存します。同じドメインでもトップページが引用されたのか、実験対象ページが引用されたのかでは意味が異なるからです。
AI回答の原文も保存する
引用率だけを記録すると、AIO施策の変化を見落とす場合があります。
自社URLが引用されなくても、
- 自社ブランドが新しく回答へ登場した
- 自社独自データが回答内容へ反映された
- 競合だけだった回答に自社が追加された
- 引用ページがトップページから対象記事へ変わった
といった変化が起こる可能性があります。
そのため、実験ログにはAI回答原文または回答スナップショットも保存します。
ChatGPTの公式ヘルプでも、検索回答に表示される引用元を確認できる一方、検索結果や引用は不完全・古い・誤っている場合があるため、情報源そのものを確認することが推奨されています。
「引用されたか」だけでなく、「何の根拠として使われたか」を確認することで、次の改善につながります。
変更前後を1回ずつ比較して施策効果を断定しない
AIO実験で最も注意したいのが、AI回答そのものの変動です。
実験後の指標を継続監視する段階では、通常の揺れと対応が必要な異常を分ける必要があります。引用率・SOV・回答差分などの通知条件は[AIO指標の異常を検知するアラート設計](https://rebranding.co.jp/media/aio-anomaly-alert-design/)で整理しています。
2026年の研究では、Perplexity、OpenAI Search、Google系AIを対象に同じ質問を繰り返した結果、引用されるドメインや順位に大きなばらつきが確認されました。研究者は、単発の引用率を固定値ではなく、回答分布から得られたサンプルとして扱うべきだとしています。
国内の実測でも同じ問題が確認されています。
株式会社ディライトが22サイト・69キーワードを6週間観測した検証では、内容を変更していない期間も含め、同一ページの引用回数が1回から13回まで変動しました。同社も、短期の増減だけから施策との因果関係を断定することは難しいとしています。
したがって、
変更前:1回測定
変更後:1回測定
だけで「効果あり」と判定するのは避けます。
少なくとも複数の質問・複数回の回答を使い、可能であれば複数日に分けて記録します。
変更前後で固定する条件を先に決める
比較できる実験ログにするには、施策以外の条件を可能な範囲で揃えます。
固定対象の例は次の通りです。
| 固定する条件 | 理由 |
|---|---|
| 質問文 | 表現違いによる回答変化を減らす |
| 質問セット | 前後で母集団を変えない |
| AIサービス | プラットフォーム差を混ぜない |
| 測定回数 | 分母を揃える |
| 対象URL | ページ単位で評価する |
| 記録項目 | 後から横比較できるようにする |
AIサービスをまたいで比較する場合は、ChatGPT、Google AI Mode、Perplexityなどを別々に集計します。
2025年から2026年の研究でも、AI検索サービスごとに引用元の多様性、鮮度、言語差、質問表現への感度などが異なることが報告されています。
「全AI平均」だけを見ると、どこで変化したのか分からなくなるためです。
実験ログには成功だけでなく「無変化」と「悪化」も残す
AIO改善のナレッジを強くするのは、成功例の数ではありません。
何をやっても変わらなかった条件まで残っていることです。
判定は、たとえば次の4つに統一できます。
| 判定 | 意味 |
|---|---|
| 採用 | 複数観測で改善傾向があり継続する |
| 再検証 | 変化はあるがデータが不足 |
| 保留 | 明確な変化を確認できない |
| 撤回 | 悪化・副作用が大きく元に戻す |
「効果なし」も重要な実験結果です。
同じ施策を別担当者が半年後に再び試すことを防げます。
また、過去に効果がなかった施策でも、AIサービスや検索システムが更新された後に再検証する価値が生じる場合があります。その場合も過去ログが比較基準になります。
実験ログの記入例
以下は記録方法を説明するための架空例です。実測結果ではありません。
| 項目 | 記入例 |
|---|---|
| 実験ID | EXP-202608-014 |
| 仮説 | 記事内に具体的なFAQを追加すると対象質問で引用される割合が増える |
| 対象ページ | AIO解説記事A |
| 対象質問 | 固定5問 |
| 対象AI | AIサービスA |
| 変更内容 | 関連FAQ4問を追加 |
| 変更前 | 20観測中3回引用 |
| 変更後 | 20観測中7回引用 |
| 引用率 | 15%→35% |
| 差 | +20ポイント |
| 外乱要因 | 同期間にサイト全体の更新あり |
| 判定 | 再検証 |
| 学び | 改善は観測されたがFAQ追加だけの影響とは断定しない |
| 次の行動 | 別ページで同条件を再検証 |
この例で重要なのは、15%から35%へ上がったこと自体ではありません。
外乱要因があるため「FAQ追加で引用率が20ポイント改善した」と断定せず、再検証へ回している点です。
実際、サクラサクマーケティングの2026年6月の検証では、既存ページへFAQを追加した5つの対象キーワードすべてでAI Overviewsの引用率改善が観測されました。一方で、同記事ではAI Overviewsの表示自体が時間単位で変化することや、自然検索順位への影響を断定できない点にも触れています。
他社の成功施策をそのまま正解とせず、自社条件で再検証することが重要です。
複数施策を比較するとAIOの改善ルールが作れる
実験ログが10件、20件と蓄積すると、単発の施策結果ではなく、横断的な比較が可能になります。
たとえば、
| 実験分類 | 実験数 | 改善を観測 | 再検証 | 変化なし |
|---|---|---|---|---|
| FAQ追加 | 8 | 5 | 2 | 1 |
| 一次データ追加 | 6 | 5 | 1 | 0 |
| 見出し再設計 | 7 | 3 | 2 | 2 |
| 構造化データのみ | 5 | 1 | 1 | 3 |
という形で集計できます。
この表も架空例ですが、ログが蓄積されれば、
「FAQなら効く」
ではなく、
「どのページ・質問・AI・条件でFAQ追加後に改善が多かったか」
まで掘り下げられます。
AIO研究全体でも、すべてのサイトに共通する万能な施策が確立しているとは言えません。2026年7月に45研究を整理したレビューでは、AI検索は複数段階からなる確率的な仕組みであり、一般化されたテクニックがプラットフォームをまたいで安定的に効く証拠は限定的だと整理されています。
だからこそ、自社の実験ログが重要な運用資産になります。
AIO実験ログの運用フロー
実務では次の順番にすると管理しやすくなります。
STEP1|改善したい状態を決める
「AI引用を増やす」「ブランド言及を増やす」「対象ページを引用させる」など、実験の目的を1つ決めます。
STEP2|仮説を一文で書く
「○○を変更すると、△△の質問で□□が改善する」の形にします。
STEP3|変更前を測る
対象質問、AI回答、引用URL、言及、測定日時を保存します。
STEP4|主要変更を1つ実施する
変更内容と公開日時を記録します。
STEP5|同じ条件で再測定する
質問、AI、観測回数などを可能な限り揃えます。
STEP6|前後差と外乱要因を確認する
数字だけではなく、同時期の別改修、競合変化、AI側の変更なども記録します。
STEP7|学びと次の行動を決める
採用・再検証・保留・撤回のいずれかへ分類します。

AIO実験は前後比較で終わりません。得られた学びを判定し、次の実験へつなげるところまでを1サイクルとして管理します。
AIO実験ログで最も重要なのは「再現できる学び」に変えること
AIOの計測データを集めるだけでは、改善ナレッジにはなりません。
重要なのは、
何を変えた結果なのか
を追跡できることです。
引用率やブランド言及率は「結果」です。
実験ログは、その結果へ至るまでの、
仮説
→変更
→条件
→観測
→判断
→次の施策
をつなぐ役割を持ちます。
初期のGEO研究でも、生成AI検索での可視性改善手法は分野によって効果が異なることが示されています。
今後AI検索の仕様やモデルが変わったとしても、施策と結果が整理された履歴があれば、「昔うまくいった施策」を盲目的に繰り返すのではなく、現在の条件で再検証できます。
AIO担当者が残すべきものは、成功数字の一覧ではありません。
誰が見ても「なぜ実施し、何を変え、何が起き、次に何をするのか」が分かる実験履歴です。
まとめ
AIO施策の実験ログでは、引用率などの計測結果だけではなく、変更点と結果を施策単位で結び付けて記録します。
基本ルールは次の通りです。
- 1実験につき主要変更をできるだけ1つにする
- 変更前の状態を必ず保存する
- 対象質問・AI・測定回数を固定する
- AI回答原文と引用元URLを保存する
- 引用率とブランド言及率を分ける
- 単発測定で効果を断定しない
- 外乱要因を記録する
- 成功だけでなく無変化・悪化も残す
- 最後に「学び」と「次の行動」を決める
AI検索は回答や引用元が変動するため、単純な前後比較だけでは施策効果を誤認する可能性があります。
だからこそ、AIO施策を「作業履歴」ではなく「実験ログ」として蓄積し、再現可能な改善ナレッジへ変える運用が重要です。
参考文献・データ元
Google「AI Features and Your Website」
発表元:Google Search Central
最終更新:2025年12月10日
使用内容:AI Overviews・AI Modeへの表示条件、SEO基盤、表示が保証されない点。
参考元URL:https://developers.google.com/search/docs/appearance/ai-features
Google「Optimizing your website for generative AI features on Google Search」
発表元:Google Search Central
公開:2026年
使用内容:生成AI検索でも従来のSEO基盤が重要であること、ユーザー価値を中心としたコンテンツ設計。
参考元URL:https://developers.google.com/search/docs/fundamentals/ai-optimization-guide
OpenAI「Searching the web with ChatGPT」
発表元:OpenAI
更新:2026年8月
使用内容:ChatGPT Searchの引用表示と、検索結果・引用元を確認する際の注意。
参考元URL:https://help.openai.com/en/articles/9237897
Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement
著者:Ronald Sielinski
公開:2026年
対象:Perplexity Search、OpenAI Search、Google系AIに対する反復測定
主要結果:同一質問でも引用分布が変動し、単発の可視性指標では測定誤差を過小評価する可能性がある。
使用目的:AIO実験を単発測定で判断しない根拠。
参考元URL:https://arxiv.org/abs/2603.08924
What Gets Cited: Competitive GEO in AI Answer Engines
公開:2026年
対象:6つのLLM、252,000試行
主要結果:比較対象間で1要因だけを変更する統制実験により、引用選択へ影響する要素を分析。
使用目的:「1実験=1主要変更」の設計根拠。
参考元URL:https://arxiv.org/html/2605.25517v1
Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026)
著者:Olivier Martinez
公開:2026年7月15日
対象:2023〜2026年の45研究
主要結果:GEOの指標・証拠基準にはばらつきがあり、反復測定、統制、人的確認などを含む再現可能な検証が重要。
使用目的:実験ログによる継続検証の根拠。
参考元URL:https://arxiv.org/abs/2607.14035
GEO: Generative Engine Optimization
著者:Pranjal Aggarwalほか
掲載:KDD 2024
DOI:10.1145/3637528.3671900
主要結果:生成エンジンにおける可視性改善を体系的に検証し、施策効果がクエリ領域によって異なることを報告。
使用目的:GEO/AIO施策を条件別に検証する必要性の背景。
参考元URL:https://arxiv.org/html/2311.09735
「AI検索への引用の必要条件と十分条件」
発表元:株式会社ディライト
公開・更新:2026年6月8日
対象期間:2026年4月19日〜6月3日
対象:22サイト・69キーワード・17スナップショット
使用内容:AI検索引用の日次変動と施策効果を短期変動だけで断定しにくい点。
参考元URL:https://delight.co.jp/ai-search-lab/news/aio_lab/
「FAQ追加でAI Overviewsからの引用率が改善した検証事例」
発表元:サクラサクマーケティング株式会社
更新:2026年6月24日
使用内容:FAQ追加前後の引用率測定例と、AIO表示・順位変動に関する検証上の注意。
参考元URL:https://www.sakurasaku-marketing.co.jp/labo/blogs/faq-ai
