この記事は、固定質問セット・対象AI・引用や推薦の判定ルールなど、定点観測の基本設計がすでに完了している担当者を対象にしています。質問セットの作り方、引用率KPI、週次・月次の観測運用は、既存記事「AI検索の引用率を定点観測する方法」の担当範囲です。
ここで扱うのは、その次の測定品質です。同じ時点・同じ条件で独立した反復を行い、回答・引用・推薦順位がどの程度ばらつくかを分布で確認します。その分布を「通常の揺れ幅」として保存し、時系列の変化が通常揺れを超えたときだけ確認バッチへ進む判定ルールを作ります。
AI回答の再現性監査とは、同一時点の測定ノイズを基準化すること
再現性監査の目的は、AI回答を毎回一致させることではありません。同一時点・同一条件で複数回測ったときに生じるばらつきを、時系列変化を判定する前のノイズ基準として保存することです。
2026年2月に公開されたCuiとAlexanderの研究では、2種類のプロンプト方法、6モデル、4つのtemperature条件について各10回、計480回の実行を比較し、同じタスク・データ・設定でも分析結果に相当のばらつきが確認されました。著者らは、LLMによる分析では独立した複数回実行を行い、結果の分布を見る必要があるとしています。
したがって、再現性監査では「今回1回の回答」と「前回1回の回答」を比べません。同じ時点で得た回答群を1バッチとしてまとめ、バッチ内の分布から通常の揺れ幅を作り、次のバッチをその幅と比較することが中心になります。
定点観測と再現性監査の役割分担
定点観測と再現性監査は、似ていますが担当する問いが異なります。
AIO全体のKPIや「表示→引用→流入→成果」の整理は、AIOの効果測定の全体像で確認できます。
| 工程 | 答える問い | この工程で決めるもの | 本記事での扱い |
|---|---|---|---|
| 定点観測設計 | 何を継続して測るか | 固定質問セット、対象AI、引用・言及の判定、KPI、観測頻度 | 既存記事へ委譲 |
| 再現性監査 | 同じ時点でどこまで揺れるか | 独立反復、バッチ内分布、通常揺れの基準線 | 本記事の中心 |
| 変化確認 | 通常揺れを超えたか | 確認バッチの要否、3段階判定 | 本記事の中心 |
| 原因分析 | なぜ変わったか | モデル更新、検索環境、競合、自社施策の切り分け | 確認バッチ後に実施 |
つまり、再現性監査のために質問セットを作り直したり、引用率KPIを再定義したりする必要はありません。定点観測で固定した仕様をそのまま使い、同一時点の反復だけを追加して測定ノイズを見える化するのが役割です。
同一時点の反復で追加固定する条件
定点観測ですでに固定している質問文、対象AI、判定ルールをここで再設計しません。再現性監査では、同一バッチ内の結果を比較できるよう、次の差分条件だけをそろえます。
| 追加で固定・記録する項目 | 再現性監査での扱い |
|---|---|
| 独立実行 | 直前の回答を次の実行へ持ち込まない。原則は新規チャット・独立リクエスト |
| 実行時間帯 | 同一バッチはできるだけ近い時間帯で完了し、時点差を小さくする |
| 会話・メモリ状態 | 同一バッチ内でON/OFFや新規・継続条件を変えない |
| Web検索状態 | ON/OFFなど利用者が確認できる条件をそろえる |
| 地域・言語等 | 同一バッチ内で変更しない。固定できないものは記録する |
| API設定 | API利用時はtemperature、top_p等を同一バッチ内で固定する |
| 保存形式 | 全実行で回答全文、引用URL、推薦順、実行時刻を同じ形式で保存する |

ブラウザ版などで内部条件を完全には固定できない場合でも、問題はありません。重要なのは「すべての変動を消す」ことではなく、同一バッチ内で意図的な条件変更を入れず、固定できない条件を記録しておくことです。
回答・引用・推薦順位は分布として別々に読む
再現性監査では、1回の「出た・出なかった」ではなく、同一バッチ内でどの程度ばらついたかを見ます。回答内容、言及・推薦、引用、順位は性質が異なるため、同じ数値へまとめず別々に分布を確認します。
| 観測対象 | バッチ内で記録する指標例 | 通常揺れとしての読み方 |
|---|---|---|
| 回答内容 | 主要主張の一致率、結論カテゴリ別件数 | 結論や論点がどこまで入れ替わるか |
| 言及・推薦 | 自社出現回数 ÷ 反復回数 | 同一時点での出現率の幅を見る |
| 引用元 | URL・ドメイン別の採用回数、重複率 | 引用元の入れ替わり幅を見る |
| 推薦順位 | 1位率、Top3率、中央値、最小・最大順位 | 順位の中心とレンジを見る |
| 競合 | 同時出現回数、競合別出現率 | 推薦集合そのものの入れ替わりを見る |

AI回答の変動要因を特定するには、回答内容、言及・推薦、引用、順位を別々の指標として記録します。
たとえば10回中7回自社が推薦された場合、「今回の観測では7/10回」と記録します。「AIは70%の確率で必ず自社を推薦する」と一般化してはいけません。有限回の観測には不確実性があるためです。
反復回数は「何回なら正解」ではなく、判断に必要な精度で決める
反復回数にすべてのケースで通用する唯一の正解はありません。実務では、少ない回数で揺れの有無を確認し、重要な判断ほど回数を増やす段階設計が扱いやすくなります。
目安として、5回はスクリーニング、10回は重要質問の基準線づくり、20回以上は判断が割れる質問や小さな差を確認したい場合の追加観測と位置づける方法があります。これは業界標準ではなく、監査を始めるための運用上の目安です。
10回という回数自体を「十分」とみなすのも危険です。二項比率をWilson法の95%信頼区間で試算すると、10回中5回の観測率50%は約23.7〜76.3%、20回中10回では約29.9〜70.1%、50回中25回でも約36.6〜63.4%です。【弊社算出】これは各回を独立に近い二項事象として扱った単純な計算例で、AI回答の真の確率を保証するものではありません。
一方、2026年7月のブランド回答の分散研究では、12,933件のLLM回答を分析し、同一質問内の再実行だけでなく、質問の言い換え、モデル、言語もばらつきの要因になると報告されました。その研究条件では、5回を超える反復より、モデルや言語を広げる方がクエリ予算当たりの信頼性改善が大きい結果でした。ただし、これは中央・東欧20ブランド、8言語、3モデルを対象にしたプレプリントの結果であり、あらゆるAIO監査へそのまま当てはめる数字ではありません。
ただし、本記事の通常揺れ基準には、質問の言い換え、モデル変更、言語変更を混ぜません。それらは別条件の比較実験として分離します。再現性監査の1バッチでは、同一条件の反復だけを行い、その条件下での分布を基準化することが重要です。
AI回答の再現性を監査する7ステップ
固定質問セット・対象AI・判定ルールがある状態から、次の順で通常揺れの基準線を作ります。

1. 定点観測の既存仕様を読み込む
使用する質問ID、質問文、対象AI、引用・言及・推薦の判定ルールを確認します。ここでは新しい質問やKPIを追加しません。定点観測の仕様をそのまま反復測定へ持ち込みます。
2. 1バッチの独立反復回数を決める
5回、10回など、その質問で通常揺れを確認するための回数を事前に決めます。途中で結果を見ながら都合よく回数を変えるのではなく、追加測定が必要な場合は別バッチとして残します。
3. 同一時点で独立実行する
1回目の回答を2回目の文脈に持ち込まないよう、新規チャットや独立リクエストを使います。同一バッチはできるだけ近い時間帯で完了し、時系列変化とバッチ内ノイズを混ぜないようにします。
4. 生の回答・引用・推薦順を保存する
集計値だけでなく、回答全文、引用URL、推薦順、実行時刻、固定できなかった条件を保存します。後から判定ルールを確認したり、分布を再集計したりできる状態を残します。
5. バッチ内の分布を出す
言及率、引用採用率、Top3率、順位中央値、順位範囲、引用URLの入れ替わりなどを集計します。回答文は主要主張をカテゴリ化し、どの結論が何回出たかを確認します。
6. 通常の揺れ幅として基準線を保存する
同一時点の反復結果を、その質問・AI・条件におけるノイズ基準として保存します。次の時系列観測では、単発回答同士ではなく、新しいバッチの分布がこの基準線からどこまで外れたかを見ます。
7. 基準線を外れたときだけ確認バッチを回す
通常揺れを超える変化が出ても、すぐ異常や施策効果と断定しません。同じ仕様でもう一度独立反復し、同方向の変化が再現するか確認します。
一時的な揺れと実質的な変化を3段階で分ける
異常判定では、「前回より下がった」だけでは不十分です。バッチ内で観測した通常揺れを基準にし、その幅を外れた場合だけ確認バッチへ進みます。さらに、業務上意味のある変化幅も事前に決めておきます。

通常の揺れ幅を外れただけでは異常と断定せず、同条件の確認バッチでも変化が続いた場合に原因分析へ進みます。
| 判定 | 状態 | 対応 |
|---|---|---|
| ノイズ範囲 | 基準線のばらつきの中で上下している | 原則として経過観測 |
| 要確認 | 通常幅を外れたが、1バッチだけの変化 | 同条件で確認バッチを実行 |
| 変化候補 | 事前に決めた重要変化幅を超え、確認バッチでも同方向 | モデル更新、検索環境、競合、自社施策を切り分ける |
重要なのは、「20ポイント下がれば異常」のような数字を後から都合よく決めないことです。問い合わせや経営判断に使う重要質問なら小さな変化でも追加観測し、探索用質問なら大きな変化だけを見るなど、用途ごとに重要変化幅を先に決めます。
また、確認バッチで変化が再現しても、自社施策が原因とは限りません。モデル更新、検索インデックス、ニュース、競合サイト、地域条件などが同時に変わっていないか確認してから原因仮説を立てます。
「毎回同じ回答」でも正しいとは限らない
再現性と正確性は別の品質です。2025年のEMNLP論文では、LLMが複数回の確率的サンプルで同じ誤答を繰り返す「self-consistent error」が扱われ、既存の誤り検出手法がこうした一貫した誤りを見逃しやすいことが報告されています。
そのため、再現性監査で「10回中10回同じ引用だった」と分かっても、その引用や回答内容が正しいとは限りません。再現性監査の後に、引用先の実在性、本文との一致、情報の更新日、企業名・商品・数値などの事実確認を別工程で行います。
再現性監査は「答えが正しいか」を判定する工程ではなく、「観測値がどの程度安定しているか」を判定する工程です。この2つを分けると、AIO計測の判断精度が上がります。
再現性監査バッチで最低限残すチェック項目
毎回の監査で最低限、次の項目が残っていれば、後から同条件で再測定しやすくなります。
- 監査ID
- 定点観測側の質問ID
- 定点観測側の対象AI・モデル
- バッチ開始・終了時刻
- 独立実行の方法
- Web検索・会話・メモリなどバッチ内で揃えた条件
- 固定できなかった条件
- 反復回数
- 回答全文
- 自社・競合の言及有無
- 推薦順位
- 引用URL
- 言及率・Top3率・引用採用率
- 順位中央値・順位範囲
- 前回バッチとの差
- 確認バッチの要否
- モデル・検索・競合等の外部変化メモ
このバッチ記録を定点観測の時系列データへ接続すると、「数値が変わった」という結果だけでなく、「通常の揺れを超えたため確認バッチが必要」という判断まで残せます。
まとめ
再現性監査は、固定質問セットや引用率KPIを作る工程ではありません。定点観測の設計が完了した後に、同一時点・同一条件で独立反復し、測定ノイズの基準線を作る工程です。
回答内容、言及・推薦、引用元、推薦順位をバッチ内の分布として保存し、その分布を「通常の揺れ幅」として次回以降の観測に使います。新しい観測が通常幅の中なら経過観測、幅を外れたら確認バッチ、確認バッチでも同方向なら変化候補として原因分析へ進みます。
この役割分担にすると、定点観測の記事が担当する「何を継続して測るか」と、本記事が担当する「同じ時点でどこまで揺れるか」が分離されます。単発回答の増減ではなく、通常揺れを超えたときだけ次の確認工程へ進む測定ルールを作ることが、再現性監査のゴールです。
参考文献・データ元
- OpenAI「Why am I getting different completions on Playground vs. the API?」更新:2026年8月。使用内容:temperature、モデル、プロンプト、APIパラメータなど出力差の条件。
URL: https://help.openai.com/en/articles/6643200-why-am-i-getting-different-completions-on-playground-vs-the-api%253F.xlsx - OpenAI「Memory FAQ」更新:2026年8月。使用内容:メモリ・過去の会話等が応答文脈として利用されること。
URL: https://help.openai.com/en/articles/8590148 - OpenAI「Searching the web with ChatGPT」更新:2026年8月。使用内容:検索クエリの書き換え、メモリ・概算位置情報とWeb検索条件。
URL: https://help.openai.com/en/articles/9237897 - Jiaxin Cui, Rohan Alexander「Same Prompt, Different Outcomes: Evaluating the Reproducibility of Data Analysis by LLMs」2026年。対象:2プロンプト方式、6モデル、4 temperature条件、計480回。使用内容:LLM分析の再現性と複数回観測の必要性。DOI:10.48550/arXiv.2602.14349。
URL: https://arxiv.org/abs/2602.14349 - Dmitrij Żatuchin「Where Does the Noise Come From? A Variance-Components Decomposition of Non-Determinism in LLM Brand Answers」2026年。対象:12,933回答、20ブランド、8言語、3モデル。使用内容:ブランド回答の分散要因、反復・言語・モデル等の比較。プレプリント。DOI:10.48550/arXiv.2607.13304。
URL: https://arxiv.org/abs/2607.13304 - Hexiang Tan et al.「Too Consistent to Detect: A Study of Self-Consistent Errors in LLMs」EMNLP 2025。使用内容:複数回で同じ誤答が続くself-consistent errorと再現性・正確性の区別。DOI:10.18653/v1/2025.emnlp-main.238。
URL: https://aclanthology.org/2025.emnlp-main.238/
