検索ブランド相談室 | 検索と評判の専門メディア

面接官ごとの評価ばらつきを監査する方法|採点差・通過率・コメント傾向を比較

部署:人事・採用担当者部署:経営者・責任者レベル:実践採用 DX、業務効率化採用マーケティング
同じ候補者の評価シートに異なる点数を付ける複数の面接官の手元と、面接官評価のばらつきを示したアイキャッチ

構造化面接の評価シートを作成しても、それだけで面接官の評価がそろうとは限りません。同じ5段階評価でも、「3」を標準と考える人と「4」を標準と考える人がいれば、選考結果は面接官の割り当てによって変わります。

面接工程を含む採用ファネル全体の指標体系と、測定結果を改善へつなげる考え方は、[採用改善の効果測定とPDCAの全体像](https://rebranding.co.jp/media/recruiting-measurement/)で整理しています。

確認すべきなのは、評価シートの有無ではなく、実際の選考データで評価基準が同じように使われているかです。

面接官別の平均点、通過率、評価項目別の採点差、コメントの根拠を比較すると、「全体的に甘い」「特定項目だけ厳しい」「点数は同じでも判断根拠が違う」といった問題を切り分けられます。

この記事では、構造化面接を導入した後に評価のばらつきを監査し、改善対象と優先順位を決める方法を解説します。

面接官評価のばらつきは「平均点」だけでは判断できない

面接官ごとの評価差を確認するとき、最初に平均点だけを見るのは不十分です。

例えば、面接官Aの平均点が3.8、面接官Bが3.3だったとしても、Aが優秀な候補者を多く担当していただけかもしれません。反対に平均点がほぼ同じでも、候補者ごとの採点や評価項目を見ると大きく判断が異なる場合があります。

そのため、最低でも次の4つを組み合わせて確認します。

監査項目 確認すること 主に分かる問題
平均評価点 面接官ごとの平均点 全体的な甘さ・厳しさ
通過率 面接官別の合格・通過割合 合否判断の甘辛
評価項目別の点数 主体性、論理性など項目別平均 特定項目の解釈差
コメント 点数の根拠として何を書いているか 評価基準の理解差

面接官評価のばらつきを平均評価点、通過率、評価項目別点数、コメントの4指標で監査する構造図

平均点だけでは評価基準のずれは判断できません。通過率、評価項目別の点数、コメントまで組み合わせて確認します。

さらに、同じ候補者を複数の面接官が評価している場合は、候補者単位の採点差も確認します。

採用面接に関する研究でも、面接官同士の評価がどの程度一致するかを示す「評価者間信頼性」は重要な論点です。日本企業の新卒採用データを分析した研究では、面接官の組み合わせによって評価者間信頼性に幅があり、一律に高い一致が確認されたわけではありません。

つまり、評価シートを配布したことではなく、実際の評価結果がどの程度そろっているかまで確認する必要があります。

構造化面接でも評価のばらつきは残る

構造化面接とは、候補者に共通した質問を行い、同じ評価尺度と基準を使って回答を評価する方法です。

米国人事管理庁(OPM)も、構造化面接では全候補者に同じ質問を行い、同じ評価尺度と基準で評価することを基本としています。また、構造化の程度が高い面接ほど、評価者の一致度や信頼性が高くなる傾向を説明しています。

ただし、共通の質問や評価表があることと、面接官がその基準を同じ意味で使えることは別です。

例えば「主体性」を5段階で評価するときでも、次のような違いが発生します。

  • 面接官A:自分から提案した経験があれば4点
  • 面接官B:提案後に周囲を動かした実績までなければ3点
  • 面接官C:成果につながって初めて4点

評価項目名と5段階の数字だけを共通化しても、各点数に対応する具体的な行動が定義されていなければ、採点基準は面接官の頭の中に残ります。

OPMも、評価尺度を設計する際には、能力レベルごとの行動例や状況例を設定し、質問ごとの採点方法を決めることを推奨しています。

面接官の評価ばらつきは4つの指標で監査する

実務では、次の順番で監査すると原因を切り分けやすくなります。

1.面接官別の平均評価点を見る

最初に面接官ごとの平均評価点を並べます。

例として5段階評価の場合、次のような表を作ります。

面接官 面接件数 平均点
A 28 3.8
B 31 3.4
C 26 2.9
D 30 3.5

Aだけ高く、Cだけ低ければ、評価の甘辛が異なる可能性があります。

ただし、担当した候補者の属性、職種、選考段階が異なる場合は単純比較できません。

「同じ職種」「同じ選考段階」「同じ評価シート」など、条件をそろえて比較することが重要です。

2.面接官別の通過率を比較する

次に、面接官別の通過率を確認します。

面接官 面接件数 通過人数 通過率
A 28 20 71%
B 31 17 55%
C 26 9 35%
D 30 17 57%

平均点と通過率を組み合わせると問題を見つけやすくなります。

例えばAは平均点も通過率も高い一方、Cは両方とも低い場合、Aが相対的に甘く、Cが厳しい可能性があります。

ただし、通過率そのものに「正しい数値」はありません。

母集団や候補者の質が異なるため、「全社平均から何%離れたら異常」と機械的に決めるのではなく、差が大きい面接官を追加確認するための警告指標として使います。

3.評価項目別に採点差を分解する

平均点に差があったら、次は評価項目ごとに分解します。

評価項目 面接官A 面接官B 面接官C
論理的思考 3.5 3.4 3.3
主体性 4.2 3.4 2.8
協働性 3.7 3.6 3.5

この例では、論理的思考と協働性は大きく変わりません。一方、主体性ではAとCの差が1.4点あります。

この場合、「面接官Aは甘い」とまとめるより、「主体性の評価基準についてAとCで解釈が異なる可能性がある」と判断した方が改善策を決めやすくなります。

評価基準の改善では、「3点」「4点」といった数字だけではなく、それぞれの点数に該当する具体的な行動を定義します。

4.コメントが点数の根拠になっているか確認する

最後に面接コメントを確認します。

点数だけでは、なぜその評価になったのか分かりません。

例えば「主体性4点」に対して、次の2種類のコメントでは品質が大きく異なります。

根拠が弱いコメント

  • 積極的だった
  • 印象が良かった
  • リーダーシップがありそう

根拠を確認できるコメント

  • 前職で顧客対応の問題を自ら整理し、上司へ改善策を提案した
  • 提案後に3名のメンバーと役割分担し、運用変更まで進めた
  • 本人の行動と結果を追加質問で確認した

OPMも、構造化面接の記録では、候補者の回答内容を記録し、職務に関係する回答を一貫した方法で採点することを重視しています。候補者の外見や印象など、評価対象ではない情報を採点根拠に含めるべきではないとしています。

したがって、コメント監査では文章量ではなく、点数につながった候補者の発言・行動事実が記録されているかを確認します。

面接官ごとの問題を4タイプに分類する

平均点、通過率、項目別評価、コメントを組み合わせると、問題を4タイプに整理できます。

タイプ データの特徴 主な原因候補 改善方法
全体的に甘い 平均点・通過率とも高い 評価水準が低い 採点例の再共有
全体的に厳しい 平均点・通過率とも低い 合格基準を高く解釈 合否基準の再確認
特定項目だけずれる 一部評価項目のみ差が大きい 項目定義の解釈差 行動アンカーを修正
根拠が弱い 点数は付くがコメントに事実が少ない 印象評価・記憶依存 記録ルールを改善

面接官の評価ばらつきを全体的に甘い、厳しい、特定項目だけずれる、根拠が弱いの4タイプに分類した図

面接官の評価差は一種類ではありません。データの特徴から4タイプに分けると、修正すべき評価基準や運用ルールを判断しやすくなります。

重要なのは、「評価が違う面接官=能力が低い面接官」と決めつけないことです。

候補者の割り当て、評価項目の定義、質問方法、面接記録、選考段階など、仕組み側に原因がある場合もあります。

同じ候補者を複数人が評価している場合は採点差を直接確認する

複数の面接官が同じ候補者を評価するパネル面接などでは、より直接的に評価差を確認できます。

例えば、同じ候補者に対して次の評価になったとします。

候補者 面接官A 面接官B 点差
候補者1 4 4 0
候補者2 5 3 2
候補者3 3 2 1
候補者4 4 2 2

同じ候補者に対する面接官Aと面接官Bの採点差を候補者ごとに比較した監査イメージ

同じ候補者を複数の面接官が評価している場合は、候補者単位の点差から評価基準のずれを直接確認できます。図中の数値は監査方法を説明する例です。

点差が大きい候補者について、評価項目とコメントを見直します。

面接研究でも、同じ対象に対して複数の評価者がどの程度一致するかは重要な品質指標です。

Huffcuttらが125の信頼性係数、合計32,428人を対象に行ったメタ分析では、評価者間信頼性の平均値は、パネル面接で.74、異なる面接官が別々に実施する面接で.44でした。面接形式によって評価の一致度が異なり得ることを示しています。

別の構造化面接研究では、質問を職務分析に基づいて作成し、回答の採点尺度に具体例を設けるなど高度に構造化した面接で、149人を対象に評価者間信頼性.88が報告されています。

これらは特定条件下の研究結果であり、すべての企業で同じ数値になるわけではありません。しかし、構造化の設計と実際の評価一致度を別々に確認する必要性を示しています。

面接官評価監査は「異常値を処罰するため」ではなく基準を修正するために使う

監査結果は、面接官ランキングを作るためではありません。

目的は、評価基準がどこで違って解釈されているかを発見し、次回の面接で同じ判断ができる状態へ近づけることです。

例えば主体性の評価で差が大きければ、実際のコメントを匿名化して面接官同士で比較します。

  • この回答を3点とした理由は何か
  • 4点にするには何が必要か
  • どの発言を評価根拠にしたか
  • 追加質問で何を確認するべきだったか

この議論を行い、評価シートの説明や行動アンカーを修正します。

面接官へ他の評価者との差をフィードバックする方法にも研究があります。構造化面接において、自分の評価と全体の平均的な評価との差を示すフィードバックを行った研究では、特に評価が甘い、または厳しい面接官の評価差が縮小しました。研究者らは、こうしたフィードバックが評価者間の差を小さくし、信頼性向上に役立つ可能性を示しています。

したがって、監査は一度で終わらせず、

監査 → 原因確認 → 基準修正 → 面接官への共有 → 再測定

までを一つの改善サイクルとして設計します。

面接官評価を監査し、原因確認、基準修正、面接官への共有、再測定を繰り返す改善サイクル

評価差の監査は面接官を順位付けするためではありません。差が生じた理由を確認し、評価基準を修正して再測定するところまでを一つの改善サイクルとして運用します。

初回監査では5つの列をそろえれば始められる

高度な採用分析ツールがなくても、次のデータがあれば基本的な監査は可能です。

  • 面接官ID
  • 候補者ID
  • 評価項目ごとの点数
  • 合否または次工程への通過結果
  • 面接コメント

職種、求人、面接日、選考段階も記録できれば、比較条件をそろえやすくなります。

最初から複雑な統計分析を行う必要はありません。

まずは、同じ求人・同じ選考段階について、

  1. 面接官別の件数を集計する
  2. 平均点を比較する
  3. 通過率を比較する
  4. 評価項目別の平均点を比較する
  5. 差が大きい項目のコメントを確認する

という順番で進めます。

件数が極端に少ない面接官の数値は偶然の影響を受けやすいため、少数データだけで評価基準の良し悪しを断定しないことも重要です。

監査で差を見つけた後の改善優先順位

すべての差を同時に修正する必要はありません。

次の順番で優先すると、選考結果への影響が大きい問題から対応できます。

優先度1:合否を左右する項目の評価差

必須要件や合否判定に強く影響する項目で面接官差が大きければ、最優先で修正します。

優先度2:複数の面接官で繰り返し発生している差

一人だけではなく複数人で同じ解釈差が発生している場合、個人ではなく評価シートの設計に問題がある可能性があります。

優先度3:点数とコメントが一致していない評価

高評価なのに根拠となる行動事実が記録されていない場合は、評価記録のルールを見直します。

優先度4:少数案件だけに発生した差

件数が少ないものは、追加データを集めてから判断します。

面接官評価は定期的に再監査する

一度評価基準をそろえても、新しい面接官が参加したり、採用要件や職種が変わったりすれば評価差は再び発生します。

そのため、面接官研修の実施回数だけを管理するのではなく、研修後に実際の評価データがどう変化したかまで確認します。

例えば四半期や採用期ごとに、

  • 面接官別平均点
  • 面接官別通過率
  • 評価項目別のばらつき
  • 同一候補者の採点差
  • コメントに根拠が記録されている割合

を再確認します。

構造化面接は「質問表と評価シートを作って完成する仕組み」ではありません。

質問、評価基準、実際の採点結果を継続的に確認し、ずれを修正することで標準化の効果を維持できます。

まとめ

構造化面接を導入した後は、評価シートが使われているかだけではなく、評価基準が面接官ごとに同じように運用されているかを確認する必要があります。

最初に確認したいのは、次の4点です。

  • 面接官ごとの平均評価点
  • 面接官ごとの通過率
  • 評価項目ごとの採点差
  • コメントに残された評価根拠

差が見つかったら、単純に「面接官の評価が間違っている」と判断するのではなく、候補者の割り当て、評価項目の定義、行動アンカー、質問方法、コメントルールまで確認します。

そのうえで、監査、原因確認、評価基準の修正、面接官へのフィードバック、再測定までを繰り返すことが重要です。

評価シートを作ることは標準化のスタートです。実際の採点データまで監査して初めて、「同じ評価基準が現場で機能しているか」を確認できます。

参考文献・データ元

無料相談はこちら