コラム

評価軸の解釈が分かれると、同じ回答でも面接官によって点数が分かれる

同じ評価軸を使っていても、読み方が人によって違えば、点数は誰が評価したかで変わります。面接官の傾向を含む点数は、ただ集めても比べられず、入社後の結果で確かめることもできません。人とAIの評価のズレから、解釈が分かれる箇所を見つけて直す意味をまとめました。

問題

解釈が分かれる評価軸は、3つの問題を起こす

同じ評価軸を使っていても、その読み方が人によって違うことがあります。そうした評価軸は、次の3つの問題を起こします。

01

誰が面接したかで、合否が変わる

同じ回答でも、面接官によって加点にも減点にもなりえます。合否の線の近くでは、その差で結果が変わります。

02

点数を集めても、比べられない

面接官や時期が違えば、面接官の傾向も変わり、同じ点数でも中身が別物です。去年と今年の点数を並べても、比べたことになりません。

03

入社後の結果で確かめられない

選考時の点数と入社後の評価を突き合わせても、評価軸が正しかったのか、面接官の読み方の違いなのかを分けられません。

入社後の結果で確かめるときの考え方は「面接の評価が正しかったかは、入社後にしか分からない」にまとめています。

研究結果

人の評価は、評価される人より、評価する人を映しやすい

Scullen氏らが2000年に、入社後の人事評価を分析した研究を発表しています。管理職2,350人と2,142人の2組のデータで、1人ずつを、上司2人・同僚2人・部下2人・本人の計7人が評価しています。評価のばらつきのうち、評価する人ごとの癖で説明できる部分は62%と53%で、評価される人の実際の働きぶりで説明できる部分は21%と25%でした。言い換えると、点数の違いの半分以上は誰が評価したかで生まれていて、本人の働きぶりの違いで生まれていた部分は4分の1ほどでした。点数は、評価される人よりも、評価する人を映していたことになります。

面接でも、評価は面接官によって分かれます。Huffcutt氏らが2013年に発表した分析では、面接官どうしの評価の相関は、同じ面接に同席した場合で平均0.74、それぞれ別の回に面接した場合で平均0.44でした。相関は−1から1の値で、1に近いほど、2人の評価がそろうことを表します。言い換えると、別々に面接すると評価は分かれやすく、同じ面接に同席すると似た評価になりやすい、ということです。ただし、同席して同じ回答を聞いていても、2人の評価が完全にそろうわけではありません。

国内の新卒採用でも、同じ傾向が報告されています。鈴木氏が2016年に発表した研究は、国内のソフトウェア開発会社の新卒採用で、最終面接の評価を調べました。取締役と事業部長の2人が、「社会人の態度」「対人関係力」「性格の適合度」「誠実さ」「業績創出可能性」の5つの評価軸で、それぞれ0〜8点を付けています。2人の評価の順位相関は、最も高い「性格の適合度」で0.41、「社会人の態度」「対人関係力」「誠実さ」は0.23〜0.25でした。「業績創出可能性」は0.04で、2人の評価に関係は見られませんでした。同じ候補者を評価しても、2人の評価は多くの評価軸で弱くしかそろわず、入社後の成果を見通す評価軸では、ほとんどそろいませんでした。

今城氏は2010年の学会発表で、職種を決めずに採用する日本の新卒採用は、特定の職務に対して人を評価する欧米よりも、面接官ごとの違いが出やすいと考え、面接官の職務経験と、重視する人物特徴の関係を調べました。営業の経験が長い面接官とそうでない面接官とでは、重視する人物特徴に違いが見られました。

評価軸に書かれていないものも、評価に入り込みます。Barrick氏らが2009年に発表したメタ分析は、候補者の外見、印象をよく見せる振る舞い、話し方やしぐさと、面接官の評価との関係を調べました。その影響は構造化されていない面接ほど大きく、面接で見えたものが入社後の働きぶりと一致するとは限らない、と結論づけています。

出典:Scullen, S. E., Mount, M. K., & Goff, M. (2000). Understanding the latent structure of job performance ratings. Journal of Applied Psychology, 85(6), 956–970. https://doi.org/10.1037/0021-9010.85.6.956/Huffcutt, A. I., Culbertson, S. S., & Weyhrauch, W. S. (2013). Employment interview reliability: New meta-analytic estimates by structure and format. International Journal of Selection and Assessment, 21(3), 264–276. https://doi.org/10.1111/ijsa.12036/Barrick, M. R., Shaffer, J. A., & DeGrassi, S. W. (2009). What you see may not be what you get: Relationships among self-presentation tactics and ratings of interview and job performance. Journal of Applied Psychology, 94(6), 1394–1411. https://doi.org/10.1037/a0016532/鈴木智之(2016). 面接評定要素に着目した採用選考面接の評価者間信頼性の実証分析. 日本労務学会誌, 17(1), 69–91. https://doi.org/10.24592/jshrm.17.1_69/今城志保(2010). なぜ採用面接時の評価観点は面接者間で異なるのか―面接者の職務経験の違いによる影響―. 日本グループ・ダイナミックス学会 2010年大会 発表論文. https://www.recruit-ms.co.jp/research/thesis/pdf/2010jgda.pdf

気づきにくい理由

人どうしの解釈のズレは、見えにくい

人どうしの評価のズレは、面接官ごとの甘辛と混ざるので、評価軸の読み方の違いだけを取り出しにくくなります。同じ候補者を複数の面接官が評価する機会も、多くはありません。1人の面接官の点数だけを見ても、その面接官が評価軸をどう読んでいるかは分かりません。

AIの特徴

AIは評価軸を書かれたとおりに読むので、ズレを見る起点になる

AIは、評価軸の文面と、記録に残った発言だけを手がかりに採点します。話しぶりや外見は採点に使わず、評価軸に書かれていない基準も持ち込みません。人とAIが同じ評価軸で採点すれば、AIの点数は、評価軸を書かれたとおりに当てはめた結果として、人の点数と比べる起点になります。生成AIの点数も毎回まったく同じとは限りませんが、はっきりした回答では、ほとんど動きません。

発生例(説明のための例です)

主体的に動いた経験(L5:行動・相手・結果がそろっている/L3:行動は述べているが、結果が分からない)

前職では、問い合わせが急に増えた時期に、対応の手順を自分でまとめてチームに共有しました。

AIの採点

3点

行動は述べているが、結果が分からないため、L3にあたる。

人の採点

4点

数字は出ていないが、話しぶりから、成果を出していそうだと感じた。

人は、評価軸に書かれていない推測で、一段高く読んでいます。

ズレの読み方

ズレは、3つの出方で読み分ける

人とAIの点数がズレたときは、ズレの出方を見ると、何が起きているかを読み分けられます。

01

全体に、人の点数が高い・低い

どの評価軸でも人の点数が高い、あるいは低いなら、評価軸の問題ではなく、面接官ごとの甘辛です。

02

特定の評価軸だけでズレる

一部の評価軸でだけズレが続くなら、その評価軸の説明が読み手によって違う解釈を許している可能性があるため、見直しの候補となります。

03

特定の候補者だけでズレる

一部の候補者でだけズレるなら、人は話し方や雰囲気など、記録に残らないものを見ている可能性があるため、評価根拠が妥当であるかを点検する材料になります。

そろえる価値

解釈がそろえば、点数は自社の資産として積み上がる

ズレた箇所は、書かれた評価軸を起点に直します。人の判断に理由があるなら、その基準を評価軸に書き足して言葉にします。理由がなければ、人の採点を評価軸にそろえます。こうして解釈がそろうと、次のことができるようになります。

01

誰が面接しても、同じ物差しで判断できる

面接官が替わっても、合否の線の意味が変わりません。新しい面接官も、同じ評価軸を読めば同じように採点できます。

02

点数を、時期をまたいで比べられる

同じ点数が同じ意味を持つので、点数を集めるほど、判断の材料が増えていきます。

03

入社後の結果で、評価軸を確かめられる

面接官の読み方の違いが小さくなるほど、評価軸そのものが正しかったかを確かめやすくなります。

書き換えた評価軸は、過去の面接で試せます。詳しくは「評価軸を書き換えたら、過去の面接で試せる」にまとめています。

人とAIの評価を比べられる条件

人とAIが同じ評価軸を使えるから、ズレを比べられる

人とAIの点数を比べられるのは、人の評価シートとAIの評価軸が、同じ言葉で書かれているときだけです。評価軸がサービス側で決まっている場合、AIの評価軸と自社の評価シートは別の言葉になり、同じ基準で並べられません。

Proomiでは、評価軸を自社の言葉で書けます。人も同じ評価軸で点数を付けられるので、評価軸ごとに、AIの点数と並べて見られます。

比較のポイント

人とAIの評価を比べられるかは、3点で確かめる

AI面接サービスを比べるときは、次の3点を確かめると、人とAIの評価をそろえていけるかが分かります。

01

人も、AIと同じ評価軸で点数を残せるか

評価軸が別々なら、人とAIのズレを比べられません。

02

AIの点数に、根拠が残るか

根拠があれば、どの発言の読み方でズレたのかを確かめられます。

03

人とAIの点数を、評価軸ごとに並べて見られるか

合計点だけでは、どの評価軸でズレているかが分かりません。

Q&A

よくある質問

人とAI、どちらの点数が正しいのですか

どちらとも決まっていません。AIの点数は、評価軸を書かれたとおりに当てはめた結果です。人の点数とズレたときに、どちらに基準を置くかは自社が決めます。その判断を、評価軸の言葉に残していきます。

ズレは、なくすべきですか

ゼロにする必要はありません。特定の候補者でだけ出るズレは、人が記録に残らないものを見ているしるしで、人が確かめるべき情報かもしれません。そろえたいのは、評価軸の読み方のズレです。

どのくらいの件数で、傾向が見えますか

1件ずつのズレでは、たまたまかどうかが分かりません。まとまった件数で、評価軸ごとに、ズレの向きが続いているかを見てください。

次に読む

解釈が分かれる箇所を直したら、過去の面接で試す

解釈が分かれる箇所を書き直したら、過去の面接で試せます。点数が候補者を分けているかも、あわせて確かめておくと、どの評価軸から直すかを決めやすくなります。

再採点

評価軸を書き換えたら、過去の面接で試せる →

書き換えた評価軸で過去の面接を採点し直し、点数の変化を見る。

分布

評価軸の数は、判断材料の数ではない →

点数が一部に集まる理由を、国家公務員の人事評価の公開データで確かめる。

関連ページ

場面ごとの使い方

解釈のずれは、拠点の多い採用や面接官の育成でも同じように起きます。

標準化

評価標準化 →

評価軸を先に決め、面接官による評価のぶれを抑える。

拠点

多拠点採用 →

拠点が増えても、採用基準を一つに保つ。

練習

採用面接の練習 →

候補者役のAIを相手に、面接の練習を何度でも。

いまの評価軸を、一度そのまま見せてください

お持ちの評価軸のうち、読み手によって解釈が分かれやすいのはどこかを、一緒に確かめます。無料・約30分。