信頼性は「測定の一貫性(何度測っても同じ結果か)」、妥当性は「測りたいものを正しく測れているか」を指します。信頼性が高くても妥当性が低いことはあり、両方そろって初めて測定の質が担保されます。尺度研究では両者を分けて検証します。
信頼性と妥当性はどう違いますか?
信頼性とは、同じ対象を同じ方法で繰り返し測定したときに、どれだけ一貫した結果が得られるかを示す指標である。妥当性とは、その測定方法が本当に測りたい概念を測れているかを示す指標である。的当てに例えると、信頼性は矢が同じ場所に集まっているかどうか、妥当性は矢が的の中心に当たっているかどうかにあたる。矢が同じ場所に集まっていても(信頼性が高くても)、それが的外れな場所なら妥当性は低い。
たとえば「体重計で身長を測る」ことを考えると分かりやすい。同じ体重計で複数回測れば毎回同じ値が出るため信頼性は高いが、測りたいのが身長である以上、体重計というツール自体が妥当性を欠いている。逆に精度の低い巻き尺で身長を測ると、毎回微妙に異なる値が出て信頼性は低いが、測ろうとしている対象(身長)自体は正しく捉えており妥当性はある。この2軸は独立して検討する必要がある。
妥当性にはどんな種類がありますか?
妥当性は目的に応じていくつかの種類に分けて検証される。
| 種類 | 確認する内容 | 主な検証方法 |
|---|---|---|
| 内容妥当性 | 測定項目が概念の内容を過不足なく網羅しているか | 専門家によるレビュー |
| 基準関連妥当性 | 既存の基準(他の尺度や将来の結果)と関連するか | 既存尺度との相関、予測的中率 |
| 構成概念妥当性 | 理論的に想定される構成概念を正しく測れているか | 因子分析、既知集団法 |
| 表面的妥当性 | 回答者から見て測定内容が妥当に見えるか | 回答者への確認 |
基準関連妥当性はさらに、既存の尺度や現在のデータと比較する「併存的妥当性」と、将来の結果を予測できるかを確認する「予測的妥当性」に分けられる。たとえば新しい学習意欲尺度を作った場合、既存の学習意欲尺度との相関を見るのが併存的妥当性の検証、その後の成績向上を予測できるかを見るのが予測的妥当性の検証にあたる。

信頼性はどうやって確認しますか?
信頼性の確認方法は主に3つある。1つ目は内的整合性(項目間の一貫性)で、クロンバックのα係数で数値化するのが一般的である。2つ目は再検査信頼性で、同じ対象に時間を空けて同じ調査を行い、結果の相関を確認する。3つ目は評定者間信頼性で、複数の評価者が同じ対象を評価した結果の一致度を確認する方法であり、質的研究のコーディング作業などで用いられる。
アンケートの妥当性を高めるには?
研究用アンケートの妥当性を高めるには、先行研究で使用実績のある尺度を活用する、専門家によるレビューを受ける、本調査の前にプレテストを実施して回答のしやすさを確認する、といった手順が有効である。研究計画書の段階で測定方法の妥当性をどう担保するかを明記しておくと、審査でも説得力が増す(研究計画書の書き方)。
信頼性と妥当性はどちらが重要ですか?
信頼性は妥当性の必要条件であるが、十分条件ではない。妥当性がない測定はどれだけ信頼性が高くても意味を持たないため、まず測りたい概念を正しく捉えられているか(妥当性)を検討し、そのうえで一貫して測定できるか(信頼性)を確認する順序が実務的である。量的研究・質的研究のいずれを選ぶ場合でも、この2つの観点は共通して必要になる(質的研究と量的研究の違い)。使用する尺度や分析手法の全体像は研究方法の選び方とあわせて確認するとよい。
よくある質問
信頼性と妥当性はどちらが重要ですか?
妥当性がなければ信頼性が高くても意味を持たない。まず測りたい概念を正しく捉えられているか(妥当性)を検討し、そのうえで一貫して測定できるか(信頼性)を確認する。
妥当性にはどんな種類がありますか?
主に内容妥当性・基準関連妥当性・構成概念妥当性・表面的妥当性の4種類がある。それぞれ専門家レビューや因子分析など異なる方法で検証する。
信頼性はどうやって確認しますか?
クロンバックのα係数による内的整合性の確認、再検査信頼性、評定者間信頼性の3つが代表的な方法である。
アンケートの妥当性を高めるには?
先行研究で実績のある尺度を使う、専門家レビューを受ける、プレテストで回答のしやすさを確認する、といった手順が有効である。
