【心理統計】基本的な用語や統計の種類・選び方を分かりやすく解説

心理統計には、t検定、χ²検定、分散分析、因子分析、重回帰分析…

とたくさんの手法があります。

 

「名前は知っているけれど、どれをいつ使うのか分からない」

そう感じている人は多いはずです。

 

じつは手法選びは、たった3つの質問に答えるだけでほぼ絞り込めます

この記事では、まず選び方の全体像を示し、そのうえで基本用語とケース別の使い分けを解説します。

公認心理師として実務・研究に触れてきた立場から、つまずきやすいポイントも一緒にまとめました。

 

【あわせて読みたい】

心理統計の手法選びは「3つの質問」で決まる

【心理統計】基本的な用語や統計の種類・選び方を分かりやすく解説

統計手法は「データの種類」「知りたいこと」「群の数と対応の有無」の3つで決まります。

 

いきなり手法名から考えるとこんがらがります。

逆に、この3つを順に答えていけば、候補は自然と1つか2つに絞られます。

ステップ1:そのデータは何尺度か?

まず、扱うデータの「尺度水準」を確認します。

尺度水準とは、その数値がどこまでの意味を持っているかを表す分類です。

たとえば、「徒競走の順位」の1位・2位・3位は、ただの順位で、足し算しても意味がありません。

一方、「反応時間」の1秒・2秒は、足しても引いても意味があります。

4つの尺度水準

① 名義尺度:「区別する」だけ

数字は単なるラベルです。大小も順序もありません。性別、血液型、診断名、所属など。

1番と2番のどちらが「上」かは決められないので、平均も順位も出せません。

使える代表値は「最頻値」だけです。

② 順序尺度:「順番」に意味がある

大小関係はわかりますが、間隔が等しい保証はありません。成績の順位、重症度(軽症・中等症・重症)、満足度の5段階など。

1位と2位の差が、2位と3位の差と同じとは限りませんよね?

だから、足し引きはできず、「真ん中の値=中央値」までが使えます。

③ 間隔尺度:「差」に意味がある

目盛りの間隔が等しいので、引き算に意味が出てきます。知能指数、偏差値、摂氏温度など。

ただし、0が「無い」を意味しない(0℃でも熱はある)ので、比には意味がありません。摂氏20度は10度の「2倍暑い」わけではないのです。

ここから「平均値」が使えます。

④ 比率尺度:「比」にも意味がある

0が「まったく無い」を意味する、絶対的な原点を持つ尺度です。反応時間、身長、体重、回数、正答数など。

0秒は「時間がかからなかった」という真の0。だから2秒は1秒の2倍と言えます。

平均値も比も、すべて使えます。

まとめ表

尺度水準 意味を持つ操作 使える代表値
名義尺度 区別のみ 性別・血液型・診断名 最頻値
順序尺度 区別+順序 成績の順位・重症度 中央値まで
間隔尺度 +差(引き算) 知能指数・偏差値・摂氏温度 平均値
比率尺度 +比(割り算) 反応時間・身長・回数 平均値+比

上にいくほど情報量が少なく、下にいくほど多くなります。

上の尺度の手法は下でも使えますが、逆はできません。

分析手法との対応

平均値を扱うt検定や分散分析は、間隔尺度以上が前提です。

名義尺度のデータで平均を出しても意味がないので、この場合はχ²検定に進みます。

なお、知能指数や偏差値を間隔尺度に分類するのは心理学の慣習で、「もとの得点が等間隔である」という仮定に基づく扱いです。

同じく、心理尺度でよく使う5件法・7件法(リッカート尺度)も厳密には順序尺度ですが、合計得点は慣習的に間隔尺度とみなして分析するのが一般的です。

ステップ2:知りたいのは「差」か「関連」か「構造」か

次に、リサーチクエスチョンの型を確認します。

  • 差を知りたい → t検定、分散分析、χ²検定
  • 関連の強さを知りたい → 相関係数
  • 予測・影響力を知りたい → 回帰分析(独立変数が1つなら単回帰分析、複数なら重回帰分析)
  • 項目の背後にある構造を知りたい → 因子分析

「A群とB群で点数が違うのか」なら差の検定です。

「Aが増えるとBも増えるのか」なら相関です。

ステップ3:群はいくつ? 対応はあるか?

差を検定する場合は、最後に群の数と「対応の有無」を確認します。

対応ありとは、同じ人から複数回データを取っている状態のことです。

 

たとえば、同じ参加者の研修前と研修後の得点なら対応あり。

別々の50人ずつを比べるなら対応なしです。

 

ここを取り違えると、検定そのものが誤りになります。

A clean vertical decision-tree flowchart diagram, minimal flat vector infographic style. Three sequential decision diamonds branching downward into rounded rectangle endpoint boxes, connected by thin straight lines with small arrowheads. Deep navy nodes, soft slate grey connectors, one muted teal highlighted path. Plenty of white space, no text, no letters, no numbers, placeholder blank shapes only. Academic, professional, uncluttered. 1080x1350.

 

【一覧表】心理統計の主な手法と使う場面

【ケース別】統計の選び方

先に全体像を押さえておきましょう。

細かい解説はこのあとのケース別セクションで扱います。

目的 使う手法
尺度の信頼性を確かめる クロンバックのα係数
2群の平均値を比べる t検定(対応あり/なし)
3群以上の平均値を比べる 一元配置分散分析+多重比較
2要因の組み合わせを見る 二元配置分散分析(交互作用)
2変数の関連の強さを見る 相関係数(ピアソン/スピアマン)

 

目的 使う手法
人数の偏りを調べる χ²検定(カイ二乗検定)
多数の項目を分類・整理する 因子分析
複数の要因の影響力を比べる 重回帰分析
正規分布が仮定できない ノンパラメトリック検定
全数調査が難しい 無作為抽出+推測統計

先におさえたい心理統計の基本用語

手法の話に入る前に、土台となる用語を整理します。

すでに知っている人は、次の「ケース別」から読んでいただいて大丈夫です。

独立変数・従属変数・剰余変数

一言で言うと、独立変数は「原因の候補」、従属変数は「結果」、剰余変数は「じゃまをする第三の要因」です。

  • 独立変数:効果を検討する側の変数。実験では研究者が意図的に操作する変数を指す
  • 従属変数:実験の結果として得られるデータ(心理学では参加者の反応や回答)
  • 剰余変数:独立変数以外で従属変数に影響しうる変数

たとえば「騒音の大きさが作業の能率に及ぼす影響」を調べる実験を考えます。

操作するのは騒音の大きさなので、これが独立変数。

条件ごとに得られた作業成績が従属変数です。

そして、室温・湿度・照明・時間帯など、成績に影響しかねない要因が剰余変数にあたります。

 

なお調査研究では、性別や自尊心の高低のように操作できない属性を独立変数として扱うこともあります。

その場合は操作をしていないぶん、因果の主張は弱くなります。

 

剰余変数は、無作為割り当て・条件の一定化・カウンターバランスなどで統制します。

ここを放置すると、「騒音のせいで成績が下がった」と言い切れなくなります。

信頼性・妥当性

一言で言うと、信頼性は「測定結果が安定しているか」、妥当性は「測りたいものを測れているか」です。

 

たとえば、大学生の誠実性を調べるために、4月と9月に同じ質問紙で調査したとします。

4月と9月で結果が大きくずれていたら、測定が安定していないので信頼性は低いと判断されます。

一方、そもそも質問項目が「誠実性」を捉える内容になっているかどうかは妥当性の問題です。

 

体重計にたとえると、乗るたびに値が変わるのが信頼性の問題、体重ではなく身長を測ってしまうのが妥当性の問題です。

信頼性が低ければ妥当性も確保できませんが、信頼性が高くても妥当とは限りません。

代表値(平均値・中央値・最頻値)

代表値とは、そのデータを一つの値で代表させたときの典型的な値です。

  • 平均値:データの総和 ÷ データの個数
  • 中央値:小さい順に並べたとき、ちょうど真ん中にくる値
  • 最頻値:もっとも多く出現する値

 

たとえば「1, 2, 2, 2, 4, 6, 10, 12, 14, 20」という10個のデータなら、

  • 平均値=73 ÷ 10 = 7.3
  • 中央値=5番目と6番目(4と6)の平均で 5
  • 最頻値= 2

平均値の7.3は、実際のデータの多くより高い値になっています。

これは10・12・14・20といった右側の大きな値に引っ張られたためです。

つまり、分布が右に裾を引いている状態です。

外れ値がある、あるいは分布が左右に歪んでいるときは、中央値のほうが実態を表します。

年収とかが良い例ですね。

散布度(標準偏差・四分位偏差)

散布度とは、データの散らばり具合を表す値です。

代表値だけでは「平均は同じでもバラつきがまるで違う」2つの集団を区別できません。

  • 標準偏差:各データが平均からどれだけ離れているかの平均的な大きさ。代表値に平均値を使うときに対応する
  • 四分位偏差:第3四分位数と第1四分位数の差を2で割った値。代表値に中央値を使うときに対応する

平均点が同じ60点でも、標準偏差が5点のクラスと20点のクラスでは、指導の打ち手はまったく変わります。

代表値と散布度は必ずセットで見るのが基本です。

相関関係と因果関係はどう違う?

一言で言うと、相関は「一緒に動く」、因果は「一方が他方を引き起こす」ことです。

 

たとえば、一日のメール利用回数と他者への依存度を調べ、「メールが多い人ほど依存度が高い」という結果が出たとします。

このとき両者に相関があるとは言えます。

 

しかし、メールが多いから依存度が高まったのか、依存度が高いからメールが増えたのかは分かりません。

第三の要因(たとえば孤独感)が両方を押し上げている可能性もあります。

 

因果関係を主張するには、時間的な先行関係・共変関係・第三変数の排除という条件が必要です。

そのため、相関関係があっても因果関係があるとは限りません。

 

なお、逆も完全ではありません。

因果があっても、関係が曲線的だったり、別の要因が打ち消していたりすると、相関係数はほぼ0になることがあります。

有意差とp値の正しい意味

一言で言うと、有意差とは「その差が偶然だけでは説明しにくい」と統計的に判断された状態です。

 

手続きはこうです。

まず「差はない」という帰無仮説を立てます。

次に、その仮説が正しいと仮定したとき、観察された結果以上に極端なデータが得られる確率を計算します。

これがp値です。

p値が有意水準(心理学では通常5%)を下回れば、帰無仮説を棄却して「有意差あり」と判断します。

なぜ「差はない」から始めるのか

不思議に思いませんか?

知りたいのは「差がある」ことなのに、統計では必ず「差はない」という帰無仮説から出発します。

理由はシンプルで、「差がある」という仮説では確率が計算できないからです。

たとえば、「この勉強法には効果がある」と言われても、5点上がるのか30点上がるのか決まりません。想定が無限にあるので、計算のしようがない。

一方、「効果はない(差はゼロ)」なら、想定はひとつに定まります。

偶然だけが働く世界を具体的に描けるので、確率が計算できるのです。

だから統計はこう考えます。

まず「偶然だけの世界」を仮定してみる。その世界では、今回のデータはめったに起きないぞ。
→ じゃあ、仮定のほうが間違っていたのでは?

裁判と同じ構造です。

まず「無罪(=差はない)」と仮定し、証拠がそれでは説明できないほど強ければ有罪(=差あり)と判断する。

最初から有罪を証明しにいくのではありません。

p値とは何か:コイン投げで考える

友人が「このコイン、たぶんイカサマだよ」と言い出したとします。

帰無仮説は「ただの公平なコイン(表が出る確率50%)」。

10回投げたら、表が8回出ました。偏っている気はしますが、公平なコインでもたまに起きそうです。

そこで「公平なコインだと仮定したとき、これくらい偏った結果が出る確率」を計算します。

表が8回以上、または裏が8回以上出る確率は、約11%。

これがp値です。

10回に1回は普通に起きるので、「イカサマだ」とまでは言えません。

ではもし、100回投げて80回表だったら?

同じ計算をすると、確率は限りなくゼロに近い値になります。

公平なコインでこれが起きるとは考えにくい。

だから「ただの公平なコインである」という仮定のほうを捨てる。

これが帰無仮説の棄却です。

「以上に極端な」を含める理由

p値の定義に出てくる「観察された結果以上に極端なデータ」という部分。

コインの例で言えば、8回ちょうどではなく、8回・9回・10回をすべて足すということです。

「ちょうど8回」の確率だけを見ると、投げる回数を増やすほど、どんな結果も珍しくなってしまいます。

「これくらい偏っている」という程度を測るには、それより極端な場合をまとめて足す必要があるのです。

有意水準5%の意味

心理学では通常、有意水準を5%に設定します。

これは「偶然だけの世界なら20回に1回以下しか起きない」というラインです。

p値がこれを下回れば帰無仮説を棄却し、「有意差あり」と判断します。

なお5%に絶対的な根拠はありません。 分野の慣習として共有されている基準です。

p値が言っていないこと

ここが最も誤解されるポイントです。

「p値は差の大きさを表す」

p値が小さいほど大きな差、ではありません。

p値は「偶然では起きにくいかどうか」の指標であって、差の大きさとは別物です。

「p = .03 なら仮説が正しい確率97%」

p値は「帰無仮説が正しいと仮定したときの、データの珍しさ」です。

仮説が正しい確率ではありません。 条件が逆向きになっています。

だから効果量が必要になる

決定的な問題がこれです。

サンプルサイズが大きければ、ごくわずかな差でも有意になります。

10,000人を集めれば、平均点が0.3点違うだけでp < .001が出ます。

統計的には「偶然ではない」。でも実務的には、ほぼ意味のない差です。

有意差は「差があるかどうか」しか教えてくれません。

「その差がどれくらい大きいか」を示すのが、次に説明する効果量です。

効果量とは?(p値だけでは足りない理由)

効果量とは、差や関連の「大きさ」そのものを、サンプルサイズに左右されずに表す指標です。

 

効果量は「どれくらい違うのか」に答えます。

指標 目安(小/中/大)
Cohen’s d(平均値差) 0.2/0.5/0.8
η²(分散分析) .01/.06/.14
r(相関) .10/.30/.50

 

APAの論文執筆基準では、検定結果とあわせて効果量を報告することが求められています。

論文でも学会発表でも、「p < .05」だけで終わらせず、効果量と信頼区間まで書くのが現在の標準です。

 

Minimal flat vector infographic comparing two concepts side by side, split screen composition. Left panel: a simple yes/no binary switch icon. Right panel: a graduated measuring ruler or scale bar showing magnitude. Thin connecting divider line down the middle. Deep navy and soft slate grey with a single muted teal accent, generous white background. No text, no letters, no numbers. Clean academic editorial style. 1600x900.

【ケース別】どの統計手法を使えばいい?

ここからは、実際の場面ごとに使う手法を見ていきます。

「こういうことを知りたい」から逆引きできる形にしました。

データの信頼性を測定したい → クロンバックのα係数

新しく作った質問紙の信頼性を検討したいときは、クロンバックのα係数を使います。

 

α係数は「内的整合性」の指標です。

内的整合性とは、そのテストに含まれる項目群が、同じ心理的特性を一貫して測れているかを表す概念です。

 

値は一般に0〜1の範囲に収まり、目安として.70以上が求められます。

尺度によっては.80以上が望ましいとされることもあります。

 

ただし注意点が3つあります。

  • 項目数が多いほど値が高く出やすい(項目を増やせば水増しできてしまう)
  • α係数が高くても、測りたいものを測れている保証(妥当性)にはならない
  • 項目間の共分散が負の場合など、理論上は負の値を取ることもある

近年は、より前提のゆるいω係数(マクドナルドのオメガ)の併用も推奨されています。

全数調査が難しい対象を調べたい → 無作為抽出と推測統計

たとえば「大学生の飲酒頻度」を調べたいとき、全国の大学生全員に調査するのは現実的ではありません。

こうした場合は、母集団から無作為抽出で標本を取り、推測統計によって母集団の姿を推定します。

 

単純無作為抽出とは、母集団のどの人も等しい確率で選ばれるようにする方法です。

「答えてくれそうな人だけに聞く」といった選び方をすると、標本が偏り、母集団を推定できなくなります。

2群の平均値の差を検定したい → t検定

t検定は、2つの群の平均値の差が、偶然のばらつきでは説明しにくいと言えるかを調べる手法です。

たとえば、自尊心が高い群と低い群それぞれ50名ずつで英語の平均点を出し、その得点差が偶然の範囲かを調べたい場合に使います。

 

ここで必ず確認したいのが、対応の有無です。

  • 対応のないt検定:別々の人からなる2群を比べる(例:高自尊心群 vs 低自尊心群)
  • 対応のあるt検定:同じ人の2時点を比べる(例:研修前 vs 研修後)

上の例は別々の50名ずつなので、対応のないt検定になります。

 

また、2群の分散が大きく異なるときは、等分散を仮定しないウェルチのt検定を使います。

近年は、等分散かどうかを事前検定せず、最初からウェルチの検定を用いる方針が広く推奨されています。

3群以上の平均値を比べたい → 分散分析と多重比較

3群以上の平均値を比べるときは、一元配置分散分析(ANOVA)を使います。

たとえばA組・B組・C組という3クラスの英語テストの平均点を比べる場合です。

 

ここで「t検定を3回繰り返せばいいのでは?」と思うかもしれません。

それはやってはいけません。

 

検定を繰り返すほど、本当は差がないのに「差がある」と誤判定する確率が膨らむからです。

有意水準5%の検定を3回行うと、どれか1つが誤って有意になる確率は最大で約14%まで上がります。

※3回の検定が互いに独立な場合の計算値です。3群の総当たり比較のように検定同士が関連する場合はやや小さくなりますが、5%を大きく超える点は変わりません。

 

これを多重性の問題といいます。

そして分散分析で分かるのは、「どこかの群の間に差がある」ということだけです。

どの群とどの群の間に差があるのかを特定するには、多重比較が必要です。

多重比較にはボンフェローニ法、ホルム法、テューキーのHSD法などがあり、いずれも多重性を調整したうえで群同士を比べます。

2つの要因の組み合わせを調べたい → 二元配置分散分析

要因が2つある場合は、二元配置分散分析を使います。

たとえば、文系A組・理系B組(要因1:クラス)× 自尊心の高群・低群(要因2:自尊心)で、英語テストの平均点を比べるようなケースです。

 

このデザインで見るのは3つです。

  • クラスの主効果:クラスによって得点が違うか
  • 自尊心の主効果:自尊心の高低で得点が違うか
  • 交互作用:クラスによって自尊心の効き方が変わるか

 

とくに重要なのが交互作用です。

「文系では自尊心が高いほど得点が高いが、理系ではその傾向がない」といった、組み合わせでしか見えない効果を検出できます。

交互作用が有意だった場合は、主効果の解釈に進む前に単純主効果の検定を行います。

 

たとえば「文系のなかで自尊心の高低による差があるか」を個別に検定するイメージです。

単純主効果が有意で、その要因の水準が3つ以上ある場合は、さらに多重比較を行います。

2つの変数の関連の強さを知りたい → 相関係数

たとえば、インターネットの利用頻度と他者を見下す傾向の関連を調べたいときは、相関係数を使います。

 

相関係数は −1 〜 +1 の値をとります。

  • +1に近い:正の相関(一方が増えると他方も増える)
  • −1に近い:負の相関(一方が増えると他方は減る)
  • 0に近い:直線的な関連は弱い

強さの目安は、|r| が .10 で小、.30 で中、.50 で大とされます。

 

そして、尺度水準に応じて2つを使い分けます。

  • ピアソンの積率相関係数:間隔・比率尺度で、直線的な関係を見るとき
  • スピアマンの順位相関係数:順序尺度のとき、外れ値の影響を抑えたいとき

注意したいのは、ピアソンの相関係数は「直線的な」関係しか捉えられないという点です。

 

「適度な緊張が最も成績が良く、低すぎても高すぎても悪い」といった山型の関係では、増加部分と減少部分が打ち消し合い、相関係数がほぼ0になることがあります。

必ず散布図を描いて、目で確かめてから数値を解釈してください。

人数の偏りを調べたい → χ²検定(カイ二乗検定)

たとえば、「小学生と高校生でシャープペンシルを使っている人の割合に差があるか」を調べたいときは、χ²検定(カイ二乗検定)を使います。

平均値ではなく、人数(度数)の偏りを扱うのがこの検定の特徴です。

 

χ²検定には大きく2種類あります。

  • 独立性の検定:2つの質的変数に関連があるか(学年 × 筆記具の種類など)
  • 適合度検定:観測された度数が、理論的に期待される比率と一致するか

注意点として、期待度数の小さいセルが多いと、χ²検定の近似の精度が落ちます。

 

目安は「期待度数1未満のセルがなく、期待度数5未満のセルが全体の20%以下」です(コクランの基準)。

2×2のクロス表でこれを満たさない場合は、フィッシャーの正確確率検定を使うのが一般的です。

 

効果量は、独立性の検定ではクラメールのV(2×2のクロス表ではφ係数)、適合度検定ではCohen’s wを用います。

多数の項目を整理・分類したい → 因子分析

性格を表す形容詞が数百とあるとき、似た意味のものをまとめて整理したい。

こうした場面で使うのが因子分析です。

因子分析は、多数の観測変数の背後にある共通の潜在因子を探る手法です。

 

キャッテルは、膨大な性格語を因子分析によって16の根源特性に整理しました。

この流れがのちのビッグファイブ(5因子モデル)につながり、パーソナリティ心理学で因子分析が重視されるきっかけになりました。

 

似た手法に主成分分析がありますが、狙いが違います。

  • 因子分析:観測変数を生み出している「見えない原因」を推定する
  • 主成分分析:複数の変数を少数の合成変数にまとめて情報を圧縮する

また、仮説がない段階で構造を探るのが探索的因子分析、あらかじめ想定した構造の当てはまりを検証するのが確証的因子分析です。

複数の要因の影響力を比べたい → 重回帰分析

たとえば、「ビッグファイブの5特性のうち、他者への攻撃性に最も影響するのはどれか」を調べたいときは、重回帰分析を使います。

重回帰分析は、複数の独立変数(説明変数)から1つの従属変数(目的変数)を予測する手法です。

 

影響力の比較には、単位の影響を取り除いた標準偏回帰係数(β)を見ます。

モデル全体がどれだけ説明できたかは、決定係数R²で確認します。

 

なお、独立変数が1つだけの場合は単回帰分析です。

回帰分析という大きな枠の中に、単回帰分析と重回帰分析がある、という関係になります。

 

重回帰分析でとくに注意したいのが多重共線性です。

独立変数どうしの相関が高すぎると、係数が不安定になり、符号が逆転することさえあります。

 

投入前に独立変数間の相関を確認し、VIF(分散拡大要因)でチェックしておきましょう。

正規分布が仮定できないときは → ノンパラメトリック検定

t検定や分散分析は、母集団における誤差が正規分布にしたがうことを前提としています。

サンプルサイズが大きければ中心極限定理により頑健になりますが、小さいときは影響が大きくなります。

サンプルサイズが小さい、順序尺度である、分布が大きく歪んでいる。

こうした場合は、ノンパラメトリック検定に切り替えます。

場面 使う手法
対応なし2群 マン・ホイットニーのU検定
対応あり2群 ウィルコクソンの符号順位検定
対応なし3群以上 クラスカル・ウォリス検定
対応あり3群以上 フリードマン検定

 

順位に置き換えて比較するため外れ値に強い一方、正規分布が成り立つ場面では検出力がやや落ちます。

前提を確認したうえで選ぶことが大切です。

 

Calm minimal editorial illustration of a tidy desk from above: an open notebook, a pen, a laptop showing simple abstract chart shapes, and a cup of coffee. Flat vector style, muted palette of deep navy, warm off-white and soft slate grey with one teal accent. Soft even lighting, generous negative space. No text, no letters, no numbers. Professional and quiet. 1600x900.

心理統計でやりがちな5つの誤解

最後に、実際につまずきやすいポイントを整理します。

論文指導や国家試験でも問われやすい部分です。

誤解1:p < .05 なら効果が大きい

違います。

p値はあくまで「偶然では説明しにくいか」を表すだけです。

サンプルサイズが1万人もあれば、実質的に無意味なほど小さな差でも有意になります。

差の大きさを語りたいなら、効果量を見る必要があります。

誤解2:有意差なし=差がない

これも違います。

「有意差なし」は「差があるとは言えなかった」であって、「差がない」ことの証明ではありません。

 

サンプルサイズが小さすぎて検出できなかっただけかもしれません(第2種の誤り)。

差がないことを積極的に主張したい場合は、同等性検定(TOSTなど)やベイズファクターといった別の枠組みが必要です。

 

そもそも十分な検出力を確保できるサンプルサイズを、事前の検定力分析で設計しておくことが前提になります。

誤解3:相関があるから因果がある

先に述べたとおり、相関があっても因果があるとは限りません。

相関は因果を示す手がかりの一つにすぎず、それだけで因果を主張する根拠にはなりません。

 

「アイスの売上と水難事故は相関する」という有名な例があります。

両方を押し上げているのは気温であって、アイスが事故を起こしているわけではありません。

誤解4:α係数が高ければ良い尺度

α係数が示すのは内的整合性、つまり項目のまとまりの良さだけです。

測りたい概念を測れているか(妥当性)とは別問題です。

 

また、ほぼ同じ内容の項目を並べればα係数は簡単に上がります。

高すぎる値は、項目が冗長であるサインの場合もあります。

誤解5:とりあえずt検定を繰り返す

3群以上あるとき、総当たりでt検定を繰り返すのは典型的な誤りです。

多重性によって、第1種の誤り(本当は差がないのに有意と判断する誤り)の確率が跳ね上がります。

 

3群以上なら、t検定の繰り返しではなく分散分析+多重比較で進めます。

テューキーのHSD法のように、それ単独で多重性を調整できる手法もあります。

いずれにせよ、調整なしのt検定を並べるのは避けてください。

まとめ

心理統計の手法選びは、順番に絞り込めば難しくありません。

要点を整理します。

  1. 手法は「尺度水準」「知りたいこと」「群の数と対応の有無」の3つで決まる
  2. 平均値を比べるなら間隔尺度以上。2群ならt検定、3群以上なら分散分析+多重比較
  3. 人数の偏りを見るならχ²検定、関連の強さなら相関係数、影響力の比較なら重回帰分析
  4. p値は「差があるか」しか教えてくれない。効果量とセットで報告する
  5. 相関は因果ではない。散布図を描いて、必ず自分の目で分布を確かめる

 

人びとが抱える悩みや問題は、時代とともに変化していきます。

だからこそ心理臨床家も、知識を日々アップデートし続けなければなりません。

 

エビデンスにもとづく実践を行うだけでなく、実践から導かれた仮説を適切な統計手法で検証していく。

その積み重ねが、心理学という学問を前に進めていきます。

 

まずは手元のデータについて、「これは何尺度か」と問うところから始めてみてください。

 

参考文献

河合塾KALS監修 坂井剛・宮川純(2021)赤本 公認心理師 国試対策2021 講談社

吉田寿夫(1998)「本当にわかりやすいすごく大切なことが書いてある ごく初歩の統計の本」北大路書房

 

【あわせて読みたい】

 

【このブログを応援する】

にほんブログ村 メンタルヘルスブログ 臨床心理士へ
にほんブログ村

スポンサーリンク

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です

ABOUT US
tetsuya
北海道在住の35歳。 元ホテルマン。30歳で一念発起して、大学に入り直し、心理学を学ぶ。医療機関で実務経験を積んだのち、公認心理師資格を取得。月に5冊以上本を読んだり、論文を読み漁ったりして得た知識をブログでシェアします。