相関関係の求め方を完全解説!公式やExcel関数・見誤らないコツ
売上アップの要因分析やマーケティング施策の効果検証など、ビジネスや研究の現場で「2つのデータの関連性」を正確に把握するスキルの重要性は年々増しています。しかし、いざデータを前にすると「どのような計算をすればいいのか」「出てきた数値をどう評価すべきか」と手が止まってしまう方も少なくありません。
2つのデータの結びつきを数値化する「相関係数」は、基本の計算手順やExcel関数を使えば誰でも手軽に導き出せます。本稿では、統計学の基礎となる公式の仕組みから実務で役立つツールの操作法、そして多くの人が陥りがちな「因果関係との混同」や「疑似相関」の罠を見抜くプロの視点まで余すところなく解説します。
📌 【この記事の重要ポイントまとめ】
- 要点1:相関関係の強さは「-1から+1」の範囲を取る相関係数で表され、ExcelのCORREL関数を使えばわずか数秒で算出可能。
- 要点2:手計算の基本は「共分散」を各データの「標準偏差の積」で割るピアソンの積率相関係数であり、散布図の視覚確認とセットで行うのが鉄則。
- 要点3:「相関がある=因果関係がある」は大誤解であり、第3の要素が潜む疑似相関の見極めが誤った意思決定を防ぐ鍵。
【基礎知識】相関関係とは何か?散布図の見方と「正の相関・負の相関」
相関関係とは、「一方のデータが変化したとき、もう一方のデータも連動して増減する傾向」を指します。例えば「気温が上がるとアイスクリームの売上が伸びる」「勉強時間が増えるとテストの点数が上がる」といった関係が代表例です。
相関の向きと強さを直感的に把握するために欠かせないのが散布図です。横軸(X軸)と縦軸(Y軸)に2つのデータをプロットした際、点の散らばり具合から以下の3つのパターンを読み取ることができます。
1. 正の相関(右上がりの分布):
Xが増加するとYも増加する関係です。グラフ上の点が左下から右上に向かって一直線上に並ぶほど、強い正の相関を示します。
2. 負の相関(右下がりの分布):
Xが増加するとYが減少する関係です。例えば「標高が高くなると気温が下がる」「スマートフォンの利用時間が増えると睡眠時間が減る」といったデータが該当し、点は左上から右下に向かって並びます。
3. 無相関(円形やランダムな分布):
Xの増減がYに影響を与えない状態です。散布図上では点が全体に均等に散らばるか、完全な円・格子状になり、規則的な傾きが見られません。
データ分析を始める際は、いきなり数式に当てはめるのではなく、まず散布図を作成して全体の形状を視覚的に確かめる癖をつけておくと、後述する「外れ値の罠」を未然に回避できます。
【計算手順】ピアソンの積率相関係数の公式と共分散の計算方法
相関の度合いを客観的な数値(-1.00〜+1.00)で定量化する最も一般的な手法が、ピアソンの積率相関係数(通常 $r$ と表記)です。統計学の基礎として知られるこの公式は、以下の構成で成り立っています。
【相関係数の公式】
$r = \frac{s_{xy}}{s_x \times s_y} = \frac{\text{XとYの共分散}}{(\text{Xの標準偏差}) \times (\text{Yの標準偏差})}$
手計算やアルゴリズムを理解するために、算出ステップを3段階に分けて整理します。
ステップ1:各データの平均値と偏差を求める
データXとデータYのそれぞれの平均値を計算します。次に、各データ点から平均値を引いた差(偏差)を出します。
ステップ2:共分散を計算する
Xの偏差とYの偏差を掛け合わせ、その合計をデータ数(またはデータ数-1)で割ります。これが共分散($s_{xy}$)です。共分散がプラスであれば「正の連動」、マイナスであれば「負の連動」を示しますが、データの単位(円、kg、cmなど)に依存するため、単体では強弱を比較できません。
ステップ3:標準偏差で割って規格化する
共分散を「Xの標準偏差」と「Yの標準偏差」の積で割ることで、単位の影響を打ち消し、数値を必ず -1 から +1 の範囲に収める規格化が完了します。
このプロセスを経ることで、異なる単位を持つデータ同士(例:年収と読書量)でも、純粋な結びつきの強さを横並びで比較できるようになります。
【Excel実践】一瞬で算出!CORREL関数を使った相関係数の求め方
実務の現場では、手計算を行う必要はほとんどありません。表計算ソフトのExcel(またはGoogleスプレッドシート)を使えば、組み込み関数で一瞬にして算出が可能です。
使用する関数はCORREL(コリレーション)関数です(PEARSON関数も同じ結果を返します)。
【基本構文】=CORREL(配列1, 配列2)
【具体的な手順】
1. A列にデータ1(例:A2〜A21に広告費)、B列にデータ2(例:B2〜B21に問い合わせ件数)を入力します。
2. 結果を表示させたいセルに =CORREL(A2:A21, B2:B21) と入力し、Enterキーを押します。
3. 即座に「0.82」のような相関係数が算出されます。
【実務で失敗しないための注意点】
・空白セルや文字列の混入: CORREL関数は文字列を自動的に無視しますが、行のズレが発生すると正しく計算されません。2つの範囲の行数は必ず一致させてください。
・エラー値(#DIV/0!): 選択したデータのすべての値が同一(標準偏差が0)の場合、ゼロ除算エラーが発生します。
・データ分析ツールの活用: 3変数以上のデータを一括で処理したい場合は、Excelの「データ」タブにある「データ分析」アドインから「相関」を選択すると、複数の組み合わせをまとめた相関行列をワンクリックで生成できます。
【判断基準】相関係数の目安一覧|数値が示す強さとデータの解釈
算出された数値($r$)がどれほどの強さを持つのか、一般的な学術・ビジネスにおける相関係数の判断基準を整理しました。絶対値($|r|$)の大きさによって次のように分類されます。
| 相関係数の範囲(絶対値) | 相関の強さ | 実務における解釈の目安 |
|---|---|---|
| 0.70 〜 1.00 | 非常に強い相関 | 極めて密接に連動。予測モデルの有力な説明変数になる。 |
| 0.40 〜 0.69 | 中程度の相関 | 明確な関連性が認められる。一般的なマーケティング分析で頻出。 |
| 0.20 〜 0.39 | 弱い相関 | うっすらとした傾向はあるが、他の要因の影響を強く受けている。 |
| 0.00 〜 0.19 | ほとんど相関なし | 連動性はほぼ皆無。2つの変数は独立して動いているとみなす。 |
マイナスの符号がついた場合(負の相関)も同様で、例えば $r = -0.75$ であれば「非常に強い負の相関」と判断します。
ただし、サンプルサイズ(データ数)が極端に少ない(例:5件程度)場合、偶然高い数値が出てしまう点には注意が必要です。統計的に有意かどうかを判断するには、無相関検定(p値の算出)を併用するのが確実です。
【落とし穴】相関関係と因果関係の違い|疑似相関を見分ける実践テクニック
データ分析において最も多くの人が踏み抜いてしまう地雷が、「相関関係と因果関係の混同」です。この2つは似て非なる概念であり、明確に区別しなければ重大な経営判断ミスを招きます。
・相関関係: 2つの事象が「同時に起こりやすい」関係(どちらが原因かは問わない)
・因果関係: 一方の事象(原因)が、もう一方の事象(結果)を「直接引き起こしている」関係
典型的な例が「疑似相関(見かけ上の相関)」です。2つのデータ間に直接のつながりがないにもかかわらず、隠れた第3の要因(交絡因子)が存在することで、あたかも相関があるように見えてしまう現象を指します。
【疑似相関の有名例:アイスクリームと水難事故】
「アイスクリームの売上が増えると、水難事故の発生件数が増加する」という強い正の相関データが存在します。しかし、「アイスの販売を禁止すれば水難事故が減る」と結論づけるのは完全な誤謬です。背後に「夏の気温上昇」という共通の原因(交絡因子)が存在し、双方がそれぞれ引き上げられていたに過ぎません。
【疑似相関を見分ける3つのチェックリスト】
1. 時間的順序が正しいか: 原因となる事象は、必ず結果よりも前に発生していなければなりません。
2. 第3の交絡因子はないか: 季節性、景気、ユーザーの年齢層など、双発的に影響を与える外部要因がないか洗い出します。
3. メカニズムが論理的に説明できるか: なぜその事象がもう一方を引き起こすのか、合理的なストーリーが存在するかを検証します。
【応用編】外れ値の罠とスピアマンの順位相関係数の使い分け
一般的なピアソンの積率相関係数は「直線的な比例関係」かつ「外れ値が少ない連続データ」を前提としています。しかし、実務データにはノイズや特殊なデータがつきものです。適切に使い分けるべき応用視点を紹介します。
外れ値(極端な値)の存在:
通常のデータの中に1つだけ桁違いの数値(例:超富裕層の年収データ)が含まれていると、本来は無相関のデータでも見かけ上の相関係数が0.8などに跳ね上がってしまうことがあります。分析前には必ず散布図でプロットし、外れ値の有無を確認することが不可欠です。
スピアマンの順位相関係数の活用:
データが正規分布に従っていない場合や、アンケートの満足度評価(5段階評価)、売上ランキングなどの「順位データ(順序尺度)」を扱う場合は、スピアマンの順位相関係数($\rho$)を使用します。
スピアマンの手法は、実際の数値を「順位」に変換してから相関を計算するため、外れ値の影響を受けにくく、非線形な単調増加・減少関係も正確に捉えられるという強力なメリットがあります。Excelでもデータを RANK.EQ関数 で順位化してからCORREL関数を通すだけで簡単に算出可能です。
【相関関係の求め方】に関するよくある質問(FAQ)
Q1:相関係数がマイナスの値になった場合、どのように解釈すればよいですか?
A1:「負の相関」を示しており、一方が増加するともう一方が減少する逆比例の関係にあります。値が -1 に近いほどその逆連動の傾向が強くなります。「相関がない」という意味ではないため、マイナス記号を無視して絶対値の大きさで関連性の強弱を判断してください。
Q2:相関係数が高ければ、売上予測などの回帰分析に使っても大丈夫ですか?
A2:高い相関があることは予測モデルの前提条件ですが、十分ではありません。前述の「疑似相関」ではないかを確認し、散布図上で非線形(U字カーブなど)になっていないか確かめる必要があります。また、将来予測を行う際は、因果のメカニズムが担保されているかを必ず検証してください。
Q3:データ数が何件あれば相関係数は信頼できますか?
A3:実務上は最低でも30件〜50件以上のサンプルサイズが推奨されます。データ数が10件未満と極端に少ない場合、単なる偶然で高い相関係数が出てしまうリスクが高まるため、無相関検定を行い「有意水準(p < 0.05など)」を満たしているか確認することが推奨されます。
まとめ:今後の展望と注目ポイント
相関関係の求め方は、公式の基本構造とExcelのCORREL関数さえ押さえてしまえば、決して難しいものではありません。膨大なデータを手軽に処理できるようになった今だからこそ、単に数値を出す作業にとどまらず、その背景にあるデータの質を見極める力が問われます。
分析結果をビジネスや研究の成果に繋げるためには、「散布図で視覚的に分布を確認する」「相関係数の基準値に照らして強さを測る」「因果関係や疑似相関を疑う」という3段構えのアプローチが基本です。精度の高いデータリテラシーを武器に、日々の意思決定や課題解決に役立ててください。 (出典: 相関 関係 求め 方(Yahoo!ニュース))