권세혁HOME
  • SDV(데이터 가치화)
  • 강의노트
    • 기초수학·수리통계·조사방법
    • 기초통계·회귀·다변량분석
    • 머신러닝·딥러닝
    • AI·감성분석
  • 통계챗봇
  • 오늘의 검색 트렌드
  • 통계, 다르게 읽기
  • 통계로 보는 세상(티스토리 e책방)
  • AI_플랫폼(주식 매수 점수)
  • 유튜브
  1. 📖 (그래프는 어떻게 우리를 속이는가) 두 개의 세로축이 만드는 가짜 상관관계
  • 📋 전체 목록

  • 📖 (비율과 백분율의 함정) 인구 1만 명당 범죄율을 사용하는 이유
  • 📖 (비율과 백분율의 함정) 위험이 두 배 증가했다는 뉴스는 얼마나 위험한가?
  • 📖 (비율과 백분율의 함정) 지지율 3% 상승인가, 3%포인트 상승인가?
  • 📖 (비율과 백분율의 함정) 매출이 50% 늘었다는 말에 속지 않는 법
  • 📖 (숫자를 대표하는 방법) 같은 평균, 전혀 다른 세상
  • 📖 (숫자를 대표하는 방법) 연봉은 평균보다 중앙값으로 보아야 하는 이유
  • 📖 (숫자를 대표하는 방법) 우리 반 평균이 올랐는데 학생들은 왜 불만일까?
  • 📖 (숫자를 대표하는 방법) 별점 4.5점짜리 식당은 믿을 만한가?
  • 📖 (숫자를 대표하는 방법) 내 체온 36.5도는 정말 정상인가?
  • 📖 지각하는 사람들의 비밀
  • 📖 대기 시간의 비밀
  • 📖 평균의 함정
  • 📖 p-값은 왜 0.05인가?
  • 📖 카톡 답장 속도와 호감도의 통계학
  • 📖 (그래프는 어떻게 우리를 속이는가) 막대그래프의 축을 자르면 차이가 커진다
  • 📖 (그래프는 어떻게 우리를 속이는가) 두 개의 세로축이 만드는 가짜 상관관계
  • 📖 (그래프는 어떻게 우리를 속이는가) 누적그래프는 왜 항상 좋아 보일까?
  • 📖 (그래프는 어떻게 우리를 속이는가) 선형 눈금과 로그 눈금은 무엇이 다른가?
  • 📖 (그래프는 어떻게 우리를 속이는가) 좋은 그래프는 무엇을 숨기지 않는가?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 농구에서 ’슛 감각이 올랐다’는 말은 사실일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 동전이 다섯 번 앞면이면 다음은 뒷면일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 성공한 사람만 보면 성공법이 보이지 않는다
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 시험을 망친 다음 점수가 오르는 이유
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 기억에 잘 남는 사건이 더 자주 일어난다고 느끼는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 연승과 연패, 우연일까 실력일까
  • 📖 (기록의 착시, 대표값의 재발견) 작은 표본이 만드는 큰 착각 — 야구 타율 3할의 의미
  • 📖 (기록의 착시, 대표값의 재발견) 세대별 평균이 말해주는 진짜 의미 — 평균 키가 자라는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 평균으로 설명되지 않는 데이터들 — 최빈값이 필요한 순간
  • 📖 (기록의 착시, 대표값의 재발견) 평균의 함정 총정리 — 평균 수심 1m 강물이 위험한 이유
  • 📖 (흩어짐과 역설) “보통”의 폭을 재는 법 — 표준편차란 무엇인가
  • 📖 (흩어짐과 역설) 재벌 총수가 낀 동네 평균 소득 — 이상치 하나가 바꾸는 평균
  • 📖 (흩어짐과 역설) 입시에서 표준점수를 쓰는 이유 — 편차값의 비밀
  • 📖 (흩어짐과 역설) 단위가 다른 두 집단을 견주는 법 — 변동계수로 비교하기
  • 📖 (흩어짐과 역설) 부분에서 이기고도 전체에서 지는 이유 — 심슨의 역설
  • 📖 (숫자로 사람을 줄 세우는 법) 숫자 하나로 사회를 요약하기 — 지니계수로 읽는 불평등
  • 📖 (숫자로 사람을 줄 세우는 법) 어느 쪽이 더 공정할까 — 상대평가 vs 절대평가
  • 📖 (숫자로 사람을 줄 세우는 법) 1점 차이가 갖는 진짜 무게 — 순위의 착시
  • 📖 (숫자로 사람을 줄 세우는 법) 5.0과 4.8 사이, 표본크기의 문제 — 별점 평균의 함정
  • 📖 (숫자로 사람을 줄 세우는 법) 별점 대신 순위를 매기는 이유 — 넷플릭스 평점 시스템
  • 📖 (공식 통계 숫자 읽는 법) 평균수명 60세 시대의 오해 — 기대수명이라는 숫자의 함정
  • 📖 (공식 통계 숫자 읽는 법) 나만의 장바구니 물가지수 — 체감 물가와 통계 물가
  • 📖 (공식 통계 숫자 읽는 법) 누구를 세고 누구를 빼는가 — 실업률의 숨은 정의
  • 📖 (공식 통계 숫자 읽는 법) 분모가 다르면 결론도 다르다 — 치명률 숫자 읽는 법
  • 📖 (공식 통계 숫자 읽는 법) 인과추론 감각을 기르는 법 — 미신적 상관관계 모음
  • 📖 (확률과 우연의 세계) 23명만 모여도 생일이 겹칠 가능성이 높은 이유 — 생일 문제
  • 📖 (확률과 우연의 세계) 같은 번호가 연속으로 나오면 조작일까? — 독립사건
  • 📖 (확률과 우연의 세계) 무작위 숫자는 왜 고르게 흩어지지 않는가? — 군집 착각
  • 📖 (확률과 우연의 세계) 로또 번호에 명당이 존재할까? — 동일확률과 선택편향
  • 📖 (확률과 우연의 세계) 희귀한 사건이 매일 뉴스에 나오는 이유 — 다중 기회

목차

  • 아이 울음소리와 주가지수가 반대로 움직인다?
  • 이중축 그래프는 왜 쓰는가
  • 실제 상관계수는 얼마일까
  • 이중축 그래프가 항상 나쁜 것은 아니다
  • 결론: 겹쳐 보이는 두 선보다 상관계수를 먼저 보라

(그래프는 어떻게 우리를 속이는가) 두 개의 세로축이 만드는 가짜 상관관계

통계기초
데이터시각화
한국의 합계출산율과 코스피 지수. 서로 아무 관련 없어 보이는 이 두 지표를 이중축 그래프로 그리면 거의 완벽하게 반대로 움직이는 것처럼 보인다. 실제 상관계수를 계산해보면 이야기가 조금 달라진다.
Author

권세혁

Published

August 11, 2026

아이 울음소리와 주가지수가 반대로 움직인다?

수업 시간에 종종 이런 그래프를 학생들에게 던져준다. 한쪽 선은 계속 떨어지고, 다른 쪽 선은 오르락내리락하면서도 대체로 반대 방향으로 움직인다. “이 두 지표, 관계가 있어 보이나요?” 열에 아홉은 “네, 꽤 뚜렷하게 반대로 가네요”라고 답한다.

그 두 지표는 한국의 합계출산율과 코스피 지수 연말 종가다. 아이를 몇 명 낳을지 결정하는 일과 주식시장이 무슨 상관이 있을까? 상식적으로는 없다. 그런데 그래프만 보면 마치 두 지표가 손을 잡고 반대로 움직이는 것처럼 보인다. 이유는 데이터가 아니라 그래프를 그린 방식에 있다.

이중축 그래프는 왜 쓰는가

합계출산율은 0.7~1.2 사이의 작은 숫자이고, 코스피 지수는 2,000~3,000 사이의 큰 숫자다. 두 변수를 하나의 축에 그리면 출산율 선은 바닥에 납작하게 깔려 아무것도 보이지 않는다. 그래서 사람들은 왼쪽 축 하나, 오른쪽 축 하나를 따로 만들어 각 변수를 자기 축에 맞게 그린다. 단위가 다른 두 변수를 한 화면에 겹쳐 보고 싶을 때 흔히 쓰는 방법이다.

South Korea’s total fertility rate (left axis) and KOSPI year-end close (right axis), 2015-2024. Each axis is auto-scaled to its own data range — the classic default behavior of dual-axis charts.

두 선이 꽤 뚜렷하게 반대로 움직이는 것처럼 보인다. 출산율이 떨어지는 동안 코스피는 대체로 오르고, 2022년처럼 코스피가 크게 꺾일 때는 출산율 하락세도 잠시 주춤한다. 완벽하게 겹치진 않지만, 누가 봐도 “뭔가 관계가 있다”는 인상을 받기에는 충분하다.

착시가 생기는 이유

이 그래프가 인상적으로 보이는 이유는 상관관계의 크기 때문이 아니라, 각 축을 그 변수의 최솟값·최댓값에 맞춰 꽉 채웠기 때문이다. 왼쪽 축은 0.65~1.30, 오른쪽 축은 1900~3050으로 각각 데이터가 그래프 전체 높이를 다 쓰도록 늘여 놓았다. 두 변수의 실제 등락 폭이 얼마나 크든 작든, 축을 그렇게 맞추는 순간 두 선은 항상 “그래프 전체를 오르내리는” 것처럼 보이게 된다. 심지어 완전히 무작위인 두 숫자열도 이렇게 그리면 그럴듯하게 겹쳐 보일 수 있다.

실제 상관계수는 얼마일까

인상만으로 판단하지 말고 직접 계산해보자. 위 두 지표(합계출산율, 코스피 연말 종가) 10개년 자료로 피어슨 상관계수를 구하면 다음과 같다.

\[r = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum (x_i-\bar{x})^2 \sum (y_i-\bar{y})^2}} \approx -0.64\]

The same two variables as a scatter plot with the actual correlation coefficient. Real, but visibly noisier than the dual-axis line chart implied — and with no plausible causal link between the two.

r = -0.64는 결코 0은 아니다. “약간의 음의 상관관계가 있다”고 말할 수 있는 수준이다. 하지만 이중축 그래프가 보여준 “거의 완벽하게 반대로 움직인다”는 인상에는 한참 못 미친다. 점들은 추세선 주위에 꽤 넓게 흩어져 있다. 무엇보다, 출산율과 주가지수 사이에는 인과관계로 이어질 만한 경로가 없다. 두 지표 모두 지난 10년간 나름의 이유로 각자 방향을 가졌을 뿐, 그 방향이 우연히 대체로 어긋났던 것에 가깝다.

강의노트 〈기초통계 6. 상관분석 — 인과관계와 상관관계〉는 이 함정을 정확히 짚는다. “상관관계가 높게 나타나는 경우에도 그 관계는 단순한 우연일 수 있다.” 상관계수 자체도 인과관계를 입증하는 충분조건이 아닌데, 그 상관계수보다 훨씬 과장된 그래프를 보고 있다면 착시는 두 배가 된다.

이중축 그래프가 항상 나쁜 것은 아니다

이중축 그래프 자체가 거짓말은 아니다. 금리와 환율처럼 이론적으로 실제 연결고리가 있는 두 변수를 함께 보여주고 싶을 때, 단위가 다르다는 이유만으로 포기할 필요는 없다. 문제는 축의 범위를 어떻게 정했는지 설명하지 않을 때 생긴다.

이중축 그래프를 볼 때 확인할 것
  1. 왼쪽 축과 오른쪽 축의 범위(최솟값·최댓값)가 표시되어 있는가? 숫자 없이 선 모양만 보여준다면 의심할 이유가 된다.
  2. 두 변수 사이에 그럴듯한 인과 경로가 있는가? 경로가 없다면, 아무리 그래프가 딱 맞아떨어져도 우연일 가능성을 먼저 의심해야 한다.
  3. 실제 상관계수나 수치를 따로 확인할 수 있는가? 그래프의 “느낌”과 통계량의 “숫자”가 다르다면, 그 차이만큼 축이 인상을 조작하고 있는 것이다.

결론: 겹쳐 보이는 두 선보다 상관계수를 먼저 보라

이중축 그래프는 두 변수를 한 화면에 담기 위한 편리한 도구지만, “각 축을 데이터 범위에 맞춰 꽉 채운다”는 기본 동작 자체가 실제보다 더 강한 관계처럼 보이게 만드는 착시 장치이기도 하다. 합계출산율과 코스피 지수처럼 아무 관련이 없어야 할 두 지표조차, 축을 이렇게 그리면 그럴듯한 이야기를 만들어낸다.

나는 학생들에게 이 그래프를 보여줄 때 항상 마지막에 이렇게 말한다. “두 선이 닮아 보인다고 믿기 전에, 상관계수부터 계산해 보세요.” 그래프는 인상을 주지만, 숫자는 그 인상이 사실인지 아닌지를 말해준다.

참고 자료
  • 대한민국 합계출산율 통계 — 나무위키
  • 코스피 연도별 종가 — 위키백과
  • 꺾은선그래프의 y축 조정이 가능한 이유 — 브런치
  • 그래프 왜곡 — 나무위키
 
 

방문자 수 since 2026.08.08