권세혁HOME
  • SDV(데이터 가치화)
  • 강의노트
    • 기초수학·수리통계·조사방법
    • 기초통계·회귀·다변량분석
    • 머신러닝·딥러닝
    • AI·감성분석
  • 통계챗봇
  • 오늘의 검색 트렌드
  • 통계, 다르게 읽기
  • 통계로 보는 세상(티스토리 e책방)
  • AI_플랫폼(주식 매수 점수)
  • 유튜브
  1. 📖 (분포가 들려주는 이야기) 키는 정규분포에 가깝고 소득은 그렇지 않은 이유 — 분포 모양이 다른 이유
  • 📋 전체 목록

  • 📖 (비율과 백분율의 함정) 인구 1만 명당 범죄율을 사용하는 이유
  • 📖 (비율과 백분율의 함정) 위험이 두 배 증가했다는 뉴스는 얼마나 위험한가?
  • 📖 (비율과 백분율의 함정) 지지율 3% 상승인가, 3%포인트 상승인가?
  • 📖 (비율과 백분율의 함정) 매출이 50% 늘었다는 말에 속지 않는 법
  • 📖 (숫자를 대표하는 방법) 같은 평균, 전혀 다른 세상
  • 📖 (숫자를 대표하는 방법) 연봉은 평균보다 중앙값으로 보아야 하는 이유
  • 📖 (숫자를 대표하는 방법) 우리 반 평균이 올랐는데 학생들은 왜 불만일까?
  • 📖 (숫자를 대표하는 방법) 별점 4.5점짜리 식당은 믿을 만한가?
  • 📖 (숫자를 대표하는 방법) 내 체온 36.5도는 정말 정상인가?
  • 📖 지각하는 사람들의 비밀
  • 📖 대기 시간의 비밀
  • 📖 평균의 함정
  • 📖 p-값은 왜 0.05인가?
  • 📖 카톡 답장 속도와 호감도의 통계학
  • 📖 (그래프는 어떻게 우리를 속이는가) 막대그래프의 축을 자르면 차이가 커진다
  • 📖 (그래프는 어떻게 우리를 속이는가) 두 개의 세로축이 만드는 가짜 상관관계
  • 📖 (그래프는 어떻게 우리를 속이는가) 누적그래프는 왜 항상 좋아 보일까?
  • 📖 (그래프는 어떻게 우리를 속이는가) 선형 눈금과 로그 눈금은 무엇이 다른가?
  • 📖 (그래프는 어떻게 우리를 속이는가) 좋은 그래프는 무엇을 숨기지 않는가?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 농구에서 ’슛 감각이 올랐다’는 말은 사실일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 동전이 다섯 번 앞면이면 다음은 뒷면일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 성공한 사람만 보면 성공법이 보이지 않는다
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 시험을 망친 다음 점수가 오르는 이유
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 기억에 잘 남는 사건이 더 자주 일어난다고 느끼는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 연승과 연패, 우연일까 실력일까
  • 📖 (기록의 착시, 대표값의 재발견) 작은 표본이 만드는 큰 착각 — 야구 타율 3할의 의미
  • 📖 (기록의 착시, 대표값의 재발견) 세대별 평균이 말해주는 진짜 의미 — 평균 키가 자라는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 평균으로 설명되지 않는 데이터들 — 최빈값이 필요한 순간
  • 📖 (기록의 착시, 대표값의 재발견) 평균의 함정 총정리 — 평균 수심 1m 강물이 위험한 이유
  • 📖 (흩어짐과 역설) “보통”의 폭을 재는 법 — 표준편차란 무엇인가
  • 📖 (흩어짐과 역설) 재벌 총수가 낀 동네 평균 소득 — 이상치 하나가 바꾸는 평균
  • 📖 (흩어짐과 역설) 입시에서 표준점수를 쓰는 이유 — 편차값의 비밀
  • 📖 (흩어짐과 역설) 단위가 다른 두 집단을 견주는 법 — 변동계수로 비교하기
  • 📖 (흩어짐과 역설) 부분에서 이기고도 전체에서 지는 이유 — 심슨의 역설
  • 📖 (숫자로 사람을 줄 세우는 법) 숫자 하나로 사회를 요약하기 — 지니계수로 읽는 불평등
  • 📖 (숫자로 사람을 줄 세우는 법) 어느 쪽이 더 공정할까 — 상대평가 vs 절대평가
  • 📖 (숫자로 사람을 줄 세우는 법) 1점 차이가 갖는 진짜 무게 — 순위의 착시
  • 📖 (숫자로 사람을 줄 세우는 법) 5.0과 4.8 사이, 표본크기의 문제 — 별점 평균의 함정
  • 📖 (숫자로 사람을 줄 세우는 법) 별점 대신 순위를 매기는 이유 — 넷플릭스 평점 시스템
  • 📖 (공식 통계 숫자 읽는 법) 평균수명 60세 시대의 오해 — 기대수명이라는 숫자의 함정
  • 📖 (공식 통계 숫자 읽는 법) 나만의 장바구니 물가지수 — 체감 물가와 통계 물가
  • 📖 (공식 통계 숫자 읽는 법) 누구를 세고 누구를 빼는가 — 실업률의 숨은 정의
  • 📖 (공식 통계 숫자 읽는 법) 분모가 다르면 결론도 다르다 — 치명률 숫자 읽는 법
  • 📖 (공식 통계 숫자 읽는 법) 인과추론 감각을 기르는 법 — 미신적 상관관계 모음
  • 📖 (확률과 우연의 세계) 23명만 모여도 생일이 겹칠 가능성이 높은 이유 — 생일 문제
  • 📖 (확률과 우연의 세계) 같은 번호가 연속으로 나오면 조작일까? — 독립사건
  • 📖 (확률과 우연의 세계) 무작위 숫자는 왜 고르게 흩어지지 않는가? — 군집 착각
  • 📖 (확률과 우연의 세계) 로또 번호에 명당이 존재할까? — 동일확률과 선택편향
  • 📖 (확률과 우연의 세계) 희귀한 사건이 매일 뉴스에 나오는 이유 — 다중 기회
  • 📖 (확률의 도구들) 확률을 세는 언어 — 표본공간과 사건이란 무엇인가
  • 📖 (확률의 도구들) “적어도 하나”의 확률 — 여사건으로 풀면 쉬워지는 문제
  • 📖 (확률의 도구들) 경우의 수 세기 — 카드 한 장을 뽑을 때 확률 계산법
  • 📖 (확률의 도구들) 오해하기 쉬운 개념 — 독립이라는 것의 진짜 의미
  • 📖 (확률의 도구들) 복권 기댓값으로 알아보기 — 기댓값이란 무엇인가
  • 📖 (분포가 들려주는 이야기) 세상의 모든 데이터는 정규분포일까? — 정규분포 신화와 한계
  • 📖 (분포가 들려주는 이야기) 키는 정규분포에 가깝고 소득은 그렇지 않은 이유 — 분포 모양이 다른 이유
  • 📖 (분포가 들려주는 이야기) 평균에서 세 표준편차 밖이면 이상한 값일까? — 68-95-99.7 법칙
  • 📖 (분포가 들려주는 이야기) 하루에 걸려오는 전화 수는 어떤 분포를 따를까? — 포아송분포
  • 📖 (분포가 들려주는 이야기) 분포를 모르면 평균도 해석할 수 없다 — 분포 이해의 중요성
  • 📖 (조건부확률과 베이즈의 사고) 검사 결과가 양성이면 정말 병에 걸린 것일까? — 기저율
  • 📖 (조건부확률과 베이즈의 사고) 정확도 99% 검사가 틀릴 수 있는 이유 — 조건부확률
  • 📖 (조건부확률과 베이즈의 사고) 범인이 범행 현장에 있을 확률과 현장에 있던 사람이 범인일 확률 — 조건의 방향
  • 📖 (조건부확률과 베이즈의 사고) 스팸메일 필터는 어떻게 배워가는가? — 베이즈 갱신
  • 📖 (조건부확률과 베이즈의 사고) 새로운 증거가 들어오면 믿음도 바뀌어야 한다 — 베이지안 사고

목차

  • 키는 평균 근처에 모이고, 소득은 한쪽으로 쏠린다
  • 키는 더해져서, 소득은 곱해져서 만들어진다
  • 평균 소득이 실제 가구를 대표하지 못하는 이유
  • 더 깊이: 로그정규분포의 정의
  • SDV 관점: 평균 소득은 “대표 가구”가 아니다
  • 결론: 같은 ’사람의 값’도 만들어진 방식이 모양을 정한다

(분포가 들려주는 이야기) 키는 정규분포에 가깝고 소득은 그렇지 않은 이유 — 분포 모양이 다른 이유

통계기초
분포
성인 남성의 키는 평균 174cm 근처에 종 모양으로 모인다. 반면 가구 소득은 평균이 중앙값보다 훨씬 높다. 2024년 기준 한국 가구의 평균 소득은 7,427만 원, 중위소득은 5,800만 원이다. 같은 ’사람이 가진 값’인데 모양이 다른 이유는 값이 더해져 만들어졌는지, 곱해져 만들어졌는지에 있다.
Author

권세혁

Published

October 13, 2026

키는 평균 근처에 모이고, 소득은 한쪽으로 쏠린다

길거리에서 성인 남성 100명을 세운 뒤 키를 재면, 대부분은 170cm 안팎에 몰려 있고 170cm보다 훨씬 작거나 훨씬 큰 사람은 드물다. 병무청의 병역판정검사 통계를 보면 평균은 174cm 조금 넘고 표준편차는 6cm 안팎이다(자료마다 조금씩 다르다). 반면 가구 소득을 같은 방식으로 재면 그림이 완전히 달라진다. 통계청(국가데이터처)의 가계금융복지조사에 따르면 2024년 가구의 평균 소득은 7,427만 원이었지만, 한가운데 가구인 중위소득은 5,800만 원이었다. 평균이 중앙값보다 약 28% 높다. 키에서는 평균과 중앙값이 거의 같은데, 소득에서는 왜 이렇게 벌어질까?

키는 더해져서, 소득은 곱해져서 만들어진다

키는 수많은 유전자와 영양, 성장 환경이 더해져서 결정된다. 한 요인이 키를 1cm 늘리거나 줄이는 정도이고, 그 효과들이 모이면 가운데에 몰리는 종 모양이 된다. 앞서 본 중심극한정리가 말하는 상황이다.

소득은 다르다. 학력이 소득을 1.2배로 만들고, 업종이 1.5배로 만들고, 경력이 또 1.3배로 만든다. 이렇게 곱해지는 구조에서는 작은 차이가 누적되어 큰 차이가 된다. 그 결과 한쪽 끝에 소수의 고소득자가 길게 늘어진 오른쪽 꼬리가 생긴다. 로그를 취하면 곱셈이 덧셈으로 바뀌어 다시 대칭에 가까워지는 것이 바로 로그정규분포다.

Simulated adult male heights (normal, mean 174.5 cm, SD 5.8 cm) on the left: nearly symmetric. Simulated household incomes (lognormal, calibrated so the mean-to-median ratio is about 1.28 as in the 2024 Korean survey) on the right: a long right tail. Values are illustrative.

그림에서 소득 히스토그램은 3억 원 이상의 가구를 잘라서 보여준다. 실제로는 그 꼬리 너머에도 가구가 있고, 그 가구들이 평균을 끌어올린다. 평균이 중앙값보다 큰 것은 계산 실수가 아니라 분포 모양이 낳은 결과다.

로그를 취한 뒤에도 같은 소득 자료를 그려보면, 곱셈 구조가 덧셈 구조로 바뀌면서 꼬리가 사라진다.

Simulated household incomes after taking logarithms: the long right tail disappears and the histogram follows a normal curve (red line). Multiplicative effects become additive on the log scale. Values are illustrative.

평균 소득이 실제 가구를 대표하지 못하는 이유

평균 소득 7,427만 원을 보고 “우리 가구도 이 정도는 벌어야 평균이지”라고 생각하면, 절반 이상의 가구는 그 기준에 못 미친다. 중위소득 5,800만 원이 “한가운데 가구”의 실제 모습에 더 가깝다. 같은 데이터에 대해 평균과 중앙값이 이렇게 다른 답을 주는 것은, 분포가 대칭이 아니기 때문이다.

분포의 모양을 읽는 법
  1. 평균과 중앙값을 함께 보라. 둘이 가까우면 대칭에 가깝고, 멀면 한쪽으로 치우쳐 있다.
  2. 값이 어떻게 만들어지는지 물어라. 더해졌는지, 곱해졌는지에 따라 모양이 정해진다.
  3. 꼬리가 긴 데이터에는 로그 눈금을 시도하라. 곱셈 구조는 로그를 취하면 대칭에 가까워진다.
  4. “평균 이상”이라는 표현이 얼마나 많은 사람에게 해당하는지 세어보라. 치우친 분포에서는 소수만 해당한다.

더 깊이: 로그정규분포의 정의

강의노트 〈수리통계학 5. 유명분포 — 로그정규분포〉는 \(\log X\)가 정규분포를 따르는 확률변수 \(X\)를 로그정규분포로 정의한다. 소득처럼 양수이고 곱셈으로 결정되는 값이 이 분포에 가까운 이유를 이 정의가 설명해준다.

SDV 관점: 평균 소득은 “대표 가구”가 아니다

분포가 치우쳐 있음을 알아채는 일은 요약과 추론(1~2단계)의 핵심이다. SDV(통계적 데이터 가치화) 관점에서 이는 정책과 사업 설계의 기준을 정하는 문제다. 지원금 기준, 가격 정책, 고객 세분화를 평균 소득이나 평균 구매액으로 설계하면, 실제 대상의 절반 이상이 설계와 맞지 않는다. 치우친 데이터에서는 중앙값과 분위수를 기준으로 삼고, 평균은 전체 규모를 말할 때만 쓰는 것이 데이터를 실제 결정의 가치로 연결하는 방법이다. (SDV(데이터 가치화))

결론: 같은 ’사람의 값’도 만들어진 방식이 모양을 정한다

나는 학생들에게 키와 소득을 같은 종류의 데이터로 취급하지 말라고 말한다. 키는 더해져서 종 모양이 되고, 소득은 곱해져서 오른쪽으로 길게 늘어진다. 분포의 모양을 먼저 알아야 평균이 무엇을 말해주고 무엇을 감추는지 판단할 수 있다.

참고 자료
  • 2025년 가계금융복지조사 결과 — 대한민국 정책브리핑: 2024년 가구 평균 소득 7,427만 원, 처분가능소득 6,032만 원 등.
  • 2024년 가계금융복지조사 결과 — 대한민국 정책브리핑
  • 병무청 병역판정검사 기준 성인 남성 키 평균·표준편차는 자료마다 차이가 있어 대략적인 값(평균 약 174~175cm, 표준편차 약 6cm)으로만 사용했다.
권세혁 교수의 통계책방 사이트 소개 슬라이드 (클릭하면 크게 보기)
사이트 소개 슬라이드 확대
 
 

방문자 수 since 2026.08.08