권세혁HOME
  • 강의노트
    • 기초수학·수리통계·조사방법
    • 기초통계·회귀·다변량분석
    • 머신러닝·딥러닝
    • AI·감성분석
  • 통계챗봇
  • 오늘의 검색 트렌드
  • 통계, 다르게 읽기
  • 통계로 보는 세상(티스토리 e책방)
  • 놀이터_플랫폼(주식 매수 점수)
  1. 📖 (흩어짐과 역설) 재벌 총수가 낀 동네 평균 소득 — 이상치 하나가 바꾸는 평균
  • 📋 전체 목록

  • 📖 (비율과 백분율의 함정) 인구 1만 명당 범죄율을 사용하는 이유
  • 📖 (비율과 백분율의 함정) 위험이 두 배 증가했다는 뉴스는 얼마나 위험한가?
  • 📖 (비율과 백분율의 함정) 지지율 3% 상승인가, 3%포인트 상승인가?
  • 📖 (비율과 백분율의 함정) 매출이 50% 늘었다는 말에 속지 않는 법
  • 📖 (숫자를 대표하는 방법) 같은 평균, 전혀 다른 세상
  • 📖 (숫자를 대표하는 방법) 연봉은 평균보다 중앙값으로 보아야 하는 이유
  • 📖 (숫자를 대표하는 방법) 우리 반 평균이 올랐는데 학생들은 왜 불만일까?
  • 📖 (숫자를 대표하는 방법) 별점 4.5점짜리 식당은 믿을 만한가?
  • 📖 (숫자를 대표하는 방법) 내 체온 36.5도는 정말 정상인가?
  • 📖 지각하는 사람들의 비밀
  • 📖 대기 시간의 비밀
  • 📖 평균의 함정
  • 📖 p-값은 왜 0.05인가?
  • 📖 카톡 답장 속도와 호감도의 통계학
  • 📖 (그래프는 어떻게 우리를 속이는가) 막대그래프의 축을 자르면 차이가 커진다
  • 📖 (그래프는 어떻게 우리를 속이는가) 두 개의 세로축이 만드는 가짜 상관관계
  • 📖 (그래프는 어떻게 우리를 속이는가) 누적그래프는 왜 항상 좋아 보일까?
  • 📖 (그래프는 어떻게 우리를 속이는가) 선형 눈금과 로그 눈금은 무엇이 다른가?
  • 📖 (그래프는 어떻게 우리를 속이는가) 좋은 그래프는 무엇을 숨기지 않는가?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 농구에서 ’슛 감각이 올랐다’는 말은 사실일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 동전이 다섯 번 앞면이면 다음은 뒷면일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 성공한 사람만 보면 성공법이 보이지 않는다
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 시험을 망친 다음 점수가 오르는 이유
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 기억에 잘 남는 사건이 더 자주 일어난다고 느끼는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 연승과 연패, 우연일까 실력일까
  • 📖 (기록의 착시, 대표값의 재발견) 작은 표본이 만드는 큰 착각 — 야구 타율 3할의 의미
  • 📖 (기록의 착시, 대표값의 재발견) 세대별 평균이 말해주는 진짜 의미 — 평균 키가 자라는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 평균으로 설명되지 않는 데이터들 — 최빈값이 필요한 순간
  • 📖 (기록의 착시, 대표값의 재발견) 평균의 함정 총정리 — 평균 수심 1m 강물이 위험한 이유
  • 📖 (흩어짐과 역설) “보통”의 폭을 재는 법 — 표준편차란 무엇인가
  • 📖 (흩어짐과 역설) 재벌 총수가 낀 동네 평균 소득 — 이상치 하나가 바꾸는 평균

목차

  • 스무 가구가 사는 동네에 회장님이 이사 온다면
  • 평균보다 표준편차가 더 크게 흔들린다
  • 더 깊이: 이상치에 강한 척도, 약한 척도
  • 결론: 평균과 표준편차는 극단값 앞에서 함께 흔들린다

(흩어짐과 역설) 재벌 총수가 낀 동네 평균 소득 — 이상치 하나가 바꾸는 평균

통계기초
기술통계
20가구가 사는 평범한 동네에 회장님 한 명이 이사 온다. 실제 공시된 대기업 총수 보수(2025년 248억 원)를 그대로 넣어 계산해보면, 동네 평균 소득은 21배 뛴다. 그런데 표준편차는 무려 865배 뛴다. 이상치 하나가 평균보다 흩어짐 척도를 훨씬 더 크게 흔든다는 사실을, 어제 배운 제곱의 원리로 풀어본다.
Author

권세혁

Published

September 1, 2026

스무 가구가 사는 동네에 회장님이 이사 온다면

20가구가 사는 평범한 아파트 단지를 하나 상상해보자. 다들 비슷비슷하게 벌어서, 가구당 연소득이 대략 4,500만~7,100만 원 사이에 몰려 있고 평균은 5,747만 원이다. 그런데 어느 날 이 단지 한 동에 대기업 회장님이 입주한다. 실제로 2025년 공시 기준, 한화그룹 김승연 회장은 계열사 5곳에서 받은 보수를 합쳐 248억 4,100만 원을 받았다. 이 숫자를 그대로 21번째 가구로 집어넣고 평균을 다시 계산하면 어떻게 될까?

21 households on a log scale: 20 ordinary incomes clustered together, and one real, publicly disclosed 2025 chaebol-owner compensation figure (Hanwha Group chairman, KRW 24.841 billion) far to the right. The mean (gold) is dragged almost all the way to the outlier; the median (gray) barely moves.

계산 결과 동네 평균은 5,747만 원에서 12억 3,764만 원으로 뛴다. 21.5배다. 회장님 한 명의 보수가 나머지 스무 가구 전체를 합친 것(약 11억 4,900만 원)보다도 많으니 당연한 결과다. 반면 중앙값은 5,708만 원에서 5,781만 원으로 거의 그대로다 — 지난달 다룬 연봉 이야기에서 확인했듯, 중앙값은 극단값 하나에 흔들리지 않는다.

낯익은 통계 우화

“술집에 빌 게이츠가 들어오면, 그 술집 안 모든 사람의 평균 재산이 순식간에 억만장자 수준이 된다”는 이야기는 통계 수업에서 자주 쓰이는 비유다. 오늘 계산한 동네 평균 소득이 정확히 같은 원리다. 평균은 “전체를 인원수로 나눈 값”이기 때문에, 극단적으로 큰 값 하나가 나머지 전부를 압도할 수 있다.

평균보다 표준편차가 더 크게 흔들린다

여기서 어제 배운 표준편차를 같은 자료에 적용해보면 훨씬 흥미로운 사실이 드러난다. 회장님이 들어오기 전, 20가구의 표준편차는 625만 원이었다. 회장님을 더한 21가구의 표준편차는 54억 821만 원이다.

Before-and-after comparison of the mean and the standard deviation, on a log scale (linear scale would make the ‘before’ bars invisible). The mean grows 21.5x when the outlier is added; the standard deviation grows 865x — because SD is built from squared deviations, and squaring one huge number dwarfs everything else in the sum.

평균은 21.5배 뛰었지만 표준편차는 865배 뛰었다. 왜 이렇게 차이가 날까? 답은 어제 글에서 손으로 계산해본 표준편차의 계산 순서에 있다. 평균은 값을 그냥 더해서 가구 수로 나눈다 — 극단값 하나가 들어와도 그 값 자체의 크기만큼만 영향을 준다. 반면 표준편차는 평균에서 떨어진 편차를 제곱해서 더한다. 회장님의 소득은 원래 동네 평균보다 247억 원 넘게 높은데, 이 큰 편차를 제곱하는 순간 그 값은 나머지 스무 가구의 편차를 전부 제곱해 더한 것보다도 압도적으로 커진다. 평균은 극단값에 “끌려가지만”, 표준편차는 극단값 하나에 통째로 “장악당한다”고 표현해도 좋을 정도다.

이상치 하나가 있을 때 확인할 것
  1. 평균이 크게 변했다면, 표준편차는 그보다 훨씬 더 크게 변했을 가능성이 높다. 제곱이라는 연산 자체가 극단값의 영향력을 증폭시키기 때문이다.
  2. 중앙값과 사분위범위(IQR)는 이상치에 상대적으로 둔감하다. 극단값 하나가 있는 자료를 요약할 때는 평균·표준편차보다 중앙값·IQR을 함께 살펴보는 편이 안전하다.
  3. “평균과 표준편차가 이상하게 크다”는 신호를 보면, 값을 하나하나 확인하라. 계산 오류가 아니라 진짜 이상치일 수도, 반대로 입력 오류일 수도 있다.

더 깊이: 이상치에 강한 척도, 약한 척도

강의노트 〈기초통계학 3. 데이터와 요약통계 — 측정형 데이터〉는 흩어짐 척도 네 가지 — 분산, 표준편차, 범위(range), 사분위범위(IQR) — 를 나란히 정리하면서, 사분위범위에 대해 “중간 50% 데이터의 범위이며, 이상값에 덜 민감하다”고 명시한다. 오늘 계산에서 확인했듯 분산과 표준편차는 제곱이라는 연산 때문에 이상치 하나에도 크게 흔들리지만, 사분위범위는 애초에 상위·하위 25%를 계산에서 빼고 중간 50%만 보기 때문에 회장님 같은 극단값이 끼어들어도 거의 변하지 않는다. 어떤 척도를 쓸지는 “이 데이터에 극단값이 있을 가능성이 있는가”라는 질문에 대한 답에 달려 있다.

결론: 평균과 표준편차는 극단값 앞에서 함께 흔들린다

나는 학생들에게 소득·자산처럼 극단값이 나올 수 있는 자료를 다룰 때는 평균과 표준편차를 계산하기 전에 먼저 산점도나 히스토그램으로 값을 눈으로 훑어보라고 말한다. 오늘 살펴본 동네 이야기가 보여주듯, 이상치 하나는 평균을 21배, 표준편차를 865배까지 흔들 수 있다. 어제는 표준편차가 “보통의 폭”을 재는 유용한 도구라는 걸 배웠다면, 오늘은 그 도구조차 극단값 앞에서는 무너질 수 있다는 걸 확인한 셈이다. 흩어짐을 재는 척도를 고를 때도, 그 척도 자체가 무엇에 취약한지부터 알아야 한다.

참고 자료
  • 2025년 연봉 순위, 1위 김승연 회장 248억원 — 녹색경제신문
 
 

방문자 수 since 2026.08.08