권세혁HOME
  • SDV(데이터 가치화)
  • 강의노트
    • 기초수학·수리통계·조사방법
    • 기초통계·회귀·다변량분석
    • 머신러닝·딥러닝
    • AI·감성분석
  • 통계챗봇
  • 오늘의 검색 트렌드
  • 통계, 다르게 읽기
  • 통계로 보는 세상(티스토리 e책방)
  • AI_플랫폼(주식 매수 점수)
  • 유튜브
  1. 📖 (기록의 착시, 대표값의 재발견) 평균으로 설명되지 않는 데이터들 — 최빈값이 필요한 순간
  • 📋 전체 목록

  • 📖 (비율과 백분율의 함정) 인구 1만 명당 범죄율을 사용하는 이유
  • 📖 (비율과 백분율의 함정) 위험이 두 배 증가했다는 뉴스는 얼마나 위험한가?
  • 📖 (비율과 백분율의 함정) 지지율 3% 상승인가, 3%포인트 상승인가?
  • 📖 (비율과 백분율의 함정) 매출이 50% 늘었다는 말에 속지 않는 법
  • 📖 (숫자를 대표하는 방법) 같은 평균, 전혀 다른 세상
  • 📖 (숫자를 대표하는 방법) 연봉은 평균보다 중앙값으로 보아야 하는 이유
  • 📖 (숫자를 대표하는 방법) 우리 반 평균이 올랐는데 학생들은 왜 불만일까?
  • 📖 (숫자를 대표하는 방법) 별점 4.5점짜리 식당은 믿을 만한가?
  • 📖 (숫자를 대표하는 방법) 내 체온 36.5도는 정말 정상인가?
  • 📖 지각하는 사람들의 비밀
  • 📖 대기 시간의 비밀
  • 📖 평균의 함정
  • 📖 p-값은 왜 0.05인가?
  • 📖 카톡 답장 속도와 호감도의 통계학
  • 📖 (그래프는 어떻게 우리를 속이는가) 막대그래프의 축을 자르면 차이가 커진다
  • 📖 (그래프는 어떻게 우리를 속이는가) 두 개의 세로축이 만드는 가짜 상관관계
  • 📖 (그래프는 어떻게 우리를 속이는가) 누적그래프는 왜 항상 좋아 보일까?
  • 📖 (그래프는 어떻게 우리를 속이는가) 선형 눈금과 로그 눈금은 무엇이 다른가?
  • 📖 (그래프는 어떻게 우리를 속이는가) 좋은 그래프는 무엇을 숨기지 않는가?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 농구에서 ’슛 감각이 올랐다’는 말은 사실일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 동전이 다섯 번 앞면이면 다음은 뒷면일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 성공한 사람만 보면 성공법이 보이지 않는다
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 시험을 망친 다음 점수가 오르는 이유
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 기억에 잘 남는 사건이 더 자주 일어난다고 느끼는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 연승과 연패, 우연일까 실력일까
  • 📖 (기록의 착시, 대표값의 재발견) 작은 표본이 만드는 큰 착각 — 야구 타율 3할의 의미
  • 📖 (기록의 착시, 대표값의 재발견) 세대별 평균이 말해주는 진짜 의미 — 평균 키가 자라는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 평균으로 설명되지 않는 데이터들 — 최빈값이 필요한 순간
  • 📖 (기록의 착시, 대표값의 재발견) 평균의 함정 총정리 — 평균 수심 1m 강물이 위험한 이유
  • 📖 (흩어짐과 역설) “보통”의 폭을 재는 법 — 표준편차란 무엇인가
  • 📖 (흩어짐과 역설) 재벌 총수가 낀 동네 평균 소득 — 이상치 하나가 바꾸는 평균
  • 📖 (흩어짐과 역설) 입시에서 표준점수를 쓰는 이유 — 편차값의 비밀
  • 📖 (흩어짐과 역설) 단위가 다른 두 집단을 견주는 법 — 변동계수로 비교하기
  • 📖 (흩어짐과 역설) 부분에서 이기고도 전체에서 지는 이유 — 심슨의 역설
  • 📖 (숫자로 사람을 줄 세우는 법) 숫자 하나로 사회를 요약하기 — 지니계수로 읽는 불평등
  • 📖 (숫자로 사람을 줄 세우는 법) 어느 쪽이 더 공정할까 — 상대평가 vs 절대평가
  • 📖 (숫자로 사람을 줄 세우는 법) 1점 차이가 갖는 진짜 무게 — 순위의 착시
  • 📖 (숫자로 사람을 줄 세우는 법) 5.0과 4.8 사이, 표본크기의 문제 — 별점 평균의 함정
  • 📖 (숫자로 사람을 줄 세우는 법) 별점 대신 순위를 매기는 이유 — 넷플릭스 평점 시스템
  • 📖 (공식 통계 숫자 읽는 법) 평균수명 60세 시대의 오해 — 기대수명이라는 숫자의 함정
  • 📖 (공식 통계 숫자 읽는 법) 나만의 장바구니 물가지수 — 체감 물가와 통계 물가
  • 📖 (공식 통계 숫자 읽는 법) 누구를 세고 누구를 빼는가 — 실업률의 숨은 정의
  • 📖 (공식 통계 숫자 읽는 법) 분모가 다르면 결론도 다르다 — 치명률 숫자 읽는 법
  • 📖 (공식 통계 숫자 읽는 법) 인과추론 감각을 기르는 법 — 미신적 상관관계 모음
  • 📖 (확률과 우연의 세계) 23명만 모여도 생일이 겹칠 가능성이 높은 이유 — 생일 문제
  • 📖 (확률과 우연의 세계) 같은 번호가 연속으로 나오면 조작일까? — 독립사건
  • 📖 (확률과 우연의 세계) 무작위 숫자는 왜 고르게 흩어지지 않는가? — 군집 착각
  • 📖 (확률과 우연의 세계) 로또 번호에 명당이 존재할까? — 동일확률과 선택편향
  • 📖 (확률과 우연의 세계) 희귀한 사건이 매일 뉴스에 나오는 이유 — 다중 기회
  • 📖 (확률의 도구들) 확률을 세는 언어 — 표본공간과 사건이란 무엇인가
  • 📖 (확률의 도구들) “적어도 하나”의 확률 — 여사건으로 풀면 쉬워지는 문제
  • 📖 (확률의 도구들) 경우의 수 세기 — 카드 한 장을 뽑을 때 확률 계산법
  • 📖 (확률의 도구들) 오해하기 쉬운 개념 — 독립이라는 것의 진짜 의미
  • 📖 (확률의 도구들) 복권 기댓값으로 알아보기 — 기댓값이란 무엇인가
  • 📖 (분포가 들려주는 이야기) 세상의 모든 데이터는 정규분포일까? — 정규분포 신화와 한계
  • 📖 (분포가 들려주는 이야기) 키는 정규분포에 가깝고 소득은 그렇지 않은 이유 — 분포 모양이 다른 이유
  • 📖 (분포가 들려주는 이야기) 평균에서 세 표준편차 밖이면 이상한 값일까? — 68-95-99.7 법칙
  • 📖 (분포가 들려주는 이야기) 하루에 걸려오는 전화 수는 어떤 분포를 따를까? — 포아송분포
  • 📖 (분포가 들려주는 이야기) 분포를 모르면 평균도 해석할 수 없다 — 분포 이해의 중요성
  • 📖 (조건부확률과 베이즈의 사고) 검사 결과가 양성이면 정말 병에 걸린 것일까? — 기저율
  • 📖 (조건부확률과 베이즈의 사고) 정확도 99% 검사가 틀릴 수 있는 이유 — 조건부확률
  • 📖 (조건부확률과 베이즈의 사고) 범인이 범행 현장에 있을 확률과 현장에 있던 사람이 범인일 확률 — 조건의 방향
  • 📖 (조건부확률과 베이즈의 사고) 스팸메일 필터는 어떻게 배워가는가? — 베이즈 갱신
  • 📖 (조건부확률과 베이즈의 사고) 새로운 증거가 들어오면 믿음도 바뀌어야 한다 — 베이지안 사고

목차

  • “평균 혈액형”이라는 질문이 성립하지 않는 이유
  • 척도가 다르면 쓸 수 있는 대표값도 달라진다
  • 평균은 계산되지만, 아무도 그 시각에 있지 않다
  • 더 깊이: 척도에 따라 다른 대표값
  • 결론: 평균을 내기 전에, 봉우리부터 세어보라

(기록의 착시, 대표값의 재발견) 평균으로 설명되지 않는 데이터들 — 최빈값이 필요한 순간

통계기초
기술통계
한국인의 ’평균 혈액형’은 무엇일까? 이 질문은 애초에 성립하지 않는다 — 혈액형은 더하고 나눌 수 있는 숫자가 아니기 때문이다. 지하철 혼잡 시간을 평균 내면 아무도 타지 않는 한산한 시각이 나오는 것도 같은 문제의 다른 얼굴이다. 평균이 아니라 최빈값이 필요한 두 가지 순간을 정리한다.
Author

권세혁

Published

August 27, 2026

“평균 혈액형”이라는 질문이 성립하지 않는 이유

한국인의 평균 혈액형은 무엇일까? 이상하게 들리겠지만, 이 질문에는 애초에 답이 없다. 한국갤럽조사연구소가 2023년 전국 성인 1,501명을 대상으로 조사한 결과, 한국인의 혈액형 분포는 A형 34%, O형 28%, B형 26%, AB형 11%였다. 그런데 이 네 범주를 “더해서 4로 나누는” 식의 평균 계산은 원천적으로 불가능하다. A형과 B형을 더하면 무엇이 나오는가? 이 질문 자체가 성립하지 않는다.

South Korea’s blood-type distribution (Gallup Korea, 2023 survey, n=1,501 adults). Unlike most of the world, where type O is the most common blood type, type A is the mode in South Korea.

이 자료에서 유일하게 말이 되는 “대표값”은 최빈값(mode) — 가장 많은 사람이 속한 범주, 즉 A형이다. 흥미롭게도 이건 세계적인 경향과도 다르다. 전 세계적으로는 O형이 가장 흔한 혈액형이지만, 한국은 A형이 최빈값이라는 점에서 예외적이다. “평균”은 이 자료에 대해 아무것도 말해줄 수 없지만, “최빈값”은 이렇게 분명한 사실 하나를 알려준다.

척도가 다르면 쓸 수 있는 대표값도 달라진다

혈액형, 성별, 거주지처럼 순서 없이 분류만 하는 자료를 명목척도라 부른다. 이런 자료에는 산술 연산 자체가 의미를 갖지 않으므로, 평균은 물론 중앙값조차 계산할 수 없다. 오직 “가장 많이 나온 값이 무엇인가”라는 최빈값만 모든 종류의 자료에 적용할 수 있는 유일한 대표값이다.

최빈값이 필요한 첫 번째 신호: 범주형·명목형 자료

혈액형, 선호 브랜드, 거주 지역, 정당 지지처럼 숫자로 환산할 수 없는 범주형 자료를 다룰 때는 평균이나 중앙값을 시도하기 전에 먼저 물어야 한다. “이 값들을 더하고 나누는 것이 말이 되는가?” 답이 “아니오”라면, 유일하게 남는 선택지는 최빈값이다.

평균은 계산되지만, 아무도 그 시각에 있지 않다

그런데 최빈값이 필요한 순간이 하나 더 있다. 이번엔 숫자 자료인데도 평균이 무의미해지는 경우다. 서울의 지하철·버스는 출근 시간대와 퇴근 시간대, 하루 두 번 승객이 몰린다. 이런 “시간대별 승차 인원” 자료의 평균 시각을 계산하면 어떻게 될까?

A stylized, illustrative model (not real subway data) of ridership by hour of day, with two real-world-typical peaks around the morning and evening commute. The weighted mean hour (~13:00) lands in the quietest trough of the entire day — a time when almost nobody is actually riding.

평균 시각은 오후 1시 근처로 계산된다. 그런데 그 시간대는 실제로는 하루 중 승객이 가장 적은 한산한 시간이다. 출근·퇴근이라는 뚜렷이 다른 두 봉우리를 하나의 평균으로 뭉개버리면, “평균적으로 사람들이 지하철을 타는 시각”이라는 표현 자체가 실재하지 않는 순간을 가리키게 된다. 이런 자료를 요약할 때 필요한 건 하나의 평균값이 아니라, “오전 8시와 오후 6시, 두 개의 봉우리가 있다”는 최빈값(또는 최빈 구간) 정보다.

문제는 이 함정이 숫자 자료에서는 눈에 잘 띄지 않는다는 점이다. \(\bar{x} = \frac{1}{n}\sum x_i\)라는 계산은 원자료를 하나하나 더해 \(n\)으로 나눌 뿐, 그 값들이 한 덩어리로 몰려 있는지 두 봉우리로 갈라져 있는지는 전혀 들여다보지 않는다. 즉 평균이라는 숫자 자체에는 분포의 모양이 조금도 남지 않는다. 그래서 숫자형 자료를 다룰 때는 평균을 계산하기 전에 반드시 히스토그램부터 그려보는 순서를 거쳐야 한다. 히스토그램 없이 곧장 평균을 구하면, 오늘 살펴본 지하철 사례처럼 봉우리가 여러 개라는 사실 자체를 발견할 기회조차 없이 지나가 버린다.

최빈값이 필요한 두 번째 신호: 봉우리가 여러 개인 분포

시간대별 교통량, 매장 방문객 수, 통화량처럼 하루·한 주 동안 뚜렷한 패턴이 반복되는 자료는 평균 하나로 요약하면 오히려 정보를 잃는다. 숫자형 자료를 요약하는 표준 순서는 평균부터 구하는 게 아니라, 히스토그램을 먼저 그려 봉우리가 몇 개인지 확인한 다음에 평균·중앙값·최빈값 중 무엇을 쓸지 정하는 것이다. 이 순서를 건너뛰고 평균부터 계산하면, 다봉분포라는 신호 자체를 놓친 채 실재하지 않는 “평균 시각” 같은 숫자만 손에 쥐게 된다.

더 깊이: 척도에 따라 다른 대표값

강의노트 〈기초통계학 1. 데이터란? — 질적변수와 양적변수〉는 명목척도부터 비율척도까지 척도 유형별로 어떤 요약 통계가 계산 가능한지 정리한 표를 제시한다. 이 표에서 최빈값은 명목·서열·등간·비율척도 모든 칸에 체크되어 있는 유일한 대표값이다. 반면 평균은 등간·비율척도에서만, 중앙값은 서열·등간·비율척도에서만 계산할 수 있다. 이어지는 〈데이터와 요약통계 — 측정형 데이터〉 절은 산술평균이 “이상값에 민감하다”는 약점을, 중앙값은 “이상값에 강건”하다는 대안을 제시하는데, 최빈값의 강점은 이와는 결이 다르다 — 이상값 방어가 아니라, 애초에 평균이라는 연산 자체가 성립하지 않거나 의미를 잃는 상황에서 유일하게 남는 선택지라는 점이다.

결론: 평균을 내기 전에, 봉우리부터 세어보라

나는 학생들에게 어떤 자료든 요약하기 전에 먼저 두 가지를 물어보라고 말한다. 첫째, 이 값들을 더하고 나누는 게 말이 되는가? 아니라면 최빈값이 답이다. 둘째, 숫자형 자료라서 말이 된다 해도 평균을 계산하는 코드부터 치지 말고, 히스토그램부터 그려서 봉우리가 하나인가 여럿인가를 눈으로 확인하라. 이 순서를 지키지 않으면, 즉 히스토그램 없이 곧장 평균을 구해버리면, 다봉분포라는 신호는 애초에 발견될 기회조차 얻지 못한다. 지난 챕터의 “같은 평균, 전혀 다른 세상”에서 살펴봤듯, 평균이라는 숫자 하나는 분포의 모양을 감쪽같이 숨긴다. 혈액형처럼 평균 자체가 성립하지 않는 자료든, 출퇴근 시간대처럼 평균이 존재하지도 않는 순간을 가리키는 자료든 — 결론은 같다. 평균은 만능 대표값이 아니라, 특정 조건(등간·비율척도, 단봉분포)에서만 제 역할을 하는 여러 도구 중 하나일 뿐이다.

참고 자료
  • 한국갤럽조사연구소 (2023). 한국인의 혈액형, 별자리, 사주, 신년운세 등에 대한 조사 (전국 만 19세 이상 1,501명).
  • 우리국민 본인 혈액형…A형 34%, B형 26%, AB형 11%, O형 28% — 폴리스TV
권세혁 교수의 통계책방 사이트 소개 슬라이드 (클릭하면 크게 보기)
사이트 소개 슬라이드 확대
 
 

방문자 수 since 2026.08.08