권세혁HOME
  • SDV(데이터 가치화)
  • 강의노트
    • 기초수학·수리통계·조사방법
    • 기초통계·회귀·다변량분석
    • 머신러닝·딥러닝
    • AI·감성분석
  • 통계챗봇
  • 오늘의 검색 트렌드
  • 통계, 다르게 읽기
  • 통계로 보는 세상(티스토리 e책방)
  • AI_플랫폼(주식 매수 점수)
  • 유튜브
  1. 📖 (분포가 들려주는 이야기) 평균에서 세 표준편차 밖이면 이상한 값일까? — 68-95-99.7 법칙
  • 📋 전체 목록

  • 📖 (비율과 백분율의 함정) 인구 1만 명당 범죄율을 사용하는 이유
  • 📖 (비율과 백분율의 함정) 위험이 두 배 증가했다는 뉴스는 얼마나 위험한가?
  • 📖 (비율과 백분율의 함정) 지지율 3% 상승인가, 3%포인트 상승인가?
  • 📖 (비율과 백분율의 함정) 매출이 50% 늘었다는 말에 속지 않는 법
  • 📖 (숫자를 대표하는 방법) 같은 평균, 전혀 다른 세상
  • 📖 (숫자를 대표하는 방법) 연봉은 평균보다 중앙값으로 보아야 하는 이유
  • 📖 (숫자를 대표하는 방법) 우리 반 평균이 올랐는데 학생들은 왜 불만일까?
  • 📖 (숫자를 대표하는 방법) 별점 4.5점짜리 식당은 믿을 만한가?
  • 📖 (숫자를 대표하는 방법) 내 체온 36.5도는 정말 정상인가?
  • 📖 지각하는 사람들의 비밀
  • 📖 대기 시간의 비밀
  • 📖 평균의 함정
  • 📖 p-값은 왜 0.05인가?
  • 📖 카톡 답장 속도와 호감도의 통계학
  • 📖 (그래프는 어떻게 우리를 속이는가) 막대그래프의 축을 자르면 차이가 커진다
  • 📖 (그래프는 어떻게 우리를 속이는가) 두 개의 세로축이 만드는 가짜 상관관계
  • 📖 (그래프는 어떻게 우리를 속이는가) 누적그래프는 왜 항상 좋아 보일까?
  • 📖 (그래프는 어떻게 우리를 속이는가) 선형 눈금과 로그 눈금은 무엇이 다른가?
  • 📖 (그래프는 어떻게 우리를 속이는가) 좋은 그래프는 무엇을 숨기지 않는가?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 농구에서 ’슛 감각이 올랐다’는 말은 사실일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 동전이 다섯 번 앞면이면 다음은 뒷면일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 성공한 사람만 보면 성공법이 보이지 않는다
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 시험을 망친 다음 점수가 오르는 이유
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 기억에 잘 남는 사건이 더 자주 일어난다고 느끼는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 연승과 연패, 우연일까 실력일까
  • 📖 (기록의 착시, 대표값의 재발견) 작은 표본이 만드는 큰 착각 — 야구 타율 3할의 의미
  • 📖 (기록의 착시, 대표값의 재발견) 세대별 평균이 말해주는 진짜 의미 — 평균 키가 자라는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 평균으로 설명되지 않는 데이터들 — 최빈값이 필요한 순간
  • 📖 (기록의 착시, 대표값의 재발견) 평균의 함정 총정리 — 평균 수심 1m 강물이 위험한 이유
  • 📖 (흩어짐과 역설) “보통”의 폭을 재는 법 — 표준편차란 무엇인가
  • 📖 (흩어짐과 역설) 재벌 총수가 낀 동네 평균 소득 — 이상치 하나가 바꾸는 평균
  • 📖 (흩어짐과 역설) 입시에서 표준점수를 쓰는 이유 — 편차값의 비밀
  • 📖 (흩어짐과 역설) 단위가 다른 두 집단을 견주는 법 — 변동계수로 비교하기
  • 📖 (흩어짐과 역설) 부분에서 이기고도 전체에서 지는 이유 — 심슨의 역설
  • 📖 (숫자로 사람을 줄 세우는 법) 숫자 하나로 사회를 요약하기 — 지니계수로 읽는 불평등
  • 📖 (숫자로 사람을 줄 세우는 법) 어느 쪽이 더 공정할까 — 상대평가 vs 절대평가
  • 📖 (숫자로 사람을 줄 세우는 법) 1점 차이가 갖는 진짜 무게 — 순위의 착시
  • 📖 (숫자로 사람을 줄 세우는 법) 5.0과 4.8 사이, 표본크기의 문제 — 별점 평균의 함정
  • 📖 (숫자로 사람을 줄 세우는 법) 별점 대신 순위를 매기는 이유 — 넷플릭스 평점 시스템
  • 📖 (공식 통계 숫자 읽는 법) 평균수명 60세 시대의 오해 — 기대수명이라는 숫자의 함정
  • 📖 (공식 통계 숫자 읽는 법) 나만의 장바구니 물가지수 — 체감 물가와 통계 물가
  • 📖 (공식 통계 숫자 읽는 법) 누구를 세고 누구를 빼는가 — 실업률의 숨은 정의
  • 📖 (공식 통계 숫자 읽는 법) 분모가 다르면 결론도 다르다 — 치명률 숫자 읽는 법
  • 📖 (공식 통계 숫자 읽는 법) 인과추론 감각을 기르는 법 — 미신적 상관관계 모음
  • 📖 (확률과 우연의 세계) 23명만 모여도 생일이 겹칠 가능성이 높은 이유 — 생일 문제
  • 📖 (확률과 우연의 세계) 같은 번호가 연속으로 나오면 조작일까? — 독립사건
  • 📖 (확률과 우연의 세계) 무작위 숫자는 왜 고르게 흩어지지 않는가? — 군집 착각
  • 📖 (확률과 우연의 세계) 로또 번호에 명당이 존재할까? — 동일확률과 선택편향
  • 📖 (확률과 우연의 세계) 희귀한 사건이 매일 뉴스에 나오는 이유 — 다중 기회
  • 📖 (확률의 도구들) 확률을 세는 언어 — 표본공간과 사건이란 무엇인가
  • 📖 (확률의 도구들) “적어도 하나”의 확률 — 여사건으로 풀면 쉬워지는 문제
  • 📖 (확률의 도구들) 경우의 수 세기 — 카드 한 장을 뽑을 때 확률 계산법
  • 📖 (확률의 도구들) 오해하기 쉬운 개념 — 독립이라는 것의 진짜 의미
  • 📖 (확률의 도구들) 복권 기댓값으로 알아보기 — 기댓값이란 무엇인가
  • 📖 (분포가 들려주는 이야기) 세상의 모든 데이터는 정규분포일까? — 정규분포 신화와 한계
  • 📖 (분포가 들려주는 이야기) 키는 정규분포에 가깝고 소득은 그렇지 않은 이유 — 분포 모양이 다른 이유
  • 📖 (분포가 들려주는 이야기) 평균에서 세 표준편차 밖이면 이상한 값일까? — 68-95-99.7 법칙
  • 📖 (분포가 들려주는 이야기) 하루에 걸려오는 전화 수는 어떤 분포를 따를까? — 포아송분포
  • 📖 (분포가 들려주는 이야기) 분포를 모르면 평균도 해석할 수 없다 — 분포 이해의 중요성
  • 📖 (조건부확률과 베이즈의 사고) 검사 결과가 양성이면 정말 병에 걸린 것일까? — 기저율
  • 📖 (조건부확률과 베이즈의 사고) 정확도 99% 검사가 틀릴 수 있는 이유 — 조건부확률
  • 📖 (조건부확률과 베이즈의 사고) 범인이 범행 현장에 있을 확률과 현장에 있던 사람이 범인일 확률 — 조건의 방향
  • 📖 (조건부확률과 베이즈의 사고) 스팸메일 필터는 어떻게 배워가는가? — 베이즈 갱신
  • 📖 (조건부확률과 베이즈의 사고) 새로운 증거가 들어오면 믿음도 바뀌어야 한다 — 베이지안 사고

목차

  • 세 표준편차 밖은 드문 값일까
  • 정규분포에서 세 구간의 확률
  • 이 법칙이 말해주지 않는 것
  • 분포에 상관없이 쓸 수 있는 보장: 체비셰프 부등식
  • 더 깊이: 체비셰프 부등식
  • SDV 관점: 이상치 기준은 확률로 계산하고 비용으로 정하라
  • 결론: 3σ는 정규분포의 규칙이지, 모든 데이터의 규칙이 아니다

(분포가 들려주는 이야기) 평균에서 세 표준편차 밖이면 이상한 값일까? — 68-95-99.7 법칙

통계기초
분포
정규분포에서 평균 ± 1·2·3 표준편차 안에 들어갈 확률은 각각 68%, 95%, 99.7%다. 그러니 세 표준편차 밖은 370번에 한 번꼴이다. 이 숫자는 이상치를 판정하는 편리한 기준이 되지만, 정규분포가 아닌 데이터에서도 똑같이 쓰면 잘못된 경보를 울린다.
Author

권세혁

Published

October 14, 2026

세 표준편차 밖은 드문 값일까

공장에서 생산되는 부품의 길이를 재서 평균이 10.00mm, 표준편차가 0.02mm라고 하자. 어느 날 10.07mm짜리 부품이 나왔다. 평균에서 0.07mm 떨어졌으니 표준편차의 3.5배다. 이 부품은 ’이상한 것’일까? 많은 현장에서 “3시그마 밖은 이상하다”는 규칙을 쓴다. 그 근거가 바로 정규분포의 68-95-99.7 법칙이다.

정규분포에서 세 구간의 확률

정규분포는 평균을 중심으로 대칭이다. 평균 ± 1σ 안에 들어갈 확률은 약 68.3%, ± 2σ 안에는 약 95.4%, ± 3σ 안에는 약 99.7%다. 따라서 어느 한쪽이든 3σ를 넘을 확률은 약 0.13%, 양쪽을 합하면 0.27%, 즉 약 370개 중 1개꼴이다.

Standard normal curve with the regions within 1, 2 and 3 standard deviations shaded. Each band contains about 68.3%, 95.4% and 99.7% of the probability.

이 법칙이 말해주지 않는 것

68-95-99.7 법칙은 데이터가 정규분포일 때만 성립한다. 그런데 정규분포가 아닌 데이터에 이 규칙을 그대로 적용하면, 실제보다 훨씬 많은 값이 “이상치”로 잡히거나, 반대로 진짜 이상치가 정상으로 넘어간다. 아래 그림은 정규분포와 꼬리가 긴 분포(로그정규분포)에서 평균 ± 3표준편차 밖에 떨어지는 비율을 비교한 것이다.

Share of observations beyond mean plus or minus 3 standard deviations: about 0.27% for normal data (the textbook rule) but several times larger for a long-tailed lognormal distribution. The same rule gives very different alarm rates.

비율의 차이만 보면 정규분포의 0.27%와 로그정규분포의 값이 얼마나 다른지 바로 와닿지 않을 수 있다. 중요한 것은 그 차이가 경보의 빈도로 바뀐다는 점이다. 하루 1만 건의 거래를 감시하는 시스템에서 0.27%는 하루 27건이지만, 꼬리가 긴 데이터에서 실제 비율이 그보다 몇 배 높다면 경보는 하루 수백 건이 되어 담당자가 감당할 수 없게 된다.

분포에 상관없이 쓸 수 있는 보장: 체비셰프 부등식

분포 모양을 모를 때는 체비셰프 부등식이 안전한 하한을 준다. 평균에서 \(k\)표준편차 이상 떨어질 확률은 \(1/k^2\)를 넘지 않으므로, 어떤 분포에서든 평균 ± 3σ 안에 최소 \(1-1/9\approx88.9\%\)가 들어간다. 정규분포라면 99.7%이지만, 분포를 모르면 보장은 88.9%까지 떨어진다. 이 차이가 바로 정규분포 가정이 주는 이득과 위험의 크기다.

3σ 기준을 쓰기 전에 확인할 것
  1. 데이터의 분포를 먼저 그려보라. 정규분포가 아니면 68-95-99.7은 근사조차 되지 않는다.
  2. 이상치 판정을 확률로 바꿔 계산하라. 일일 건수와 곱해 실제 경보 횟수를 추정하라.
  3. 분포를 모르면 체비셰프로 하한을 잡아라. 보수적이지만 가정이 필요 없다.
  4. 이상치의 정의를 업무 비용과 연결하라. 놓치는 비용과 경보의 비용 중 무엇이 큰지에 따라 기준이 달라진다.

더 깊이: 체비셰프 부등식

강의노트 〈수리통계학 5. 확률분포함수 관련 부등식 — 체비셰프 부등식〉는 분포의 모양에 관계없이 평균에서 멀리 떨어진 값의 확률을 분산으로 상한을 잡는 부등식을 소개한다. 오늘 살펴본 “분포를 몰라도 88.9%는 보장된다”는 말이 바로 이 부등식의 결과다.

SDV 관점: 이상치 기준은 확률로 계산하고 비용으로 정하라

정규분포 기준으로 이상치를 판정하는 일은 요약과 추론(1~2단계)에 속한다. SDV(통계적 데이터 가치화) 관점에서 중요한 것은 기준 자체가 아니라 그 기준이 만들어낼 결과다. 품질 관리, 부정 거래 탐지, 서버 모니터링에서 “3σ 밖”이라는 규칙을 기계적으로 적용하면, 분포가 치우친 지표에서 경보가 폭주해 정작 중요한 신호가 묻힌다. 기준을 정할 때는 분포를 확인해 실제 경보율을 계산하고, 그 경보를 처리하는 비용과 놓쳤을 때의 손실을 함께 놓고 결정해야 데이터가 판단의 가치를 만든다. (SDV(데이터 가치화))

결론: 3σ는 정규분포의 규칙이지, 모든 데이터의 규칙이 아니다

나는 학생들에게 “3시그마 밖이면 이상하다”는 말을 들으면 두 가지를 되묻게 한다. 이 데이터는 정말 종 모양인가? 그리고 그 기준으로 하루에 몇 번 경보가 울리는가? 370번에 한 번이라는 숫자는 정규분포에서만 믿을 수 있는 숫자다.

참고 자료
  • 68-95-99.7 법칙의 확률값(68.27%, 95.45%, 99.73%)은 표준정규분포의 이론값이다.
  • 체비셰프 부등식의 보장은 강의노트의 정리를 기준으로 했다.
권세혁 교수의 통계책방 사이트 소개 슬라이드 (클릭하면 크게 보기)
사이트 소개 슬라이드 확대
 
 

방문자 수 since 2026.08.08