권세혁HOME
  • SDV(데이터 가치화)
  • 강의노트
    • 기초수학·수리통계·조사방법
    • 기초통계·회귀·다변량분석
    • 머신러닝·딥러닝
    • AI·감성분석
  • 통계챗봇
  • 오늘의 검색 트렌드
  • 통계, 다르게 읽기
  • 통계로 보는 세상(티스토리 e책방)
  • AI_플랫폼(주식 매수 점수)
  • 유튜브
  1. 📖 (확률의 도구들) 복권 기댓값으로 알아보기 — 기댓값이란 무엇인가
  • 📋 전체 목록

  • 📖 (비율과 백분율의 함정) 인구 1만 명당 범죄율을 사용하는 이유
  • 📖 (비율과 백분율의 함정) 위험이 두 배 증가했다는 뉴스는 얼마나 위험한가?
  • 📖 (비율과 백분율의 함정) 지지율 3% 상승인가, 3%포인트 상승인가?
  • 📖 (비율과 백분율의 함정) 매출이 50% 늘었다는 말에 속지 않는 법
  • 📖 (숫자를 대표하는 방법) 같은 평균, 전혀 다른 세상
  • 📖 (숫자를 대표하는 방법) 연봉은 평균보다 중앙값으로 보아야 하는 이유
  • 📖 (숫자를 대표하는 방법) 우리 반 평균이 올랐는데 학생들은 왜 불만일까?
  • 📖 (숫자를 대표하는 방법) 별점 4.5점짜리 식당은 믿을 만한가?
  • 📖 (숫자를 대표하는 방법) 내 체온 36.5도는 정말 정상인가?
  • 📖 지각하는 사람들의 비밀
  • 📖 대기 시간의 비밀
  • 📖 평균의 함정
  • 📖 p-값은 왜 0.05인가?
  • 📖 카톡 답장 속도와 호감도의 통계학
  • 📖 (그래프는 어떻게 우리를 속이는가) 막대그래프의 축을 자르면 차이가 커진다
  • 📖 (그래프는 어떻게 우리를 속이는가) 두 개의 세로축이 만드는 가짜 상관관계
  • 📖 (그래프는 어떻게 우리를 속이는가) 누적그래프는 왜 항상 좋아 보일까?
  • 📖 (그래프는 어떻게 우리를 속이는가) 선형 눈금과 로그 눈금은 무엇이 다른가?
  • 📖 (그래프는 어떻게 우리를 속이는가) 좋은 그래프는 무엇을 숨기지 않는가?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 농구에서 ’슛 감각이 올랐다’는 말은 사실일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 동전이 다섯 번 앞면이면 다음은 뒷면일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 성공한 사람만 보면 성공법이 보이지 않는다
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 시험을 망친 다음 점수가 오르는 이유
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 기억에 잘 남는 사건이 더 자주 일어난다고 느끼는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 연승과 연패, 우연일까 실력일까
  • 📖 (기록의 착시, 대표값의 재발견) 작은 표본이 만드는 큰 착각 — 야구 타율 3할의 의미
  • 📖 (기록의 착시, 대표값의 재발견) 세대별 평균이 말해주는 진짜 의미 — 평균 키가 자라는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 평균으로 설명되지 않는 데이터들 — 최빈값이 필요한 순간
  • 📖 (기록의 착시, 대표값의 재발견) 평균의 함정 총정리 — 평균 수심 1m 강물이 위험한 이유
  • 📖 (흩어짐과 역설) “보통”의 폭을 재는 법 — 표준편차란 무엇인가
  • 📖 (흩어짐과 역설) 재벌 총수가 낀 동네 평균 소득 — 이상치 하나가 바꾸는 평균
  • 📖 (흩어짐과 역설) 입시에서 표준점수를 쓰는 이유 — 편차값의 비밀
  • 📖 (흩어짐과 역설) 단위가 다른 두 집단을 견주는 법 — 변동계수로 비교하기
  • 📖 (흩어짐과 역설) 부분에서 이기고도 전체에서 지는 이유 — 심슨의 역설
  • 📖 (숫자로 사람을 줄 세우는 법) 숫자 하나로 사회를 요약하기 — 지니계수로 읽는 불평등
  • 📖 (숫자로 사람을 줄 세우는 법) 어느 쪽이 더 공정할까 — 상대평가 vs 절대평가
  • 📖 (숫자로 사람을 줄 세우는 법) 1점 차이가 갖는 진짜 무게 — 순위의 착시
  • 📖 (숫자로 사람을 줄 세우는 법) 5.0과 4.8 사이, 표본크기의 문제 — 별점 평균의 함정
  • 📖 (숫자로 사람을 줄 세우는 법) 별점 대신 순위를 매기는 이유 — 넷플릭스 평점 시스템
  • 📖 (공식 통계 숫자 읽는 법) 평균수명 60세 시대의 오해 — 기대수명이라는 숫자의 함정
  • 📖 (공식 통계 숫자 읽는 법) 나만의 장바구니 물가지수 — 체감 물가와 통계 물가
  • 📖 (공식 통계 숫자 읽는 법) 누구를 세고 누구를 빼는가 — 실업률의 숨은 정의
  • 📖 (공식 통계 숫자 읽는 법) 분모가 다르면 결론도 다르다 — 치명률 숫자 읽는 법
  • 📖 (공식 통계 숫자 읽는 법) 인과추론 감각을 기르는 법 — 미신적 상관관계 모음
  • 📖 (확률과 우연의 세계) 23명만 모여도 생일이 겹칠 가능성이 높은 이유 — 생일 문제
  • 📖 (확률과 우연의 세계) 같은 번호가 연속으로 나오면 조작일까? — 독립사건
  • 📖 (확률과 우연의 세계) 무작위 숫자는 왜 고르게 흩어지지 않는가? — 군집 착각
  • 📖 (확률과 우연의 세계) 로또 번호에 명당이 존재할까? — 동일확률과 선택편향
  • 📖 (확률과 우연의 세계) 희귀한 사건이 매일 뉴스에 나오는 이유 — 다중 기회
  • 📖 (확률의 도구들) 확률을 세는 언어 — 표본공간과 사건이란 무엇인가
  • 📖 (확률의 도구들) “적어도 하나”의 확률 — 여사건으로 풀면 쉬워지는 문제
  • 📖 (확률의 도구들) 경우의 수 세기 — 카드 한 장을 뽑을 때 확률 계산법
  • 📖 (확률의 도구들) 오해하기 쉬운 개념 — 독립이라는 것의 진짜 의미
  • 📖 (확률의 도구들) 복권 기댓값으로 알아보기 — 기댓값이란 무엇인가

목차

  • 1,000원을 내면 평균 얼마를 돌려받나
  • 계산해 보기: 4·5등에서만 180원
  • 한 사람의 1년은 어떨까
  • 기댓값이 말해주는 것, 말해주지 않는 것
  • 더 깊이: 기댓값의 정의
  • SDV 관점: 평균 한 줄이 감추는 분포를 함께 읽어라
  • 결론: 평균이 500원이면, 나는 대개 500원보다 못 받는다

(확률의 도구들) 복권 기댓값으로 알아보기 — 기댓값이란 무엇인가

통계기초
확률
로또 한 게임 1,000원의 기댓값은 약 500원이다. 당첨금 총액이 판매액의 50%로 정해져 있기 때문이다. 매주 사서 1년을 버텨도 4·5등만 보면 대부분 투자금의 일부만 돌아온다. 기댓값은 ’평균적으로 얼마를 돌려받는가’를 말해주는 숫자다.
Author

권세혁

Published

October 2, 2026

1,000원을 내면 평균 얼마를 돌려받나

로또 6/45 한 게임은 1,000원이다. 당첨금은 판매액의 50%로 정해져 있고, 5등은 5,000원, 4등은 50,000원이 고정이며 1~3등은 나머지를 당첨자 수로 나눠 받는다. 그렇다면 한 게임을 살 때마다 평균적으로 돌려받는 돈, 곧 기댓값은 얼마일까? 각 결과의 상금에 그 확률을 곱해서 더한 값이 기댓값이다.

\[E[X]=\sum_x x\,P(X=x)\]

계산해 보기: 4·5등에서만 180원

  • 5등(번호 3개 일치): 확률 \(\binom{6}{3}\binom{39}{3}/\binom{45}{6}=2.244\%\) → 기여 \(0.02244\times5{,}000\approx\) 112원
  • 4등(4개 일치): 확률 \(0.1365\%\) → 기여 \(0.001365\times50{,}000\approx\) 68원
  • 1~3등: 확률은 1등 1/8,145,060, 3등 1/35,724 등으로 극히 작지만 상금이 크다. 판매액의 50%가 당첨금이므로 4·5등 몫(약 180원)을 뺀 나머지가 1~3등의 평균 기여분, 곧 약 320원이다.

합치면 기댓값은 약 500원, 즉 1,000원을 내고 평균 500원을 돌려받는다. 평균적으로 절반을 잃는 게임인 셈이다(이월된 회차 등에 따라 회차별로 달라질 수 있는 설계상의 평균이다).

Where the average 1,000 won goes: about 112 won from 5th prizes, 68 won from 4th prizes, roughly 320 won from 1st-3rd prizes (implied by the 50% payout rule), and about 500 won not returned to players.

한 사람의 1년은 어떨까

기댓값은 ’평균’이지 ’내가 얻을 값’이 아니다. 매주 5게임씩 1년(260게임)을 사는 사람 1만 명을 시뮬레이션해 보자. 1~3등은 확률이 너무 작아 대부분의 사람에게 한 번도 일어나지 않으므로, 여기서는 4·5등 상금만 세어 본다. 260,000원을 쓰고 4·5등에서 돌려받는 금액은 평균 약 46,300원이고, 거의 모든 사람이 쓴 돈의 절반에도 못 미친다.

10,000 simulated players who each buy 260 lotto games (5 per week for a year). Histogram of the money returned from 4th and 5th prizes only, versus the 260,000 won spent. Almost nobody gets back even half of what they spent from these prizes.

기댓값이 말해주는 것, 말해주지 않는 것

기댓값이 500원이라는 사실은 이 게임이 장기적으로 반복하면 평균 손실이 발생하도록 설계되었음을 알려준다. 그러나 개인에게 일어나는 일은 훨씬 들쭉날쭉하다. 대부분은 소액을 받거나 아무것도 받지 못하고, 극소수만 수억 원을 받는다. 기댓값은 그 극단값까지 확률로 가중해 하나의 숫자로 요약한 것이라 대부분의 사람이 실제로 겪는 경험과는 다를 수 있다.

기댓값을 읽을 때
  1. 기댓값 = 각 결과 × 확률의 합. 큰 상금이라도 확률이 작으면 기여는 작다.
  2. 기댓값은 ’반복했을 때의 평균’이지 한 번의 결과가 아니다.
  3. 분포의 모양을 함께 보라. 극단값이 평균을 끌어올리면 대부분은 평균에 못 미친다.
  4. 비용과 비교하라. 기댓값이 지불 금액보다 작으면 평균적으로 손해다.

더 깊이: 기댓값의 정의

강의노트 〈수리통계학 2. 확률변수 — 기대값 정의〉는 이산형 확률변수의 기대값을 \(\sum g(x)f_X(x)\)로 정의한다. 오늘 계산은 \(g(x)\)를 상금으로, \(f_X(x)\)를 등수별 당첨 확률로 놓은 그대로의 적용이다.

SDV 관점: 평균 한 줄이 감추는 분포를 함께 읽어라

기댓값을 계산하는 일은 요약과 추론(1~2단계)에 속한다. SDV(통계적 데이터 가치화) 관점에서 핵심은, “평균 수익률 5%”, “고객당 평균 매출 3만 원” 같은 숫자가 오늘의 시뮬레이션처럼 소수의 큰 값이 평균을 끌어올린 결과일 수 있다는 점이다. 평균만 보고 의사결정을 하면 대부분의 고객이 경험하는 현실과 괴리가 생긴다. 기댓값과 함께 분포, 곧 대부분의 사람이 얻는 값과 극단의 몫을 나란히 보여줄 때 숫자가 비로소 결정의 가치가 된다. (SDV(데이터 가치화))

결론: 평균이 500원이면, 나는 대개 500원보다 못 받는다

나는 학생들에게 복권을 사지 말라고 하지는 않는다. 다만 1,000원이 평균 500원으로 돌아온다는 사실, 그리고 대부분의 사람은 그 평균에도 못 미친다는 사실을 알고 사라고 말한다. 기댓값은 미래를 맞추는 예언이 아니라, 반복되는 게임의 구조를 한 숫자로 드러내는 도구다.

참고 자료
  • 로또6/45 소개 — 동행복권: 당첨금 총액은 판매액의 50%, 5등 5,000원·4등 50,000원 고정.
  • 고객센터 당첨자 가이드 — 동행복권
권세혁 교수의 통계책방 사이트 소개 슬라이드 (클릭하면 크게 보기)
사이트 소개 슬라이드 확대
 
 

방문자 수 since 2026.08.08