권세혁HOME
  • SDV(데이터 가치화)
  • 강의노트
    • 기초수학·수리통계·조사방법
    • 기초통계·회귀·다변량분석
    • 머신러닝·딥러닝
    • AI·감성분석
  • 통계챗봇
  • 오늘의 검색 트렌드
  • 통계, 다르게 읽기
  • 통계로 보는 세상(티스토리 e책방)
  • AI_플랫폼(주식 매수 점수)
  • 유튜브
  1. 📖 (숫자를 대표하는 방법) 별점 4.5점짜리 식당은 믿을 만한가?
  • 📋 전체 목록

  • 📖 (비율과 백분율의 함정) 인구 1만 명당 범죄율을 사용하는 이유
  • 📖 (비율과 백분율의 함정) 위험이 두 배 증가했다는 뉴스는 얼마나 위험한가?
  • 📖 (비율과 백분율의 함정) 지지율 3% 상승인가, 3%포인트 상승인가?
  • 📖 (비율과 백분율의 함정) 매출이 50% 늘었다는 말에 속지 않는 법
  • 📖 (숫자를 대표하는 방법) 같은 평균, 전혀 다른 세상
  • 📖 (숫자를 대표하는 방법) 연봉은 평균보다 중앙값으로 보아야 하는 이유
  • 📖 (숫자를 대표하는 방법) 우리 반 평균이 올랐는데 학생들은 왜 불만일까?
  • 📖 (숫자를 대표하는 방법) 별점 4.5점짜리 식당은 믿을 만한가?
  • 📖 (숫자를 대표하는 방법) 내 체온 36.5도는 정말 정상인가?
  • 📖 지각하는 사람들의 비밀
  • 📖 대기 시간의 비밀
  • 📖 평균의 함정
  • 📖 p-값은 왜 0.05인가?
  • 📖 카톡 답장 속도와 호감도의 통계학
  • 📖 (그래프는 어떻게 우리를 속이는가) 막대그래프의 축을 자르면 차이가 커진다
  • 📖 (그래프는 어떻게 우리를 속이는가) 두 개의 세로축이 만드는 가짜 상관관계
  • 📖 (그래프는 어떻게 우리를 속이는가) 누적그래프는 왜 항상 좋아 보일까?
  • 📖 (그래프는 어떻게 우리를 속이는가) 선형 눈금과 로그 눈금은 무엇이 다른가?
  • 📖 (그래프는 어떻게 우리를 속이는가) 좋은 그래프는 무엇을 숨기지 않는가?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 농구에서 ’슛 감각이 올랐다’는 말은 사실일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 동전이 다섯 번 앞면이면 다음은 뒷면일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 성공한 사람만 보면 성공법이 보이지 않는다
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 시험을 망친 다음 점수가 오르는 이유
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 기억에 잘 남는 사건이 더 자주 일어난다고 느끼는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 연승과 연패, 우연일까 실력일까
  • 📖 (기록의 착시, 대표값의 재발견) 작은 표본이 만드는 큰 착각 — 야구 타율 3할의 의미
  • 📖 (기록의 착시, 대표값의 재발견) 세대별 평균이 말해주는 진짜 의미 — 평균 키가 자라는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 평균으로 설명되지 않는 데이터들 — 최빈값이 필요한 순간
  • 📖 (기록의 착시, 대표값의 재발견) 평균의 함정 총정리 — 평균 수심 1m 강물이 위험한 이유
  • 📖 (흩어짐과 역설) “보통”의 폭을 재는 법 — 표준편차란 무엇인가
  • 📖 (흩어짐과 역설) 재벌 총수가 낀 동네 평균 소득 — 이상치 하나가 바꾸는 평균
  • 📖 (흩어짐과 역설) 입시에서 표준점수를 쓰는 이유 — 편차값의 비밀
  • 📖 (흩어짐과 역설) 단위가 다른 두 집단을 견주는 법 — 변동계수로 비교하기
  • 📖 (흩어짐과 역설) 부분에서 이기고도 전체에서 지는 이유 — 심슨의 역설
  • 📖 (숫자로 사람을 줄 세우는 법) 숫자 하나로 사회를 요약하기 — 지니계수로 읽는 불평등
  • 📖 (숫자로 사람을 줄 세우는 법) 어느 쪽이 더 공정할까 — 상대평가 vs 절대평가
  • 📖 (숫자로 사람을 줄 세우는 법) 1점 차이가 갖는 진짜 무게 — 순위의 착시
  • 📖 (숫자로 사람을 줄 세우는 법) 5.0과 4.8 사이, 표본크기의 문제 — 별점 평균의 함정
  • 📖 (숫자로 사람을 줄 세우는 법) 별점 대신 순위를 매기는 이유 — 넷플릭스 평점 시스템
  • 📖 (공식 통계 숫자 읽는 법) 평균수명 60세 시대의 오해 — 기대수명이라는 숫자의 함정
  • 📖 (공식 통계 숫자 읽는 법) 나만의 장바구니 물가지수 — 체감 물가와 통계 물가
  • 📖 (공식 통계 숫자 읽는 법) 누구를 세고 누구를 빼는가 — 실업률의 숨은 정의
  • 📖 (공식 통계 숫자 읽는 법) 분모가 다르면 결론도 다르다 — 치명률 숫자 읽는 법
  • 📖 (공식 통계 숫자 읽는 법) 인과추론 감각을 기르는 법 — 미신적 상관관계 모음

목차

  • 두 식당 중 어디를 골라야 할까
  • 별점도 결국 표본평균이다
  • 표본이 작을수록 평균은 크게 흔들린다
  • 플랫폼들의 해법: 베이지안 가중평균
  • 결론: 별점 앞에는 항상 괄호 속 숫자를 봐야 한다

(숫자를 대표하는 방법) 별점 4.5점짜리 식당은 믿을 만한가?

통계기초
기술통계
리뷰 8개짜리 평점 4.9와 리뷰 1,200개짜리 평점 4.3, 어느 쪽이 더 믿을 만할까? 평균과 표본 크기의 관계를 다룹니다.
Author

권세혁

Published

July 28, 2026

두 식당 중 어디를 골라야 할까

강의 중 예시로 이 얘기를 꺼내면 학생들 절반은 이미 스마트폰으로 배달앱이나 네이버 지도를 켜고 있다. 다들 이 화면이 익숙하다는 뜻이다. 지도 앱을 켰다. A 식당은 별점 4.9(리뷰 8개), B 식당은 별점 4.3(리뷰 1,200개). 숫자만 보면 A가 훨씬 나아 보인다. 그런데 정말 A가 더 맛있는 집일까?

별점도 결국 표본평균이다

식당 별점은 그 식당에 다녀간 손님들 중 리뷰를 남긴 사람들의 점수를 평균 낸 것이다. 즉, 진짜 궁금한 “이 식당의 진짜 품질”이라는 모집단 값을 몇 명의 표본으로 추정한 표본평균에 불과하다.

리뷰 8개와 리뷰 1,200개의 차이

A 식당의 리뷰가 8개뿐이라면, 다음에 별점 3점짜리 리뷰 하나만 더 달려도 평균은 4.9에서 순식간에 4.6대로 떨어진다. 반면 B 식당은 리뷰가 1,200개이므로, 새 리뷰 하나가 평균을 흔드는 폭은 사실상 0에 가깝다.

같은 “리뷰 1개”라도 표본 크기에 따라 평균에 미치는 영향력은 전혀 다르다.

표본이 작을수록 평균은 크게 흔들린다

통계학에서 표본평균의 불확실성, 즉 표준오차(Standard Error)는 다음과 같이 표본 크기의 제곱근에 반비례해서 줄어든다.

\[\text{SE} = \frac{\sigma}{\sqrt{n}}\]

리뷰 개수 \(n\)이 4배로 늘어나야 표준오차는 절반으로 줄어든다. 리뷰가 몇 개 안 되는 식당은 진짜 실력과 동떨어진 평균이 우연히 찍혀 있을 가능성이 훨씬 크다.

리뷰 개수가 늘어날수록 평점 평균의 95% 신뢰구간 폭(오차범위)이 좁아진다. 리뷰 10개 안팎에서는 오차범위가 ±0.5점을 넘지만, 리뷰가 수백 개를 넘으면 오차범위는 거의 사라진다.

리뷰가 8개인 A 식당은 오차범위가 무려 ±0.55점에 달한다. 진짜 평균이 4.35~5.0 사이 어디든 있을 수 있다는 뜻이다. 반면 리뷰가 1,200개인 B 식당은 오차범위가 ±0.05점 이내로 좁혀진다. “4.9”라는 숫자와 “4.3”이라는 숫자는 애초에 신뢰도가 다른 숫자다.

플랫폼들의 해법: 베이지안 가중평균

이 문제를 잘 아는 플랫폼들은 단순 평균 대신 베이지안 가중평균(Bayesian weighted average)을 쓴다. IMDb 영화 순위가 대표적이다.

IMDb 공식

\[WR = \frac{v}{v + m} \times R + \frac{m}{v + m} \times C\]

  • \(R\): 해당 항목의 평균 평점
  • \(v\): 해당 항목의 리뷰(투표) 수
  • \(m\): “충분히 신뢰할 만하다”고 보는 최소 리뷰 수 (기준값)
  • \(C\): 전체 항목의 평균 평점 (사전 기대값)

리뷰 수 \(v\)가 작으면 가중치가 전체 평균 \(C\) 쪽으로 쏠리고, \(v\)가 크면 원래 평균 \(R\)을 거의 그대로 인정한다. 적은 표본은 겸손하게, 많은 표본은 있는 그대로 평가하는 방식이다.

세 식당에 이 공식을 적용해 보자. 최소 기준 \(m=50\), 전체 평균 \(C=4.0\)으로 가정한다.

식당 원 평점 리뷰 수 가중평균 적용 후
A (리뷰 소수) 4.9 8 4.12
C (리뷰 보통) 4.6 45 4.28
B (리뷰 다수) 4.3 1,200 4.29

원 평점(연두색)과 베이지안 가중평균 적용 후(주황색) 비교. 리뷰가 적은 A는 크게 낮아지고, 리뷰가 많은 B는 거의 그대로다. 그 결과 원래 꼴찌였던 B가 가중평균에서는 1위로 올라선다.

원래 평점만 보면 A > C > B 순이었지만, 표본 크기를 반영하자 B > C > A로 순위가 완전히 뒤집힌다. 리뷰 8개짜리 만점에 가까운 평점은, 리뷰 1,200개가 쌓인 4.3점보다 통계적으로 훨씬 근거가 약하다.

더 깊이: 가중평균의 정식 정의

IMDb 공식이 하는 일은 결국 평범한 평균과 사전 기대값을 리뷰 수 비율로 섞는 가중평균이다. 강의노트 〈기초통계 2. 데이터와 통계 — 측정형 데이터〉에는 가중평균의 일반식과 성적 계산·소비자물가지수 같은 다른 활용 사례도 함께 정리되어 있다.

결론: 별점 앞에는 항상 괄호 속 숫자를 봐야 한다

별점을 볼 때 체크할 것
  1. 평점만 보지 말고 리뷰 개수를 함께 본다. 리뷰 10개 미만의 만점은 통계적으로 거의 의미가 없다.
  2. 리뷰가 적은 만점보다 리뷰가 많은 근소한 고득점이 더 안전한 선택이다.
  3. 플랫폼이 “가중 평점”이나 “정렬 기준”을 제공한다면, 단순 평균보다 그것을 신뢰하자.
  4. 표본이 작을 때는 극단적인 값이 나오기 쉽다는 것을 항상 염두에 둔다. 이것은 식당 평점만이 아니라 표본을 다루는 모든 통계에 적용되는 원칙이다.

숫자 하나(4.9)가 다른 숫자(4.3)보다 커 보인다고 무조건 더 나은 것은 아니다. 그 숫자가 몇 명의 목소리에서 나왔는지를 함께 봐야, 비로소 평균을 제대로 읽을 수 있다.

나는 요즘도 배달앱에서 리뷰 5개짜리 만점 신규 매장보다, 리뷰 800개에 4.6점인 오래된 맛집을 먼저 누른다. 표본 크기를 아는 것만으로도, 선택이 조금은 덜 후회스러워진다.

 
 

방문자 수 since 2026.08.08