권세혁HOME
  • SDV(데이터 가치화)
  • 강의노트
    • 기초수학·수리통계·조사방법
    • 기초통계·회귀·다변량분석
    • 머신러닝·딥러닝
    • AI·감성분석
  • 통계챗봇
  • 오늘의 검색 트렌드
  • 통계, 다르게 읽기
  • 통계로 보는 세상(티스토리 e책방)
  • AI_플랫폼(주식 매수 점수)
  • 유튜브
  1. 📖 (확률과 우연의 세계) 무작위 숫자는 왜 고르게 흩어지지 않는가? — 군집 착각
  • 📋 전체 목록

  • 📖 (비율과 백분율의 함정) 인구 1만 명당 범죄율을 사용하는 이유
  • 📖 (비율과 백분율의 함정) 위험이 두 배 증가했다는 뉴스는 얼마나 위험한가?
  • 📖 (비율과 백분율의 함정) 지지율 3% 상승인가, 3%포인트 상승인가?
  • 📖 (비율과 백분율의 함정) 매출이 50% 늘었다는 말에 속지 않는 법
  • 📖 (숫자를 대표하는 방법) 같은 평균, 전혀 다른 세상
  • 📖 (숫자를 대표하는 방법) 연봉은 평균보다 중앙값으로 보아야 하는 이유
  • 📖 (숫자를 대표하는 방법) 우리 반 평균이 올랐는데 학생들은 왜 불만일까?
  • 📖 (숫자를 대표하는 방법) 별점 4.5점짜리 식당은 믿을 만한가?
  • 📖 (숫자를 대표하는 방법) 내 체온 36.5도는 정말 정상인가?
  • 📖 지각하는 사람들의 비밀
  • 📖 대기 시간의 비밀
  • 📖 평균의 함정
  • 📖 p-값은 왜 0.05인가?
  • 📖 카톡 답장 속도와 호감도의 통계학
  • 📖 (그래프는 어떻게 우리를 속이는가) 막대그래프의 축을 자르면 차이가 커진다
  • 📖 (그래프는 어떻게 우리를 속이는가) 두 개의 세로축이 만드는 가짜 상관관계
  • 📖 (그래프는 어떻게 우리를 속이는가) 누적그래프는 왜 항상 좋아 보일까?
  • 📖 (그래프는 어떻게 우리를 속이는가) 선형 눈금과 로그 눈금은 무엇이 다른가?
  • 📖 (그래프는 어떻게 우리를 속이는가) 좋은 그래프는 무엇을 숨기지 않는가?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 농구에서 ’슛 감각이 올랐다’는 말은 사실일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 동전이 다섯 번 앞면이면 다음은 뒷면일까?
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 성공한 사람만 보면 성공법이 보이지 않는다
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 시험을 망친 다음 점수가 오르는 이유
  • 📖 (사람의 직관은 왜 통계와 충돌하는가) 기억에 잘 남는 사건이 더 자주 일어난다고 느끼는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 연승과 연패, 우연일까 실력일까
  • 📖 (기록의 착시, 대표값의 재발견) 작은 표본이 만드는 큰 착각 — 야구 타율 3할의 의미
  • 📖 (기록의 착시, 대표값의 재발견) 세대별 평균이 말해주는 진짜 의미 — 평균 키가 자라는 이유
  • 📖 (기록의 착시, 대표값의 재발견) 평균으로 설명되지 않는 데이터들 — 최빈값이 필요한 순간
  • 📖 (기록의 착시, 대표값의 재발견) 평균의 함정 총정리 — 평균 수심 1m 강물이 위험한 이유
  • 📖 (흩어짐과 역설) “보통”의 폭을 재는 법 — 표준편차란 무엇인가
  • 📖 (흩어짐과 역설) 재벌 총수가 낀 동네 평균 소득 — 이상치 하나가 바꾸는 평균
  • 📖 (흩어짐과 역설) 입시에서 표준점수를 쓰는 이유 — 편차값의 비밀
  • 📖 (흩어짐과 역설) 단위가 다른 두 집단을 견주는 법 — 변동계수로 비교하기
  • 📖 (흩어짐과 역설) 부분에서 이기고도 전체에서 지는 이유 — 심슨의 역설
  • 📖 (숫자로 사람을 줄 세우는 법) 숫자 하나로 사회를 요약하기 — 지니계수로 읽는 불평등
  • 📖 (숫자로 사람을 줄 세우는 법) 어느 쪽이 더 공정할까 — 상대평가 vs 절대평가
  • 📖 (숫자로 사람을 줄 세우는 법) 1점 차이가 갖는 진짜 무게 — 순위의 착시
  • 📖 (숫자로 사람을 줄 세우는 법) 5.0과 4.8 사이, 표본크기의 문제 — 별점 평균의 함정
  • 📖 (숫자로 사람을 줄 세우는 법) 별점 대신 순위를 매기는 이유 — 넷플릭스 평점 시스템
  • 📖 (공식 통계 숫자 읽는 법) 평균수명 60세 시대의 오해 — 기대수명이라는 숫자의 함정
  • 📖 (공식 통계 숫자 읽는 법) 나만의 장바구니 물가지수 — 체감 물가와 통계 물가
  • 📖 (공식 통계 숫자 읽는 법) 누구를 세고 누구를 빼는가 — 실업률의 숨은 정의
  • 📖 (공식 통계 숫자 읽는 법) 분모가 다르면 결론도 다르다 — 치명률 숫자 읽는 법
  • 📖 (공식 통계 숫자 읽는 법) 인과추론 감각을 기르는 법 — 미신적 상관관계 모음
  • 📖 (확률과 우연의 세계) 23명만 모여도 생일이 겹칠 가능성이 높은 이유 — 생일 문제
  • 📖 (확률과 우연의 세계) 같은 번호가 연속으로 나오면 조작일까? — 독립사건
  • 📖 (확률과 우연의 세계) 무작위 숫자는 왜 고르게 흩어지지 않는가? — 군집 착각
  • 📖 (확률과 우연의 세계) 로또 번호에 명당이 존재할까? — 동일확률과 선택편향
  • 📖 (확률과 우연의 세계) 희귀한 사건이 매일 뉴스에 나오는 이유 — 다중 기회

목차

  • 완벽하게 무작위였는데, 무작위가 아니라는 항의가 빗발쳤다
  • 30곡을 진짜로 섞으면, 99.6% 확률로 어디선가 같은 아티스트가 연달아 나온다
  • 사람은 “고르게 흩어진 것”을 무작위라고 착각한다
  • 더 깊이: 포아송 과정은 원래 뭉친다
  • SDV 관점: “패턴이 보인다”는 보고를 검증하는 절차
  • 결론: 고르게 섞였다면, 오히려 그게 이상한 것이다

(확률과 우연의 세계) 무작위 숫자는 왜 고르게 흩어지지 않는가? — 군집 착각

통계기초
확률
2014년 스포티파이는 완벽하게 무작위한 셔플 알고리즘을 일부러 덜 무작위하게 바꿨다. 진짜 무작위 셔플은 같은 아티스트의 곡이 연달아 나오는 경우가 너무 잦아서, 이용자들이 ’무작위가 아니다’라고 항의했기 때문이다. 진짜 무작위는 고르게 흩어지지 않고 뭉친다는 사실이 왜 이렇게 반직관적인지 살펴본다.
Author

권세혁

Published

September 23, 2026

완벽하게 무작위였는데, 무작위가 아니라는 항의가 빗발쳤다

2014년 스포티파이는 재생목록 셔플 기능에 수학적으로 완벽한 무작위 알고리즘(피셔-예이츠 셔플)을 쓰고 있었다. 그런데도 이용자 항의가 끊이지 않았다. “같은 가수 노래가 왜 자꾸 연달아 나오죠? 이거 무작위 아니잖아요.” 스포티파이 엔지니어링 블로그는 결국 이렇게 인정했다 — 진짜 무작위는 원래 이렇게 뭉치기 마련이라고. 그래서 스포티파이는 같은 아티스트의 곡이 너무 가까이 배치되지 않도록, 알고리즘을 일부러 덜 무작위하게 바꿨다. 2005년 애플도 같은 문제를 겪었다. 스티브 잡스는 당시 발표 자리에서 이렇게 말했다. “우리 셔플이 무작위가 아니라는 사람들이 많더군요. 사실은 완벽하게 무작위입니다. 다만 무작위라는 게 가끔은 같은 아티스트의 두 곡이 나란히 나온다는 뜻이기도 하죠 … 그래서 스마트 셔플을 추가해 일부러 덜 무작위하게 만들었습니다 — 사람들은 그게 더 무작위하다고 느끼겠지만, 사실은 그 반대입니다.”

A 30-song playlist from 5 artists (6 songs each, one color per artist), arranged two ways. Top: a genuinely random shuffle - notice the clumps of same-color squares. Bottom: songs deliberately spaced round-robin style so no artist repeats back-to-back. Both are valid orderings, but only the bottom one ‘feels’ random to most listeners.

30곡을 진짜로 섞으면, 99.6% 확률로 어디선가 같은 아티스트가 연달아 나온다

이게 얼마나 흔한 일인지 직접 계산해보자. 5명의 아티스트가 각 6곡씩, 총 30곡짜리 재생목록을 진짜 무작위로 섞는다고 하자.

10,000 simulations of a truly random 30-song shuffle (5 artists, 6 songs each): how many back-to-back same-artist pairs show up. Getting zero such pairs happens only 0.4% of the time - almost every real shuffle has several clumps, averaging about 5 adjacent same-artist pairs per playlist.

시뮬레이션 결과, 같은 아티스트가 한 번도 연달아 나오지 않는 “완벽하게 고른” 셔플은 0.4%밖에 안 된다. 평균적으로 한 재생목록에 이런 “뭉침”이 5번쯤 생긴다. 즉 이용자들이 항의한 “왜 자꾸 같은 가수가 연달아 나오죠?”라는 현상은 버그가 아니라, 진짜 무작위가 원래 하는 일이었다.

사람은 “고르게 흩어진 것”을 무작위라고 착각한다

우리 뇌는 무작위를 “예측할 수 없을 만큼 고르게 퍼진 상태”로 상상한다. 그런데 수학적으로 진짜 무작위(각 사건이 서로 독립)는 정반대다 — 뭉치거나 비는 구간이 생기는 게 오히려 자연스럽다. 오히려 뭉침이나 빈 구간이 전혀 없이 고르게 퍼진 배열은, 누군가 의도적으로 배치를 조정했다는 증거에 가깝다. 이 착각을 군집 착각(clustering illusion)이라 부른다. 제2차 세계대전 당시 런던 시민들이 독일군 V-1 로켓의 낙하 지점이 “특정 구역에 집중된 패턴”을 보인다며 그 지역에 스파이가 있다고 의심했던 사례도 같은 착각이었다 — 훗날 통계 분석 결과, 낙하 지점은 순수한 무작위(포아송) 분포와 통계적으로 구별되지 않았다.

군집 착각을 피하는 법
  1. “고르게 흩어져야 무작위답다”는 직관을 의심하라. 진짜 무작위는 뭉침과 빈 구간을 만드는 게 정상이다.
  2. 뭉쳐 보이는 패턴을 발견하면, 그게 순수한 우연으로 나올 확률부터 계산해보라. 오늘처럼 계산해보면 “이상한 뭉침”이 사실은 “가장 흔한 결과”인 경우가 많다.
  3. “덜 무작위하게” 설계된 시스템(플레이리스트 셔플, 좌석 배치 등)은 사용자 경험을 위한 것이지, 통계적 무작위성의 정의와는 다르다는 걸 구분하라.

더 깊이: 포아송 과정은 원래 뭉친다

강의노트 〈수리통계학 5. 유명분포 — 포아송분포〉는 사건들이 서로 독립적으로, 일정한 평균 발생률로 일어나는 과정을 포아송 과정으로 정의한다. 포아송 과정의 핵심은 사건 사이의 간격이 무작위(지수분포)라는 데 있다 — 간격이 일정하게 고정된 게 아니라 들쭉날쭉하다. 그 결과 짧은 구간에 사건이 몰리는 뭉침과, 사건이 뜸한 빈 구간이 함께 나타난다. 오늘 살펴본 플레이리스트 셔플이나 런던 폭격 지점이나, 수학적으로는 모두 “독립적인 사건들이 무작위 간격으로 발생한다”는 같은 포아송적 구조를 공유한다.

SDV 관점: “패턴이 보인다”는 보고를 검증하는 절차

무작위 배열에서 뭉침이 나올 확률을 계산하는 건 요약과 추론(1~2단계)에 해당하는 확률 계산이다. 제가 제안하는 SDV(통계적 데이터 가치화) 관점에서 이 문제가 중요한 이유는, 현업에서 “패턴이 보인다”는 보고가 끊임없이 올라오기 때문이다 — 특정 시간대에 불량품이 몰렸다, 특정 영업일에 고객 이탈이 몰렸다, 특정 구역에 사고가 몰렸다는 식이다. 오늘 확인했듯, 완전히 무작위한 과정에서도 이런 “몰림”은 기본값에 가깝다. 데이터를 가치 있는 결정으로 연결하려면, 뭉침을 발견한 즉시 원인을 찾아 나서기 전에 “이 정도 뭉침이 순수한 우연으로 나올 확률이 얼마인가”부터 계산해야 한다. 그 확률이 낮을 때만 자원을 들여 원인을 추적하는 것이, AI 시대에 통계학자가 설계해야 할 가치 있는 의사결정 절차다. (SDV(데이터 가치화))

결론: 고르게 섞였다면, 오히려 그게 이상한 것이다

나는 학생들에게 셔플 버튼을 누르고 같은 가수 노래가 연달아 나오면, 그걸 “앱이 이상하다”는 증거가 아니라 “무작위가 제대로 작동하고 있다”는 증거로 받아들이라고 말한다. 스포티파이와 애플이 결국 알고리즘을 “덜 무작위하게” 바꾼 이유는 수학이 틀려서가 아니라, 사람의 직관에 맞추기 위해서였다. 진짜 우연 앞에서는, 고르게 흩어지지 않는 쪽이 오히려 정상이다.

참고 자료
  • Spotify Engineering, How to Shuffle Songs? (2014) — rnd.atspotify.com/how-to-shuffle-songs
  • Spotify Engineering, Shuffle: Making Random Feel More Human (2025) — engineering.atspotify.com
 
 

방문자 수 since 2026.08.08