군집・비지도학습: 개념 및 군집개수 결정
1 군집·비지도학습 개념
1.1 비지도학습의 개요
비지도학습은 정답 레이블 \(y\)가 주어지지 않은 상태에서 데이터 \(X\) 자체가 가진 구조를 찾아내는 학습 패러다임이다.
- 지도학습: “입력 \(X\)로부터 출력 \(y\)를 예측”하는 문제
- 비지도학습: “입력 \(X\)의 분포와 기하학적 형태를 이해”하는 문제
이때 ’정답이 없다’는 말은 임의적이거나 주관적이라는 뜻이 아니라, 문제 자체가 기술적·탐색적 성격을 갖는다는 뜻이다. 따라서 비지도학습의 결과는 어떤 단일한 정답이라기보다, 데이터에 대한 하나의 구조적 제안이다.
1.2 군집의 핵심 질문
군집 분석에서 반드시 답해야 할 핵심 질문은 네 가지로 정리된다.
군집은 “비슷함”의 형식화에 달려 있으며, 이 비슷함은 대개 거리(distance) 또는 유사도(similarity)로 정의된다. 어떤 거리를 쓰는가에 따라 군집 결과가 달라지는 것은 자연스러운 현상이다.
예를 들어 k-means는 군집 내 제곱거리합을 최소화하는 반면, 계층적 군집은 병합 기준(linkage)에 따라 다른 목적을 암묵적으로 채택한다. 모델 기반 군집은 우도를 최대화한다.
\(K\)는 데이터가 “본질적으로 몇 개의 집단으로 나뉜다”는 형이상학적 질문이 아니라, 분석 목적과 단순성-설명력의 균형에 의해 정해지는 선택 문제이다. 이 때문에 Elbow, Silhouette, 정보 기준(AIC/BIC) 등이 사용된다.
지도학습처럼 정답과의 오차로 평가할 수 없으므로, 내부 타당도(internal validity), 안정성(stability), 외부 정보가 있을 때의 외부 타당도(external validity) 등을 조합하여 평가한다.
1.3 군집화의 수학적 표현
관측치가 \(n\)개이고 각 관측치가 \(p\)차원 벡터일 때,
\[X = \{x_1, x_2, \ldots, x_n\}, \quad x_i \in \mathbb{R}^p\]
군집화의 결과는 각 관측치에 군집 라벨 \(z_i \in \{1, \ldots, K\}\)를 부여하는 것이며, \(z = (z_1, \ldots, z_n)\)으로 나타낼 수 있다.
\(z\)는 관측되지 않았고, 군집 알고리즘이 \(z\)를 “추정”한다. 그러나 이 ’추정’은 지도학습의 정답 회귀·분류와 달리, 정의된 목적함수/가정/거리 하에서 얻어진 최적화 결과이다.
1.4 군집화의 통계적 관점
군집은 통계적으로 다음 세 가지 관점을 동시에 갖는다.
- 기하학적 관점
- 데이터 공간에서 거리나 각도에 의해 가까운 점을 묶는 문제이다.
- 분산 분해 관점
- 전체 변동(total variation)을 군집 내 변동(within)과 군집 간 변동(between)으로 나누어 해석하는 문제이다.
- 확률모형 관점
- 데이터가 혼합분포(mixture)에서 생성되었다고 보고 잠재집단(latent class)을 추정하는 문제이다.
2 군집의 통계적 정의
군집화(clustering)는 관측치 집합 \(X = \{x_1, \ldots, x_n\}\)를 \(K\)개의 집단으로 분할하는 문제이다. 각 관측치 \(x_i \in \mathbb{R}^p\)에 대해 군집 라벨 \(z_i \in \{1, \ldots, K\}\)를 부여하며, 군집 \(k\)는
\[C_k = \{i : z_i = k\}\]
로 정의된다.
군집화는 지도학습처럼 정답 라벨이 존재하지 않으므로, “올바른 분류”라는 기준 대신 유사성의 정의와 변동의 분해를 통해 통계적으로 정당화된다.
데이터를 \(K\)개의 부분집합으로 분할하여, 군집 내 변동(WSS)을 작게 하고 군집 간 변동(BSS)을 크게 만드는 구조를 찾는 것
이때 그 출발점은 거리(또는 유사도)의 선택이며, 거리의 선택은 곧 군집 결과의 의미를 규정하는 분석자의 가정이다.
2.1 거리 기반 유사성의 정의
군집의 출발점은 “비슷함”을 수학적으로 표현하는 일이다. 이를 위해 가장 흔히 사용하는 도구가 거리(distance) 또는 비유사도(dissimilarity)이다.
일반적으로 거리함수 \(d(\cdot, \cdot)\)는 다음 성질을 만족하는 것이 이상적이다.
| 성질 | 수식 |
|---|---|
| 비음수성 | \(d(x, y) \geq 0\) |
| 동일성 | \(d(x, y) = 0 \Leftrightarrow x = y\) |
| 대칭성 | \(d(x, y) = d(y, x)\) |
| 삼각부등식 | \(d(x, z) \leq d(x, y) + d(y, z)\) |
이 네 조건을 모두 만족하면 \(d\)는 척도(metric)이다. 다만 군집 실무에서는 반드시 metric일 필요는 없고, 목적에 맞는 비유사도를 쓰는 것이 더 중요하다.
2.1.1 유클리드 거리(Euclidean Distance)
연속형 변수에서 가장 표준적으로 쓰는 거리이다.
\[d_E(x_i, x_j) = \sqrt{\sum_{m=1}^{p}(x_{im} - x_{jm})^2}\]
유클리드 거리는 좌표공간에서의 직선거리이며, k-means의 기본 가정과 가장 잘 맞는다.
변수 스케일이 다르면 큰 분산을 가진 변수가 거리를 지배하는 문제가 발생한다. 따라서 단위가 다른 변수가 섞인 자료에서는 표준화(예: z-score)가 사실상 필수이다.
2.1.2 맨해튼 거리(Manhattan Distance)
절댓값 합으로 정의되는 거리이다.
\[d_M(x_i, x_j) = \sum_{m=1}^{p}|x_{im} - x_{jm}|\]
맨해튼 거리는 좌표축 방향 이동거리이며, 이상치에 대해 유클리드 거리보다 덜 민감한 경우가 많다.
특히 고차원에서 유클리드 거리의 제곱항이 큰 차이를 과장할 수 있는데, 이때 맨해튼 거리가 더 안정적인 대안이 되기도 한다.
2.1.3 민코프스키 거리(Minkowski Distance)
유클리드와 맨해튼을 포함하는 일반화된 거리이다.
\[d_q(x_i, x_j) = \left(\sum_{m=1}^{p}|x_{im} - x_{jm}|^q\right)^{1/q}, \quad q \geq 1\]
- \(q = 2\)이면 유클리드 거리
- \(q = 1\)이면 맨해튼 거리
- \(q\)가 커질수록 큰 차이를 더 강조하는 거리
2.1.4 코사인 거리(Cosine Distance)
텍스트 임베딩, 고차원 희소벡터에서 자주 쓰는 유사도 기반 척도이다. 코사인 유사도는 두 벡터의 각도를 이용한다.
\[\cos(x_i, x_j) = \frac{x_i^\top x_j}{\|x_i\| \|x_j\|}\]
거리로 쓰려면 보통 \(d_C(x_i, x_j) = 1 - \cos(x_i, x_j)\)로 정의한다.
코사인 거리는 크기(magnitude)보다 방향(direction)에 민감하므로, 문서 길이 차이 같은 스케일 요인을 덜 받는다.
2.1.5 마할라노비스 거리(Mahalanobis Distance)
변수들 간 상관과 스케일을 동시에 고려하는 거리이다. 공분산행렬을 \(\Sigma\)라 하면
\[d_{\text{Mah}}(x_i, x_j) = \sqrt{(x_i - x_j)^\top \Sigma^{-1}(x_i - x_j)}\]
유클리드 거리가 “구형(spherical)” 등거리 곡면을 가지는 데 비해, 마할라노비스 거리는 공분산 구조에 따라 “타원형(elliptical)” 등거리 곡면을 가진다.
\(\Sigma^{-1}\) 추정이 불안정한 고차원(\(p\)가 크고 \(n\)이 작음)에서는 정규화나 차원축소가 필요하다.
2.2 군집의 분할과 지시변수 표현
군집 분할은 지시변수(indicator)로도 표현된다. \(h_{ik} \in \{0, 1\}\)를
\[h_{ik} = \begin{cases} 1, & z_i = k \\ 0, & \text{otherwise} \end{cases}\]
로 두면, 각 관측치는 정확히 하나의 군집에 속하므로 \(\sum_{k=1}^{K} h_{ik} = 1 \; (i = 1, \ldots, n)\)이다.
군집 \(k\)의 크기는 \(n_k = \sum_{i=1}^{n} h_{ik}\)이며, 군집 평균(centroid)은
\[\mu_k = \frac{1}{n_k}\sum_{i: z_i = k} x_i = \frac{1}{n_k}\sum_{i=1}^{n} h_{ik} x_i\]
로 정의된다. 이 \(\mu_k\)는 k-means에서 군집을 대표하는 중심으로 사용된다.
2.3 Within/Between Variance의 통계적 의미
| 조건 | 의미 |
|---|---|
| 응집도(Cohesion) | 같은 군집 내부에서 관측치가 서로 가깝다 |
| 분리도(Separation) | 서로 다른 군집 사이에서 중심이 멀다 |
이를 통계적으로 표현하는 대표적 방식이 총변동의 분해이다. 전체 평균을 \(\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i\)라 하자.
\[\text{TSS} = \sum_{i=1}^{n} \|x_i - \bar{x}\|^2 \quad \text{(전체 제곱합)}\]
\[\text{WSS} = \sum_{k=1}^{K}\sum_{i: z_i = k} \|x_i - \mu_k\|^2 \quad \text{(군집 내 제곱합)}\]
\[\text{BSS} = \sum_{k=1}^{K} n_k \|\mu_k - \bar{x}\|^2 \quad \text{(군집 간 제곱합)}\]
\[\text{TSS} = \text{WSS} + \text{BSS}\]
이는 분산분해의 다변량 버전이다. 각 관측치에 대해
\[x_i - \bar{x} = (x_i - \mu_{z_i}) + (\mu_{z_i} - \bar{x})\]
로 분해하고 양변의 제곱노름을 합하면 교차항이 0이 되는 구조가 나타난다. 교차항이 0이 되는 이유는 각 군집에서 \(\sum_{i: z_i = k}(x_i - \mu_k) = 0\)이기 때문이다.
핵심 결론: \(\text{TSS}\)는 데이터가 주어지면 고정된 값이므로, \(\text{WSS}\)를 최소화하는 것은 동시에 \(\text{BSS}\)를 최대화하는 것과 동치이다.
따라서 k-means는 다음 최적화 문제로 정리된다.
\[\min_{z_1, \ldots, z_n} \sum_{k=1}^{K}\sum_{i: z_i = k} \|x_i - \mu_k\|^2\]
이는 “군집 내 변동을 최소화”한다는 통계적 정의에 해당한다.
2.4 군집 품질에 대한 해석적 기준
군집은 정답이 없으므로, 군집 품질은 목적함수 값뿐 아니라 해석 가능성까지 포함한다.
\(\text{WSS}\)를 극단적으로 줄이려면 \(K = n\)으로 잡으면 되므로, 단순히 \(\text{WSS}\)를 최소화하는 것이 목표가 아니다. 군집은 항상 단순성(적은 \(K\))과 적합도(작은 WSS, 큰 BSS) 사이에서 균형을 선택하는 문제이다. 이 균형의 선택이 바로 군집 수 결정 문제로 이어진다.
3 군집 개수 결정
군집 수 \(K\)의 결정은 군집 분석에서 가장 중요한 선택 문제이다. 지도학습에서는 정답 \(y\)가 존재하므로 예측오차를 최소화하는 \(K\)를 논할 수 있으나, 군집은 정답이 없으므로 “진짜 \(K\)”를 찾는 문제가 아니다.
| 방법 | 원리 | 적용 상황 |
|---|---|---|
| Elbow | WSS 감소의 꺾임으로 \(K\) 선택 | k-means·거리 기반 군집 |
| Silhouette | 응집도-분리도 균형이 최대인 \(K\) 선택 | 일반적 군집 |
| 정보 기준(AIC/BIC) | 로그우도에 복잡도 패널티 부여 | 모델 기반 군집(GMM) |
이들 방법은 서로 보완적이며, \(K\)는 “발견”되는 값이 아니라 데이터와 목적에 근거하여 설득력 있게 선택되는 값이다.
3.1 Elbow 방법
Elbow 방법은 \(K\)가 증가함에 따라 군집 내 변동이 감소하는 양상을 이용하여 “감소 폭이 급격히 둔화되는 지점”을 \(K\)로 선택하는 방법이다.
\[\text{WSS}(K) = \sum_{k=1}^{K}\sum_{i: z_i = k} \|x_i - \mu_k\|^2\]
\(K\)가 커질수록 각 군집이 더 잘게 쪼개지므로 \(\text{WSS}(K)\)는 단조감소한다. 극단적으로 \(K = n\)이면 각 점이 하나의 군집이 되어 \(\text{WSS}(n) = 0\)이 된다. 따라서 \(\text{WSS}(K)\)의 절대값만으로는 \(K\)를 결정할 수 없으며, 감소 곡선의 “형태”를 본다.
3.1.1 Elbow의 해석
| 상황 | 의미 |
|---|---|
| 작은 \(K\) | 군집이 거칠어 WSS가 크다 |
| 큰 \(K\) | 군집이 과도하게 세분화되어 WSS가 작지만 복잡하다 |
| 적절한 \(K\) | WSS 감소의 효율이 급격히 떨어지기 시작하는 지점 |
\(K\)에 대한 \(\text{WSS}(K)\) 그래프에서, 초기에 \(K\)를 늘리면 군집 내 변동이 크게 줄어들지만 어느 시점 이후부터는 감소 폭이 작아진다. 이 꺾이는 지점(elbow)은 “군집을 더 늘려도 추가 설명력이 크지 않다”는 의미로 해석된다.
3.1.2 Elbow의 한계
- 시각적 판단 의존: 꺾임이 불명확하면 결론이 애매해진다.
- 연속 스펙트럼 데이터: 뚜렷한 군집이 없으면 WSS 곡선이 완만하게 감소하여 명확한 elbow가 나타나지 않을 수 있다.
- 단독 사용 부적절: 다른 지표(Silhouette, BIC 등)와 함께 사용하는 것이 바람직하다.
3.1.3 표준화와 거리의 영향
Elbow는 거리 기반 목적함수(WSS)에 의존하므로, 표준화 여부와 거리 척도 선택이 \(\text{WSS}(K)\) 곡선 자체를 바꾼다. Elbow를 적용할 때는 “내가 어떤 거리에서 군집을 보고 있는가”를 먼저 고정해야 한다.
3.2 Silhouette 방법
Silhouette 방법은 “군집 내 응집도(cohesion)”와 “군집 간 분리도(separation)”를 동시에 반영하는 내부 타당도 지표이다.
각 관측치 \(i\)에 대해:
\(a(i)\): 관측치 \(i\)가 속한 군집 내부에서 다른 점들과의 평균거리
\[a(i) = \frac{1}{|C_{z_i}| - 1}\sum_{\substack{j \in C_{z_i} \\ j \neq i}} d(x_i, x_j)\]
\(b(i)\): 관측치 \(i\)가 속하지 않은 다른 군집들 중, 평균거리가 가장 작은 군집까지의 평균거리
\[b(i) = \min_{l \neq z_i}\frac{1}{|C_l|}\sum_{j \in C_l} d(x_i, x_j)\]
실루엣 계수(Silhouette Coefficient)
\[s(i) = \frac{b(i) - a(i)}{\max\{a(i), b(i)\}}\]
3.2.1 값의 범위와 의미
3.2.2 Silhouette의 장점
- WSS처럼 단순히 “군집 내 변동”만 보는 것이 아니라, “다른 군집과의 분리”까지 포함한다는 점에서 균형 잡힌 지표이다.
- 점 단위로 \(s(i)\)를 볼 수 있어, 어떤 점들이 경계에 있거나 불안정한지를 진단할 수 있다.
3.2.3 Silhouette의 한계
- 거리 척도 민감: 거리 계산에 기반하므로, 거리 척도 선택과 표준화 여부에 민감하다.
- 비구형 군집: 비구형 군집이나 밀도 차이가 큰 군집에서는 점들 간 평균거리 기반 요약이 군집 구조를 충분히 반영하지 못할 수 있다.
- 계산 비용: 큰 \(n\)에서는 모든 점 쌍 거리 계산이 부담이 될 수 있어 근사적 계산을 쓰기도 한다.
3.3 정보 기준(AIC/BIC)과 군집 수 결정
정보 기준은 모델 기반 군집에서 \(K\)를 결정하는 대표적 방법이다. 모델 기반 군집에서는 데이터가 \(K\)개의 성분분포의 혼합으로 생성된다고 가정하고, \(K\)에 따라 모형의 복잡도(추정 모수 개수)가 달라진다.
단순히 우도(likelihood)를 최대화하면 \(K\)가 커질수록 유리해지므로, 우도에 복잡도 패널티를 부과한 기준이 필요하다. 그 대표가 AIC와 BIC이다.
3.3.1 로그우도와 모수 개수
GMM에서 \(K\)가 주어졌을 때 최대우도추정치 \(\hat{\Theta}_K\)로 계산한 로그우도는
\[\ell(\hat{\Theta}_K) = \sum_{i=1}^{n}\log\left(\sum_{k=1}^{K}\hat{\pi}_k \mathcal{N}(x_i \mid \hat{\mu}_k, \hat{\Sigma}_k)\right)\]
모수의 개수 \(m_K\)는 \(K\), 차원 \(p\), 공분산 구조(자유/대각/공유)에 따라 달라진다.
| 파라미터 | 개수 |
|---|---|
| 평균 (군집당 \(p\)개) | \(Kp\) |
| 공분산 (군집당 \(p(p+1)/2\)개) | \(K \cdot \frac{p(p+1)}{2}\) |
| 혼합계수 (합이 1이므로) | \(K - 1\) |
\[m_K = (K-1) + Kp + K\cdot\frac{p(p+1)}{2}\]
대각 공분산이면 공분산 모수는 군집당 \(p\)개로 줄어든다.
3.3.2 AIC
\[\text{AIC}(K) = -2\ell(\hat{\Theta}_K) + 2m_K\]
AIC는 적합도(로그우도)를 좋게 하되(첫 항), 모수 개수가 많아지는 것을 패널티(둘째 항)로 억제한다. AIC는 상대적으로 복잡한 모형을 선택하는 경향이 있으며, 예측 관점에서 유리한 경우가 있다.
3.3.3 BIC
\[\text{BIC}(K) = -2\ell(\hat{\Theta}_K) + m_K \log n\]
BIC는 \(n\)이 커질수록 패널티가 강해지므로, AIC보다 단순한 모형을 선택하는 경향이 있다. 군집 수 선택에서는 BIC가 널리 사용되며, 특히 혼합모형에서 “군집 수를 과도하게 키우는” 문제를 억제하는 데 유리하다.
3.3.4 정보 기준의 해석
AIC/BIC는 절대값 자체보다 “\(K\)에 따른 비교”가 핵심이며, 값이 작은 \(K\)가 선호된다.
\[\hat{K} = \arg\min_K \text{AIC}(K), \qquad \hat{K} = \arg\min_K \text{BIC}(K)\]
실무 팁: 혼합모형은 국소해 문제가 있으므로, 각 \(K\)마다 EM을 여러 초기값에서 실행하고 가장 큰 로그우도를 사용하는 것이 기본이다.
3.4 실무적 결론: 근거의 조합
군집 수 결정은 보통 하나의 지표로 끝나지 않는다.
거리 기반 군집(k-means 등)
- Elbow로 “감소 효율의 변화”를 파악한다.
- Silhouette로 “응집-분리 균형”을 확인한다.
모델 기반 군집(GMM)
- BIC(AIC)로 “적합도-복잡도 균형”을 평가한다.
- 소속확률(책임도) 분포로 군집 경계의 불확실성을 점검한다.
최종 선택
- 분석 목적(해석 단위, 정책 타깃 수, 운영 가능 군집 수)과 일관되어야 한다.
군집 수 \(K\)는 자연상수처럼 “발견”되는 값이 아니라, 데이터와 목적에 근거하여 설득력 있게 선택되는 값이다. 군집은 정답을 찾는 문제가 아니라 구조를 제안하는 문제라는 관점에서, \(K\) 역시 “근거를 갖춘 선택”으로 이해되어야 한다.