학습 기록/코드잇 데이터분석 부트캠프

# 위클리페이퍼 12

dataminutestone 2026. 3. 16. 08:50

Q1. 데이터 간의 유사도를 계산할 때, feature의 수가 많다면(예: 100개 이상), 이러한 high-dimensional clustering 문제를 해결하기 위한 방법들을 설명해 주세요.

feature의 수가 많아지는 고차원 데이터(high-dimensional data)에서는 차원의 저주(Curse of Dimensionality)가 발생한다. 이 경우 데이터 간 거리가 서로 비슷해지면서 유사도 기반의 클러스터링 성능이 저하되는 문제가 발생한다. 이를 해결하기 위한 주요 방법은 다음과 같다.

 

 

  • 차원 축소(Dimensionality Reduction)
    • PCA, t-SNE, UMAP 등의 방법을 사용하여 데이터의 주요 정보는 유지하면서 feature 수를 줄인다.
    • 노이즈나 불필요한 변수를 제거하여 클러스터 구조를 더 잘 드러낼 수 있다.
  • Feature Selection(특성 선택) - 트리모델에서 가지치기와 비슷
    • 클러스터링에 크게 기여하지 않는 변수들을 제거하고 중요한 feature만 선택한다.
    • 분산 기반 방법이나 상관관계 분석 등을 활용할 수 있다.
  • 차원에 안정적인 알고리즘 사용
    • DBSCAN, Spectral Clustering, Subspace Clustering 같은 방법은 고차원 데이터에서도 비교적 안정적으로 동작할 수 있다.

 

 

 

Q2. 차원 축소 기법인 주성분 분석과 요인 분석의 차이는 무엇인지 설명해 주세요.

 

구분 주성분 분석 요인분석
목적 데이터의 분산을 최대한 보존하면서 차원 축소 관측 변수 뒤에 있는 잠재 요인(latent factor)을 찾는 것
접근 방식 전체 분산(total variance)을 설명하는 새로운 축 생성 변수 간 공통 분산(common variance)을 설명
모델 가정 통계적 모델 가정이 없음 잠재 변수 모델을 가정
활용 목적 데이터 압축, 시각화, 전처리 심리학, 사회과학 등에서 잠재 요인 분석

 

즉, PCA는 데이터 구조를 단순화하는 데 목적이 있고,
요인 분석은 변수 뒤에 숨은 잠재 요인을 해석하는 데 목적이 있다는 차이가 있다.

 

Q3. 히스토그램의 주요 단점은 무엇이며, 이를 극복하기 위한 대안적인 시각화 방법을 설명해 주세요.

주요 장점

 

1. 데이터 분포를 직관적으로 확인 가능
히스토그램은 값의 구간(bin)별 빈도를 막대 형태로 보여주기 때문에 데이터가 어떤 구간에 많이 분포하는지 한눈에 파악할 수 있다.
예를 들어 정규분포 형태인지, 치우침(skewness)이 있는지, 여러 개의 봉우리가 있는지(multimodal) 등을 쉽게 확인할 수 있다.

 

2. 이상치(outlier)나 데이터 밀집 구간 확인이 쉬움
특정 구간에 데이터가 거의 없거나 갑자기 튀는 구간이 있으면 바로 확인할 수 있어 데이터 탐색(EDA) 단계에서 유용하다.

 

3. 계산과 구현이 매우 단순함
히스토그램은 단순히 데이터를 구간으로 나누고 빈도만 계산하면 되기 때문에 계산 비용이 낮고 구현이 쉽다.
그래서 대부분의 데이터 분석 라이브러리에서 기본적으로 제공되는 시각화 방법이다.

 

4. 데이터의 전체적인 형태를 빠르게 파악 가능
복잡한 모델링이나 통계 기법을 사용하지 않아도 데이터의 대략적인 분포 형태를 빠르게 이해할 수 있다.

주요 단점

  1. bin 크기에 따라 결과가 크게 달라짐
    • bin을 어떻게 설정하느냐에 따라 분포 모양이 달라질 수 있다.
  2. 데이터 밀도 구조를 정확히 표현하기 어려움
    • 연속적인 분포를 계단 형태로 표현하기 때문에 실제 분포를 왜곡할 수 있다.
  3. 여러 분포를 비교하기 어려움
    • 여러 집단을 동시에 비교하기에는 시각적으로 복잡해질 수 있다.

대안적인 시각화 방법

  1. KDE (Kernel Density Estimation)
    • 데이터를 부드러운 곡선 형태로 표현하여 실제 확률 밀도 분포를 더 자연스럽게 보여준다.
  2. Box Plot
    • 데이터의 중앙값, 사분위수, 이상치를 한눈에 파악할 수 있어 분포 비교에 유용하다.
  3. Violin Plot
    • KDE와 박스플롯을 결합한 형태로, 분포 형태와 요약 통계를 동시에 보여준다.

이러한 방법들을 사용하면 히스토그램의 한계를 보완하면서 데이터 분포를 더 효과적으로 시각화할 수 있다.

'학습 기록 > 코드잇 데이터분석 부트캠프' 카테고리의 다른 글

# 위클리페이퍼 15 & 16  (0) 2026.04.20
# 위클리페이퍼 11  (0) 2026.03.09
# 위클리페이퍼 10  (0) 2026.03.03
# 위클리페이퍼 9  (0) 2026.02.23
위클리 페이퍼 #8  (0) 2026.01.19