학습 기록/코드잇 데이터분석 부트캠프

# 위클리페이퍼 11

dataminutestone 2026. 3. 9. 09:10

Q1. 결정 트리의 장점과 단점은 무엇인가요?

장점

1. 해석이 쉽다

트리 구조로 의사결정 과정을 시각적으로 표현할 수 있기 때문에 결과를 이해하고 설명하기 쉽다. 그래서 금융, 의료처럼 모델 설명이 중요한 분야에서 많이 사용된다.

 

2. 비선형 관계를 잘 처리한다

선형 모델과 달리 변수 간 복잡한 비선형 관계도 분할 기준을 통해 자연스럽게 모델링할 수 있다.

 

3. 데이터 전처리가 비교적 적다

정규화나 스케일링 같은 전처리 과정이 크게 필요 없고, 범주형·수치형 변수 모두 사용 가능하다.

 

4. 변수 중요도 파악이 쉽다.

feature importance를 직관적으로 이해할 수 있다.

 

단점

1. 과적합(Overfitting)에 취약
트리가 깊어질수록 학습 데이터의 노이즈까지 학습해 일반화 성능이 떨어질 수 있다.

 

2. 데이터 변화에 민감 (Instability)
데이터가 조금만 바뀌어도 트리 구조가 크게 달라질 수 있다

 

3. 계단형 예측 결과
트리는 분할 기반이라 연속적인 관계를 부드럽게 표현하지 못하고 계단 형태의 예측이 나타날 수 있다.

 

4. Greedy 알고리즘 한계
각 단계에서 최적 분할을 찾지만 전체 최적 구조를 보장하지 않는다

 

Q2. 부스팅은 어떤 특징을 가진 앙상블 기법인가요? 토픽에서 배운 AdaBoost 이외의 부스팅 모델에는 무엇이 있는지에 대해 구글 등을 활용하여 직접 리서치해보고, 각 부스팅 모델의 특징, 장단점에 대해 말해주세요.

부스팅은 여러 개의 약한 학습기(weak learner)를 순차적으로 학습시키면서 이전 모델이 틀린 데이터를 더 잘 맞추도록 보완해가는 앙상블 방식이다.


(1) Gradient Boosting Machine (GBM)

특징

  • 이전 모델의 오차를 손실 함수의 gradient로 계산하여 다음 모델이 보완하도록 학습

장점

  • 높은 예측 성능
  • 다양한 손실함수 적용 가능

단점

  • 학습 속도가 느림
  • 하이퍼파라미터 튜닝이 복잡

(2) XGBoost (eXtreme Gradient Boosting)

특징

  • GBM을 개선한 모델
  • 정규화(L1, L2) 지원
  • 병렬 처리 지원
  • 조기 종료(Early stopping) 지원

장점

  • 매우 높은 성능
  • 과적합 방지 기능
  • 빠른 학습

단점

  • 모델 구조가 복잡
  • 메모리 사용량이 큰 편

(3) LightGBM

특징

  • Microsoft가 개발
  • Leaf-wise 트리 성장 방식
  • 대규모 데이터에서 매우 빠름

장점

  • 매우 빠른 학습 속도
  • 대용량 데이터 처리에 유리

단점

  • 작은 데이터에서는 과적합 가능
  • 하이퍼파라미터 영향 큼

(4) CatBoost

특징

  • Yandex가 개발
  • 범주형 데이터 처리에 특화

장점

  • 범주형 변수 자동 처리
  • 데이터 전처리 부담 감소

단점

  • 학습 속도가 LightGBM보다 느릴 수 있음
  • 모델 구조 이해가 어려움

  •  데이터가 수백만 건이면 LightGBM이 유리하고, 그보다 작으면 XGBoost가 더 안정적으로 나오는 경우가 많다.
  • 범주형 변수 많으면 CatBoost가 전처리 없이 바로 처리 가능
  • 데이터가 작으면 LightGBM보다 XGBoost가 더 낫다.
  • LightGBM > XGBoost > GBM 순서로 학습 속도가 빠르다

부스팅 모델마다 학습 방식, 속도, 과적합 특성이 달라서 데이터 상황에 따라 성능이 달라지기 때문에 여러 모델을 비교해야 한다.

'학습 기록 > 코드잇 데이터분석 부트캠프' 카테고리의 다른 글

# 위클리페이퍼 15 & 16  (0) 2026.04.20
# 위클리페이퍼 12  (0) 2026.03.16
# 위클리페이퍼 10  (0) 2026.03.03
# 위클리페이퍼 9  (0) 2026.02.23
위클리 페이퍼 #8  (0) 2026.01.19