학습 기록/코드잇 데이터분석 부트캠프

# 위클리페이퍼 10

dataminutestone 2026. 3. 3. 09:11

Q1. 모델 학습 시 발생할 수 있는 편향과 분산에 대해 설명하고, 두 개념의 관계에 대해 설명해 주세요.

 

편향

정의
모델이 실제 데이터의 패턴을 충분히 반영하지 못해서 발생하는 오차.

모델이 너무 단순해서 틀리는 것

 

특징

학습 데이터에서 성능이 낮다

과소적합

단순 모델에서 많이 발생

 

분산 (Variance)

정의

학습 데이터에 과하게 맞춰져서 데이터가 조금만 바뀌어도 예측이 크게 달라지는 현상.

데이터에 과몰입해서 틀리는 것

 

특징

훈련 성능은 매우 좋음

테스트 성능은 나쁨

과적합(Overfitting)

 

Q2 .K-폴드 교차 검증에서 K의 값을 선택할 때 고려해야 할 점은 무엇인가요?

 

K-폴드 교차 검증이란?

데이터를 K개로 나누고 K번 학습하면서
각 Fold를 번갈아 Validation으로 사용하는 방식.

 

K를 선택할 때 고려할 점

 

1. 데이터 크기

데이터가 작으면 K를 더 크게, 데이터가 크면 K를 더 작게 줄여도 됨

 

2. Bias–Variance 관점

K를 크게 할수록 검증 점수의 분산이 커질 수 있다.

 

3. 계산비용

K가 커질수록 모델을 K번 학습해야 하므로 연산량이 증가한다.

 

'학습 기록 > 코드잇 데이터분석 부트캠프' 카테고리의 다른 글

# 위클리페이퍼 12  (0) 2026.03.16
# 위클리페이퍼 11  (0) 2026.03.09
# 위클리페이퍼 9  (0) 2026.02.23
위클리 페이퍼 #8  (0) 2026.01.19
# 위클리페이퍼 6  (0) 2026.01.05