Q1. 모델 학습 시 발생할 수 있는 편향과 분산에 대해 설명하고, 두 개념의 관계에 대해 설명해 주세요.
편향
정의
모델이 실제 데이터의 패턴을 충분히 반영하지 못해서 발생하는 오차.
모델이 너무 단순해서 틀리는 것
특징
학습 데이터에서 성능이 낮다
과소적합
단순 모델에서 많이 발생
분산 (Variance)
정의
학습 데이터에 과하게 맞춰져서 데이터가 조금만 바뀌어도 예측이 크게 달라지는 현상.
데이터에 과몰입해서 틀리는 것
특징
훈련 성능은 매우 좋음
테스트 성능은 나쁨
과적합(Overfitting)
Q2 .K-폴드 교차 검증에서 K의 값을 선택할 때 고려해야 할 점은 무엇인가요?
K-폴드 교차 검증이란?
데이터를 K개로 나누고 K번 학습하면서
각 Fold를 번갈아 Validation으로 사용하는 방식.
K를 선택할 때 고려할 점
1. 데이터 크기
데이터가 작으면 K를 더 크게, 데이터가 크면 K를 더 작게 줄여도 됨
2. Bias–Variance 관점
K를 크게 할수록 검증 점수의 분산이 커질 수 있다.
3. 계산비용
K가 커질수록 모델을 K번 학습해야 하므로 연산량이 증가한다.
'학습 기록 > 코드잇 데이터분석 부트캠프' 카테고리의 다른 글
| # 위클리페이퍼 12 (0) | 2026.03.16 |
|---|---|
| # 위클리페이퍼 11 (0) | 2026.03.09 |
| # 위클리페이퍼 9 (0) | 2026.02.23 |
| 위클리 페이퍼 #8 (0) | 2026.01.19 |
| # 위클리페이퍼 6 (0) | 2026.01.05 |