2026/03 3

# 위클리페이퍼 12

Q1. 데이터 간의 유사도를 계산할 때, feature의 수가 많다면(예: 100개 이상), 이러한 high-dimensional clustering 문제를 해결하기 위한 방법들을 설명해 주세요. feature의 수가 많아지는 고차원 데이터(high-dimensional data)에서는 차원의 저주(Curse of Dimensionality)가 발생한다. 이 경우 데이터 간 거리가 서로 비슷해지면서 유사도 기반의 클러스터링 성능이 저하되는 문제가 발생한다. 이를 해결하기 위한 주요 방법은 다음과 같다. 차원 축소(Dimensionality Reduction)PCA, t-SNE, UMAP 등의 방법을 사용하여 데이터의 주요 정보는 유지하면서 feature 수를 줄인다.노이즈나 불필요한 변수를 제거하여 클..

# 위클리페이퍼 11

Q1. 결정 트리의 장점과 단점은 무엇인가요? 장점1. 해석이 쉽다트리 구조로 의사결정 과정을 시각적으로 표현할 수 있기 때문에 결과를 이해하고 설명하기 쉽다. 그래서 금융, 의료처럼 모델 설명이 중요한 분야에서 많이 사용된다. 2. 비선형 관계를 잘 처리한다선형 모델과 달리 변수 간 복잡한 비선형 관계도 분할 기준을 통해 자연스럽게 모델링할 수 있다. 3. 데이터 전처리가 비교적 적다정규화나 스케일링 같은 전처리 과정이 크게 필요 없고, 범주형·수치형 변수 모두 사용 가능하다. 4. 변수 중요도 파악이 쉽다.feature importance를 직관적으로 이해할 수 있다. 단점1. 과적합(Overfitting)에 취약트리가 깊어질수록 학습 데이터의 노이즈까지 학습해 일반화 성능이 떨어질 수 있다. 2. ..

# 위클리페이퍼 10

Q1. 모델 학습 시 발생할 수 있는 편향과 분산에 대해 설명하고, 두 개념의 관계에 대해 설명해 주세요. 편향정의모델이 실제 데이터의 패턴을 충분히 반영하지 못해서 발생하는 오차.모델이 너무 단순해서 틀리는 것 특징학습 데이터에서 성능이 낮다과소적합단순 모델에서 많이 발생 분산 (Variance) 정의 학습 데이터에 과하게 맞춰져서 데이터가 조금만 바뀌어도 예측이 크게 달라지는 현상.데이터에 과몰입해서 틀리는 것 특징 훈련 성능은 매우 좋음테스트 성능은 나쁨과적합(Overfitting) Q2 .K-폴드 교차 검증에서 K의 값을 선택할 때 고려해야 할 점은 무엇인가요? K-폴드 교차 검증이란?데이터를 K개로 나누고 K번 학습하면서각 Fold를 번갈아 Validation으로 사용하는 방식. K를 선택할..