카테고리 없음

데이터분석 부트캠프코드잇 데이터분석 부트캠프 3주차

dataminutestone 2025. 11. 14. 20:22

 

* 강의 내용은 구체적으로 적을 수 없어서 생각한 내용과 공부할 것 위주로 적습니다.


 

 

1일차)

 

넘파이, 판다스만 하겠다면 정말 깊게 파야 한다.

Scikit-learn, Plotly, Beauitfulsoup -> 기타 라이브러리 찾아보자

결측치 이상치 제대로 확인해야 한다.

코딩이든 인코딩이든 컴퓨터가 읽기 편하게 만들어주는 것이 핵심

DEA 

뭘 효과적으로 표현할 수 있는지? 

기본적인 데이터 분석가의 사고를 갖추려고 노력할 것

스스로 질문하는 연습

좋은 스토리텔링을 하는 것.....

복원의 유무가 어떤 영향을 미치는 지?

모든지 이슈파악 먼저 할 것!

 

관련된 도메인에 필요한 개인 프로젝트를 진행할 것 !

 

공부할 것)

 

머신러닝 참조 (https://wikidocs.net/223697)

라벨인코딩, 원핫인코딩

엑셀을 통한 데이터 전처리 및 검정통계

외워야 할 공식들 다시 암

스튜던트 t 검정, 웰치 t 검정


 

2일차)

 

2일차부터 개인 과제 실습에 들어갔다.

전반적인 데이터 전처리 방법과 어떻게 진행하면 효율적으로 코딩하여 진행할 수 있을지 고민해야 함.

기본적인 데이터 전처리 (이상치, 결측치, 중복행 제거)는 확실히 알아두자! 🠒 자주 사용될 것 같음..

 

직접 데이터분석을 진행해보니, 정말 고려할 요소도 많고, 생각할 것들이 많다....

 

공부할 것)


3일차)

 

bounds = {}
for col in del_cols:
    Q1 = df1[col].quantile(0.25)
    Q3 = df1[col].quantile(0.75)
    IQR = Q3 - Q1
    bounds[col] = (Q1 - 1.5 * IQR, Q3 + 1.5 * IQR)

cond = (
    (df1['신장(5cm단위)'].between(*bounds['신장(5cm단위)'])) &
    (df1['체중(5kg단위)'].between(*bounds['체중(5kg단위)'])) &
    (df1['허리둘레'].between(*bounds['허리둘레']))
)

df1 = df1[cond].copy()

print("이상치 제거 후 데이터 수:", len(df1))

 

데이터 전처리 과정을 하다보니, 파이썬을 왜 배운지 알겠다......... 

키값과 밸류값을 가진 dict 구조는 가독성을 좋게 코드를 구성할 수 있다..! 

밸류값에는 튜플이 들어갈 수도 있고, 어떤 자료형이든 다 들어갈 수 있다.

또한, 튜플을 다시 언패킹 하는 *을 활용하여 min, max 구조를 구성한 다음 *을 사용해서 진행하면 범위값을 

유지보수도 쉽고, 가독성도 좋게 코딩할 수 있다.

 

연령대코드가 기준년도별로 다른 것을 고려하지 못한 채로 분석을 진행해서 싹 다 망함.. 첨부터 다시 해야하는 줄 알았는데 다시 찾아보니 2022년 분석자료라 괜찮았다.

 

연속형 변수도 단위를 끊으면 범주형 변수가 된다. (예를 들면, 몸무게를 5kg단위로 나눠서 분류한 경우)

 


4일차)

 

범주형, 연속형 등 변수에 대한 깊은 통찰이 필요하다.

변수에 대한 설명 매뉴얼을 굉장히 깊게 이해하는 것 데이터 분석가의 기본이다

 

평균>중앙값 = 오른쪽으로 긴꼬리

평균<중앙값 = 왼쪽으로 긴 꼬리

 

이렇게 알고 있는데, 아닌 경우도 있다고 한다. 퍼센테이지 별 분포를 고려해야 함...profit를 고려할 

 

평균, 중앙값, 최빈값 수치만 보고 그래프가 어떻게 그려질 지 빠르게 파악하는 연습이 필수적이다.

 

# Quize

# 캘리포니아에서 매출이 1000이상인 주문 중, Technology 카테고리만 필터링해서 매출, 이익을 보자.

df[(df['Sales'] >= 1000) & (df['State'] == "California") & (df['Category'] == 'Technology')][['Sales', 'Profit']]

 

필터를 넣는 것이 중요하다 ! 코드는 무조건 꼼꼼하게................

컬럼도 안넣었다............... 

 

원본과 독립적으로 작업해야 할 때는 .copy()를 습관적으로 붙이자..

데이터가 크고 메모리가 작으면 남발 X

 

단위가 다른 요소를 비교 분석하기 위해선 정규화, 표준화가 중요하다.

 

공부할 것)

 

기존 공부했던 코드 복습할 것

정규화/표준화 공식 암기하기


5일차)

 

결측치를 체크할 때, NaN, N/A, NULL, #N/A 등을 삭제하지만, 스페이스바(공백)인 데이터도 결측치로 넘겨질 수 있다.

enumerate함수 잘 활용하기

 

EDA의 개념에 대해서 잘 알아야 한다.

 

 

# 여러 변수 박스플롯 그리기 - subplots 쉽게 지정하는 방식

variables = ['Sales', 'Profit']

plt.figure(figsize=(7,3))

for i, col in enumerate(variables):
    plt.subplot(1, 3, i+1)
    plt.boxplot(df[col].dropna())
    plt.title(f"{col}")
    plt.xticks([])
    plt.yticks([])

plt.tight_layout()
plt.show()

 

프로그래머스 같은 사이트에서 사람들이 코딩으로 논의했던 기록을 보고 공부할 수 있다.

 


 

✅ 주말간 할 일 체크리스트 

1. 여태까지 배운 코딩 따라 쳐보기

2. 위키독스 책 한 권 읽고, 후기 남기기

3. 데이터 책 완독하기

4. SQLD 공부하기

5. 리눅스에 대해서 알아보기