* 강의 내용은 구체적으로 적을 수 없어서 생각한 내용과 공부할 것 위주로 적습니다.
1일차)
넘파이, 판다스만 하겠다면 정말 깊게 파야 한다.
Scikit-learn, Plotly, Beauitfulsoup -> 기타 라이브러리 찾아보자
결측치 이상치 제대로 확인해야 한다.
코딩이든 인코딩이든 컴퓨터가 읽기 편하게 만들어주는 것이 핵심
DEA
뭘 효과적으로 표현할 수 있는지?
기본적인 데이터 분석가의 사고를 갖추려고 노력할 것
스스로 질문하는 연습
좋은 스토리텔링을 하는 것.....
복원의 유무가 어떤 영향을 미치는 지?
모든지 이슈파악 먼저 할 것!
관련된 도메인에 필요한 개인 프로젝트를 진행할 것 !
공부할 것)
머신러닝 참조 (https://wikidocs.net/223697)
라벨인코딩, 원핫인코딩
엑셀을 통한 데이터 전처리 및 검정통계
외워야 할 공식들 다시 암
스튜던트 t 검정, 웰치 t 검정
2일차)
2일차부터 개인 과제 실습에 들어갔다.
전반적인 데이터 전처리 방법과 어떻게 진행하면 효율적으로 코딩하여 진행할 수 있을지 고민해야 함.
기본적인 데이터 전처리 (이상치, 결측치, 중복행 제거)는 확실히 알아두자! 🠒 자주 사용될 것 같음..
직접 데이터분석을 진행해보니, 정말 고려할 요소도 많고, 생각할 것들이 많다....
공부할 것)
3일차)
bounds = {}
for col in del_cols:
Q1 = df1[col].quantile(0.25)
Q3 = df1[col].quantile(0.75)
IQR = Q3 - Q1
bounds[col] = (Q1 - 1.5 * IQR, Q3 + 1.5 * IQR)
cond = (
(df1['신장(5cm단위)'].between(*bounds['신장(5cm단위)'])) &
(df1['체중(5kg단위)'].between(*bounds['체중(5kg단위)'])) &
(df1['허리둘레'].between(*bounds['허리둘레']))
)
df1 = df1[cond].copy()
print("이상치 제거 후 데이터 수:", len(df1))
데이터 전처리 과정을 하다보니, 파이썬을 왜 배운지 알겠다.........
키값과 밸류값을 가진 dict 구조는 가독성을 좋게 코드를 구성할 수 있다..!
밸류값에는 튜플이 들어갈 수도 있고, 어떤 자료형이든 다 들어갈 수 있다.
또한, 튜플을 다시 언패킹 하는 *을 활용하여 min, max 구조를 구성한 다음 *을 사용해서 진행하면 범위값을
유지보수도 쉽고, 가독성도 좋게 코딩할 수 있다.
연령대코드가 기준년도별로 다른 것을 고려하지 못한 채로 분석을 진행해서 싹 다 망함.. 첨부터 다시 해야하는 줄 알았는데 다시 찾아보니 2022년 분석자료라 괜찮았다.
연속형 변수도 단위를 끊으면 범주형 변수가 된다. (예를 들면, 몸무게를 5kg단위로 나눠서 분류한 경우)
4일차)
범주형, 연속형 등 변수에 대한 깊은 통찰이 필요하다.
변수에 대한 설명 매뉴얼을 굉장히 깊게 이해하는 것 데이터 분석가의 기본이다
평균>중앙값 = 오른쪽으로 긴꼬리
평균<중앙값 = 왼쪽으로 긴 꼬리
이렇게 알고 있는데, 아닌 경우도 있다고 한다. 퍼센테이지 별 분포를 고려해야 함...profit를 고려할
평균, 중앙값, 최빈값 수치만 보고 그래프가 어떻게 그려질 지 빠르게 파악하는 연습이 필수적이다.
# Quize
# 캘리포니아에서 매출이 1000이상인 주문 중, Technology 카테고리만 필터링해서 매출, 이익을 보자.
df[(df['Sales'] >= 1000) & (df['State'] == "California") & (df['Category'] == 'Technology')][['Sales', 'Profit']]
필터를 넣는 것이 중요하다 ! 코드는 무조건 꼼꼼하게................
컬럼도 안넣었다...............
원본과 독립적으로 작업해야 할 때는 .copy()를 습관적으로 붙이자..
데이터가 크고 메모리가 작으면 남발 X
단위가 다른 요소를 비교 분석하기 위해선 정규화, 표준화가 중요하다.
공부할 것)
기존 공부했던 코드 복습할 것
정규화/표준화 공식 암기하기
5일차)
결측치를 체크할 때, NaN, N/A, NULL, #N/A 등을 삭제하지만, 스페이스바(공백)인 데이터도 결측치로 넘겨질 수 있다.
enumerate함수 잘 활용하기
EDA의 개념에 대해서 잘 알아야 한다.
# 여러 변수 박스플롯 그리기 - subplots 쉽게 지정하는 방식
variables = ['Sales', 'Profit']
plt.figure(figsize=(7,3))
for i, col in enumerate(variables):
plt.subplot(1, 3, i+1)
plt.boxplot(df[col].dropna())
plt.title(f"{col}")
plt.xticks([])
plt.yticks([])
plt.tight_layout()
plt.show()
프로그래머스 같은 사이트에서 사람들이 코딩으로 논의했던 기록을 보고 공부할 수 있다.
✅ 주말간 할 일 체크리스트
1. 여태까지 배운 코딩 따라 쳐보기
2. 위키독스 책 한 권 읽고, 후기 남기기
3. 데이터 책 완독하기
4. SQLD 공부하기
5. 리눅스에 대해서 알아보기