학습 기록/코드잇 데이터분석 부트캠프

# 위클리페이퍼 1

dataminutestone 2025. 11. 6. 17:42


Q1. Numpy, Pandas, Matplotlib 라이브러리의 특징에 대해 설명해주세요.

또, 파이썬 데이터 분석에서 자주 사용하는 라이브러리에 대해 자유롭게 조사하여 정리해보세요.
                                                                                                                               

 

셋 다 라이브러리이므로, 기본적으로 "import 라이브러리명 as 단축어"를 활용해야 한다.

 

Numpy

Numarray와 Numeric이라는 오래된 python 패키지를 계승해서 나온 수학 및 과학 연산을 위한 파이썬 패키지이다.

그래픽 패키지인 후술할 Pandas, Matplotlib등 과 함께 사용된다.  

array함수를 활용하여, 행렬들의 배열들을 합치고 슬라이싱 하는 기능을 한다.

x = np.array([1,2,3])
y = np.array([4,5,6])

 

Pandas

Pandas는 데이터분석을 위해 파이썬에서 사용할 수 있는 오픈소스 라이브러리이다.

1차원 배열의 값(values)에 각 값에 대응되는 인덱스(index)를 부여할 수 있는 구조인 시리즈 형태와 행방향 인덱스(index)와 열방향 인덱스(column)가 존재하는 2차원 배열의 형태인 데이터프레임(Dataframe)가 있다.

# 리스트로 생성하기
data = [
    ['1000', 'Steve', 90.72], 
    ['1001', 'James', 78.09], 
    ['1002', 'Doyeon', 98.43], 
    ['1003', 'Jane', 64.19], 
    ['1004', 'Pilwoong', 81.30],
    ['1005', 'Tony', 99.14],
]

df = pd.DataFrame(data)
print(df)

 

Matplotlib

Pandas는 데이터시각화를 위해 파이썬에서 사용할 수 있는 오픈소스 라이브러리이다. 맷플롯립(Matplotlib)은 데이터를 차트(chart)나 플롯(plot)으로 시각화하는 패키지다.. 데이터 분석에서 Matplotlib은 데이터 분석 이전에 데이터 이해를 위한 시각화나, 데이터 분석 후에 결과를 시각화하기 위해서 사용한다.

plt.title('test')
plt.plot([1,2,3,4],[2,4,8,6])
plt.show()

 

Seaborn

파이썬의 대표적인 시각화 라이브러리인 matplotlib과 더불어 또 하나의 시각화 라이브러리다. 다양한 그래프 모양을 지원하며, 색도 커스터마이징 할 수 있다. matplotlib에도 가능하지만, 개인적으로 디자인이 더 깔끔한 것 같다.

Seaborn 라이브러리에서 제공해주는 그래프

#라이브러리 임포트
import pandas as pd 
import matplotlib.pyplot as plt 
import seaborn as sns 

#seaborn에서 제공하는 flights 데이터 셋을 사용
flights = sns.load_dataset('flights')

#그래프 사이즈 설정
plt.figure(figsize=(12, 3))

 

(출처 - https://wikidocs.net/32829) 


Q2. 제1종 오류와 제2종 오류에 대해 설명해주세요

 

1종오류와 2종오류를 이해하기 위해, 귀무가설과 대립가설을 먼저 이해해야 한다.

 

1. 귀무가설을 만들고 (기호는 H0)

- 남성과 여성의 보수는 같다.

2. 대립가설을 만든다. (기호 Ha 또는 H1)

- 남성은 여성보다 보수가 더 많다.

3. 검정 통계를 만들고 측정한다.

  • 검정 통계는 랜덤 값이다.

4. 의사결정을 한다.

  • H1에 대한 증거가 충분하다면 H0를 기각하고 H1을 받아들인다.
  • H1에 대한 증거가 불충분한 경우 H0를 기각하지 않는다.

 

✅ 귀무 가설 (또는 영 가설)

처음부터 버릴 것을 예상하는 가설이다. 차이가 없거나 의미있는 차이가 없는 경우의 가설이며 이것이 맞거나 맞지 않다는 통계학적 증거를 통해 증명하려는 가설이다. -> 쉽게 말해서 대립가설이 증명되었다는 것을 파악하기 위해 설정하는 가설

 

대립가설 (연구 가설 또는 유지 가설)

모집단에서 독립변수 결과변수 사이에 어떤 특정한 관련이 있다는 꼴이다. 어떤 가능성에 대해 확률적인 가설검정을 할 때 귀무가설과 함께 사용된다.

 

1종 오류

위에서 설명한 귀무가설이 참이지만, 기각하는 경우를 1종오류라고 한다.

존재하지 않는 차이를 있다고 판단하는 경우이며, '위양성'이라고도 함

 

2종 오류

위에서 설명한 귀무가설이 거짓이지만, 채택하는 경우를 2종오류라고 한다.

 존재하는 차이를 놓친 경우이며, '위음성'이라고도 함

 

  => 쉽게 말해서 1종오류, 2종오류란 실제 결과와 검정 결과가 다른 경우를 의미한다

 

Q3. p값 (p-value)는 무엇인가요?

 

 

p 값은 통계적 가설 검정에서 사용되는 확률 값으로, 귀무가설이 맞다는 가정 하에 현재 관찰된 데이터 또는 그보다 더 극단적인 결과가 나타날 확률을 의미한다. => 예상하지 못한 결과가 나올 확률이다. 

 

이러한 p값을 기반으로 통계의 결과값을 어느정도로 신뢰할 수 있는 지 알 수 있다.

 

p값은 귀무가설이 참일 때 얻어진 결과가 우연히 나타날 확률이고, 신뢰구간은 추정된 모집단 모수가 포함될 것으로 예상되는 값의 범위이다. p값은 통계적 유의성을 판단하는 기준이 된다.