
BeautifulSoup과 Selenium은 어떤 상황에서 각각 더 적합한가요?
BeautifulSoup이 더 적합한 경우
정적(Static) 페이지: 서버가 HTML을 완성해서 내려주고, 그 안에 원하는 데이터가 이미 들어있는 경우.
- 빠름 / 가벼움: 브라우저를 안 띄워서 훨씬 빠르고 안정적임
- 대량 수집에 유리: 수천~수만 페이지 긁을 때 Selenium 쓰면 느림
- HTML만 파싱: 테이블/리스트/본문 텍스트처럼 “소스에 박혀있는 데이터”에 강함
Selenium이 더 적합한 경우
동적(Dynamic) 페이지: 처음엔 빈 껍데기 HTML만 오고, JS가 실행되면서 데이터가 채워지는 경우. 또는 사용자 행동이 필요할 때.
- JS 렌더링 필요: 스크롤 내려야 로딩(무한스크롤), 버튼 눌러야 데이터 뜸
- 로그인/세션/인증: 로그인 후에만 보이는 데이터
- 클릭/드롭다운/모달/탭: UI 조작이 있어야 내용이 바뀜
- SPA(React/Vue 등): 네트워크로 JSON 받아서 화면에 뿌리는 구조

robots.txt 파일이란 무엇이며, 웹 스크래핑 시 왜 중요한가요?
robots.txt는 크롤링을 어디까지 해도 되는지에 대한 내용을 적어둔 규칙 파일
왜 중요한지?
비록, 불법은 아니더라도 이하의 문제들이 생길 수 있음.
IP / 계정 차단
- 서비스 접근 자체가 막히거나 실무에서 진행한 프로젝트 날아감
회사 및 기관 데이터의 경우
- 공공기관, 금융, 플랫폼에서 “데이터 무단 수집”으로 공문 날아오는 경우
취업·포트폴리오 리스크
- 과제나 포폴에서 “이 데이터 어떻게 수집했나요?”, “robots.txt 확인했나요?에 대한 대답이 어려움
'학습 기록 > 코드잇 데이터분석 부트캠프' 카테고리의 다른 글
| # 위클리페이퍼 9 (0) | 2026.02.23 |
|---|---|
| 위클리 페이퍼 #8 (0) | 2026.01.19 |
| [DA] 스프린트 미션 8 (0) | 2025.12.29 |
| # 위클리페이퍼 5 (0) | 2025.12.22 |
| # 위클리페이퍼 4 (0) | 2025.12.14 |