@라이언미첼 파이썬 웹 크롤러

BIBLIOGRAPHY

REMitchell. (2015) 2025. “Remitchell/Python-Scraping.” https://github.com/REMitchell/python-scraping.

라이언 미첼. 2025. 파이썬으로 웹 크롤러 만들기. Translated by 최경현. https://www.yes24.com/Product/Goods/141892731.

History

[2025-04-28 Mon 15:52] #검색엔진 관련
[2025-02-15 Sat 16:47] 생성

파이썬으로 웹 크롤러 만들기

(라이언 미첼 2025)

라이언 미첼 최경현
다양한 웹에서 효율적으로 데이터를 수집하는 방법 A to Z오늘날 데이터가 넘쳐나는 웹에서 웹 크롤러로 할 수 있는 일은 무궁무진하다. 이 마법을 위한 준비물은 약간의 파이썬 프로그래밍 능력 하나뿐, 나머지는 이 책에 모두 담겨 있다.
Web Scraping with Python 3rd
웹 스크레이핑(Web Scraping)과 웹 크롤링(Web Crawling)의 개념

책소개- 다양한 웹에서 효율적으로 데이터를 수집하는 방법 A to Z

오늘날 데이터가 넘쳐나는 웹에서 웹 크롤러로 할 수 있는 일은 무궁무진하다. 이 마법을 위한 준비물은 약간의 파이썬 프로그래밍 능력 하나뿐, 나머지는 이 책에 모두 담겨 있다. 이 책을 활용하면 웹 크롤링을 이용해 업무를 자동화하고, 복잡한 웹 콘텐츠를 처리하는 통찰력을 얻게 될 것이다. 새롭게 3판으로 개정된 이 책은 전반적인 코드를 최신화하고 실무에서 활용할 수 있는 예제를 추가했다. 또한 브라우저 자동화를 위한 셀레니움, 정확한 데이터 추출을 위한 XPath도 함께 다fns다. 복잡한 웹 세상에서 효율적으로 데이터를 수집하고 싶은, ‘일상의 데이터 분석가’를 꿈꾸는 모두에게 이 책은 가장 정확한 나침반이 되어 줄 것이다.

[PART 1 웹 스크레이퍼 제작]

CHAPTER 1 인터넷 작동 원리

1.1 네트워킹

1.1.1 물리 계층

1.1.2 데이터 링크 계층

1.1.3 네트워크 계층

1.1.4 전송 계층

1.1.5 세션 계층

1.1.6 표현 계층

1.1.7 응용 계층

1.2 HTML

1.3 CSS

1.4 자바스크립트

1.5 개발자 도구로 웹사이트 검사하기

CHAPTER 2 웹 스크레이핑의 합법성과 윤리

2.1 상표? 저작권? 특허?

2.1.1 저작권법

2.2 동산 침해

2.3 컴퓨터 사기와 악용에 관한 법률

2.4 robots.txt와 이용 약관

2.5 세 가지 웹 스크레이퍼 사례

2.5.1 이베이 vs. 비더스 에지: 동산 침해

2.5.2 미국 vs. 오언하이머: 컴퓨터 사기와 악용에 관한 법률

2.5.3 필드 vs. 구글: 저작권과 robots.txt

CHAPTER 3 웹 스크레이핑 활용 분야

3.1 프로젝트 분류하기

3.2 이커머스

3.2.1 마케팅

3.3 학술 연구

3.4 제품 개발

3.5 여행

3.6 영업

3.7 SERP 스크레이핑

CHAPTER 4 첫 번째 웹 스크레이퍼

4.1 주피터 노트북 설치 및 실행

4.2 연결

4.3 BeautifulSoup 소개

4.3.1 BeautifulSoup 설치

4.3.2 BeautifulSoup 실행

4.3.3 신뢰할 수 있는 연결과 예외 처리

CHAPTER 5 고급 HTML 분석

5.1 다시 BeautifulSoup

5.1.1 find()와 find**** all()

5.1.2 기타 BeautifulSoup 객체

5.1.3 트리 이동

5.2 정규 표현식

5.3 정규 표현식과 BeautifulSoup

5.4 속성에 접근하기

5.5 람다 표현식

5.6 닭 잡는 데 소 잡는 칼을 쓸 필요는 없습니다

CHAPTER 6 크롤링 시작하기

6.1 단일 도메인 내의 이동

6.2 전체 사이트 크롤링

6.2.1 전체 사이트에서 데이터 수집

6.3 인터넷 크롤링

CHAPTER 7 웹 크롤링 모델

7.1 객체 계획 및 정의

7.2 다양한 웹사이트 레이아웃 다루기

7.3 크롤러 구성

7.3.1 검색을 통한 사이트 크롤링

7.3.2 링크를 통한 사이트 크롤링

7.3.3 여러 페이지 유형 크롤링

7.4 웹 크롤러 모델에 대한 생각

CHAPTER 8 스크레이피

8.1 스크레이피 설치

8.1.1 새 스파이더 초기화

8.2 간단한 스크레이퍼 작성하기

8.3 규칙에 의한 스파이더링

8.4 항목 만들기

8.5 항목 출력하기

8.6 파이프라인

8.7 스크레이피 로깅

8.8 마치며

CHAPTER 9 데이터 저장

9.1 미디어 파일

9.2 데이터를 CSV로 저장

9.3 MySQL

9.3.1 MySQL 설치

9.3.2 기본 명령어

9.3.3 파이썬과 통합

9.3.4 데이터베이스 테크닉과 모범 사례

9.3.5 여섯 다리와 MySQL

9.4 이메일

[PART 2 고급 스크레이핑]

CHAPTER 10 문서 읽기

10.1 문서 인코딩

10.2 텍스트

10.2.1 텍스트 인코딩과 인터넷

10.3 CSV

10.3.1 CSV 파일 읽기

10.4 PDF

10.5 마이크로소프트 워드와 .docx

CHAPTER 11 지저분한 데이터 다루기

11.1 텍스트 정리하기

11.2 정규화된 텍스트 다루기

11.3 판다스로 데이터 정리하기

11.3.1 정리

11.3.2 인덱싱, 정렬, 필터링

11.3.3 판다스에 대해 더 알아보기

CHAPTER 12 자연어 읽고 쓰기

12.1 데이터 요약

12.2 마르코프 모델

12.2.1 케빈 베이컨의 여섯 다리: 결론

12.3 자연어 툴킷

12.3.1 설치

12.3.2 NLTK를 사용한 통계적 분석

12.3.3 NLTK를 사용한 사전적 분석

12.4 마치며

CHAPTER 13 폼과 로그인 뚫기

13.1 파이썬 requests 라이브러리

13.2 기본적인 폼 전송

13.3 라디오 버튼, 체크박스, 기타 필드

13.4 파일과 이미지 전송

13.5 로그인과 쿠키 처리

13.5.1 HTTP 기본 접근 인증

13.6 기타 폼 문제

CHAPTER 14 자바스크립트 스크레이핑

14.1 자바스크립트에 관한 간단한 소개

14.1.1 널리 쓰이는 자바스크립트 라이브러리

14.2 Ajax와 DHTML

14.3 셀레니움으로 파이썬에서 자바스크립트 실행

14.3.1 셀레니움 설치 및 실행

14.3.2 셀레니움 선택자

14.3.3 페이지 로딩 대기

14.3.4 XPath

14.4 그 밖의 셀레니움 웹드라이버

14.5 리다이렉트 처리

14.6 자바스크립트에 대한 마지막 노트

CHAPTER 15 API를 통한 크롤링

15.1 API에 대한 간단한 소개

15.1.1 HTTP 메서드와 API

15.1.2 API 응답에 대해

15.2 JSON 파싱

15.3 문서화되지 않은 API

15.3.1 문서화되지 않은 API 찾기

15.3.2 문서화되지 않은 API 문서화하기

15.4 API와 다른 데이터 소스의 결합

15.5 마치며

CHAPTER 16 이미지 처리와 텍스트 인식

16.1 라이브러리 개관

16.1.1 필로

16.1.2 테서랙트

16.1.3 넘파이

16.2 형식이 일정한 텍스트 처리

16.2.1 이미지 자동 조정

16.2.2 웹사이트 이미지에서 텍스트 스크레이핑하기

16.3 CAPTCHA 읽기와 테서랙트 훈련

16.3.1 테서랙트 훈련

16.4 CAPTCHA 가져오기와 답 보내기

CHAPTER 17 스크레이핑 함정 피하기

17.1 스크레이핑의 윤리에 관해

17.2 사람처럼 보이기

17.2.1 헤더를 수정하십시오

17.2.2 쿠키 처리

17.2.3 TLS 핑거프린팅

17.2.4 타이밍이 가장 중요합니다

17.3 널리 쓰이는 폼 보안 기능

17.3.1 숨긴 필드 값

17.3.2 허니팟 피하기

17.4 사람처럼 보이기 위한 체크리스트

CHAPTER 18 스크레이퍼로 웹사이트 테스트하기

18.1 테스트 입문

18.1.1 단위 테스트란?

18.2 파이썬 unittest

18.2.1 위키백과 테스트

18.3 셀레니움을 사용한 테스트

18.3.1 사이트 조작

CHAPTER 19 병렬 웹 스크레이핑

19.1 프로세스 vs. 스레드

19.2 멀티스레드 크롤링

19.2.1 경쟁 상태와 큐

19.2.2 threading 모듈

19.3 멀티 프로세스

19.3.1 멀티프로세스 크롤링

19.3.2 프로세스 간 통신

19.4 멀티프로세스 크롤링의 다른 접근법

CHAPTER 20 웹 스크레이핑 프록시

20.1 원격 서버를 쓰는 이유

20.1.1 IP 주소 차단 방지

20.1.2 이동성과 확장성

20.2 토르

20.2.1 파이삭스

20.3 원격 호스팅

20.3.1 웹사이트 호스팅 계정에서 실행

20.3.2 클라우드에서 실행

20.3.3 미래를 향해

20.4 웹 스크레이핑 프록시

20.4.1 스크레이핑비

20.4.2 스크레이퍼API

20.4.3 옥시랩스

20.4.4 자이트

20.5 마치며

출판사 리뷰

HTML 기본 개념부터 AI 기반 데이터 추출까지, 높아진 웹의 장벽을 뛰어넘을 수 있는 최신 웹 크롤링 가이드

점점 더 다양하고 복잡해지는 방대한 정보의 바다에서 원하는 데이터를 얻으려면 어떻게 해야 할까요?

흩어진 데이터를 의미 있는 정보로 만들 수 있는 효과적인 도구가 있을까요? 『파이썬으로 웹 크롤러 만들기(3판)』는 이러한 질문들에 완벽한 답을 제공합니다.

1부에서는 웹 크롤링에 대한 기본적인 개념과 함께 파이썬과 BeautifulSoup 및 스크레이피와 같은 인기 라이브러리를 사용하는 비교적 간단한 웹 크롤러를 소개합니다. 그 후 MySQL의 데이터 저장, API 처리, CSV, PDF, 워드와 같은 형식의 문서 분석과 같은 핵심 기술을 이해하며 웹을 탐색하는 기본기를 배우게 됩니다.

2부에서는 1부에서 배운 기본기를 토대로 보다 복잡한 웹 환경을 분석하고 처리하기 위한 고급 기술을 다룹니다. 셀레니움을 활용하여 동적 자바스크립트 기반 페이지를 스크랩하고, 판다스와 같은 도구를 사용하여 지저분한 데이터를 정리하는 방법을 알아봅니다. 또한, 텍스트 데이터에서 의미를 추출할 수 있는 NLTK를 활용한 자연어 처리를 설명하며, 이미지에서 텍스트를 추출하여 CAPTCHA를 우회할 수 있는 테서랙트와 필로 같은 도구들도 함께 소개합니다.

변화하는 최신 웹 환경에 적절히 대응할 수 있도록 개정된 3판에서는 2판보다 이해하기 편한 구성으로 내용을 재배치하였고, 전반적으로 코드를 업데이트했습니다. 웹 크롤링을 처음 시작하는 초급자는 물론, 기존에 웹 크롤링을 업무에 활용하고 있던 중급자 이상의 분들에게도 만족감을 드릴 수 있는 도서라 자부합니다.

대상 독자

웹 크롤링을 시작하고 싶은 모든 개발자
이미 업무에 웹 크롤링을 활용하고 있는 개발자
파이썬을 이용하여 웹 데이터를 모으고 싶은 개발자

주요 내용

복잡한 HTML 파싱
자연어 읽고 쓰기
폼 및 로그인 크롤링
스크레이피 프레임워크로 크롤러 만들기
수집한 데이터를 저장하는 다양한 방법
자바스크립트 수집 및 API 이용
문서에서 데이터를 읽고 추출하기
봇 차단을 피하는 법
지저분한 데이터 형식 정돈하기
크롤러를 이용한 웹사이트 테스팅

REMitchell/python-scraping

(REMitchell [2015] 2025) REMitchell 2025 Code samples from the book Web Scraping with Python http://shop.oreilly.com/product/0636920034391.do

junghanacs🧠

Table of Contents

Backlinks