상세정보
웹 데이터 수집의 기술

웹 데이터 수집의 기술

저자
타쿠로 사사키 지음, 김경록 옮김
출판사
한빛미디어
출판일
2017-08-14
등록일
2017-10-23
파일포맷
PDF
파일크기
13MB
공급사
알라딘
지원기기
PC 프로그램 수동설치 뷰어프로그램 설치 안내
현황
  • 보유 1
  • 대출 0
  • 예약 0

책소개

프로그램에 대한 배경 지식이 \'1\'도 없는 사람일지라도
엑셀, 구글 스프레드시트로 쉽게 할 수 있는 데이터 수집 방법!


웹에는 방대한 데이터가 모인다. 대형 정보관리체계로 유명한 Dell EMC 사의 통계에 따르면 2000년에 6.2엑사바이트였던 데이터가 해마다 증가해 2020년에는 35제타바이트에 달할 것으로 예상하고 있다. 제타바이트는 엑사바이트의 1,000배이므로 약 20년간 5,000배 이상의 데이터가 증가할 것이며, 이렇게 생성된 데이터의 약 94%는 디지털 형태로 구성되어있다. 이는 새로 생성된 데이터 대부분이 디지털 형태로 탄생하고 있다는 의미이다. 디지털화된 모든 데이터의 정보가 웹에 존재하는 것은 아니지만, 대다수의 디지털 데이터가 웹을 통해 공유되는 만큼 웹 데이터의 활용이 정보 수집 및 의사 결정에 도움이 된다는 것은 부정할 수 없는 현실이다.
이 책은 그러한 \'디지털 데이터\'를 \'되도록 쉽게, 그리고 효율적으로 웹에서 수집하는 방법\'을 설명하고 있다. 데이터 수집의 효율을 극대화하기 위해 프로그램을 개발하기도 하지만 이 책은 웬만하면 많은 사람이 사용할 수 있도록 엑셀과 구글 스프레드시트 같이 구하기 쉽고, 특별한 프로그램 환경 구축이 필요치 않은 애플리케이션을 이용하고 있다. 프로그래밍 경험이 없는 사람이라도 쉽게 따라할 수 있도록 모든 절차를 자세히 설명하고 있으므로 누구든 안심하고 데이터 수집의 자동화 세계에 입문할 수 있다.

# 데이터와 크롤링을 몰라도 엑셀 및 구글 스프레드시트로 쉽게 할 수 있다
지금까지 데이터를 수집하는 방법을 설명한 책은 파이썬, 루비 등과 같은 프로그램 언어를 이용하여 사용자가 직접 크롤러를 만드는 기술을 설명한 책이 전부다. 그러나 데이터 수집은 IT 개발자가 아닌 마케터도 제품 및 서비스에 대한 고객 반응을 분석하기 위해 필요하고, 컨설턴트가 특정 기업의 매출 추이 및 인터넷에 노출된 정보의 다양한 상관관계를 분석하기 위해서도 필요하다. 하다못해 수시로 기획안 및 제안서를 작성하는 회사원들도 근거 있는 한 줄 내용을 쓰기 위해 다양한 데이터가 필요하다.
이 책은 그러한 마케터와 컨설턴트 등 일반 직장인들에게 데이터를 수집하는 방법을 알려주고자 의도적으로 집필된 책으로, 프로그래밍 없이 데이터를 수집하는 방법과 엑셀, 구글 스프레드시트의 셀 함수 등을 사용하고, 부득이하게 프로그래밍이 필요한 경우에도 엑셀의 VBA와 구글 앱스 스크립트 등 별도의 프로그래밍 환경을 구축할 필요가 없는 방법에 대해 다루고 있다. 그렇기 때문에 그 동안 데이터 수집이 필요했지만 어려운 전문 용어 때문에 관련 도서를 한 페이지도 넘기기 힘들었던 독자들은 이 책의 내용을 매우 쉽게 읽어 내려갈 수 있을 것이다.

# 이 책은 텍스트 데이터의 효율적인 수집을 목적으로 한다
텍스트 데이터에는 다양한 종류가 있다. 논문이나 뉴스, 페이스북이나 트위터와 같은 SNS에 올라오는 글, 회사 및 상품 정보, 고객 리뷰 등 자연어에 가까운 데이터에서부터 주식 정보, 각종 순위 같은 수치 데이터까지 다양하다. 이 책에서 데이터 수집의 목적은 \'독자 개인을 위해\' 혹은 \'비즈니스에서의\' 활용에 있으며, 구체적인 목표를 설정하고 몇 가지의 활용 사례를 통해 기술들을 응용하여 다양한 데이터를 수집함으로써 자연어와 수치 데이터 양쪽 모두 활용할 수 있도록 하고 있다.

# 웹에서 데이터를 효율적으로 수집하기 위한 핵심은 자동화에 있다
웹에서 데이터를 효율적으로 수집하기 위한 핵심은 자동화에 있다. 자동화를 해놓으면 내가 자는 시간에도 데이터를 수집할 수 있다. 이 책에서 다루는 자동화의 유형은 2가지가 있다. 하나는 일부 작업을 수동으로 하는 반자동화가 있고, 다른 하나는 수작업은 완전히 배제하고 컴퓨터에서 자동 혹은 정기적으로 데이터를 검색하는 완전 자동화가 있다. 이 책에서는 각각의 장단점을 소개하고 있으므로 이를 활용하여 장기간 데이터를 축적해 기초 분석 데이터로 이용할지, 실시간으로 수집한 자료를 분석해 현재 시점의 의사 결정에 도움이 되도록 할지를 선택적으로 활용해 보자.

QUICKSERVICE

TOP