출고예상일 안내
주문하신 상품이 한국에서 현지 배송을 위한 출고단계가 이루어질 것으로 예상되는 날짜입니다. 상품을 준비하는 과정에서 내부적인 사정으로 인해 출고예상일에 다소 오차가 생길 수 있습니다.
여러 상품(예약상품포함)을 함께 주문하신 경우 출고예상일이 가장 늦은 날짜에 맞춰 함께 배송됩니다.

ISBN : 9788998139339 / 652쪽 188 x 240 (㎜)
이 상품에 궁금하신점이 있으세요? 1:1상담문의

-
코리아교육그룹 교육연구소
-
토도성문(장성문)
-
이지영
-
칼릭스(손윤석)
- 19,800
- 25,200
- 27,000
- 19,800
출판사 리뷰
하둡은 대규모 클러스터로 분산된 데이터를 조회하고 분석할 수 있게 설계된 오픈소스 맵리듀스 플랫폼이다. 특히 빅 데이터 시스템에 효과적인 하둡은 애플, 이베이, 링크드인, 야후, 페이스북 같은 기업에서 핵심적인 소프트웨어를 처리하고 있다. 하둡을 통해 개발자는 데이터를 편리하게 저장, 관리, 분석할 수 있다.
《하둡 인 프랙티스》에서는 85개의 실전 예제를 수집해 이를 문제/해결책 형태로 보여준다. 이 책에서는 데이터 인그레스/이그레스, 직렬화, LZO 압축 같은 중요한 문제에 대한 개념적 토대를 쌓을 수 있게 하는 동시에 현실적인 레시피를 제공한다. 이 책에서는 각 기법을 단계별로 살펴보고, 이를 통해 구체적인 해결책과 더불어 이 해결책에 적용된 사고 방법을 배운다. 아울러 책에서 제공하는 예제는 이해하기 쉽고, 잘 구조화돼 있는 만큼 조금만 수정해 얼마든지 필요한 곳에 바로 활용할 수도 있다.
★ 이 책에서 다루는 내용 ★
◎ 하둡 및 맵리듀스에 대한 개념적 설명
◎ 85개의 검증된 실전 기법
◎ 현실적인 문제와 현실적인 해결책
◎ 맵리듀스와 R의 연동 방법
이 책에서는 독자들이 하둡에 대해 기본적으로 알고 있다고 가정한다.
하둡의 창시자인 더그 커팅은 하둡을 빅 데이터를 위한 커널이라고 부르기를 좋아하는데, 필자도 이에 동의하는 편이다. 분산 저장소와 연산 능력을 갖춘 하둡은 대용량 데이터셋을 얼마든지 처리할 수 있는 기술이다. 필자에게 있어 하둡은 구조적 데이터(RDBMS)와 비구조적 데이터(로그 파일, XML, 텍스트)를 서로 연결해주고, 이들 데이터를 쉽게 조인할 수 있게 해주는 기술이다. 이는 OLTP와 로그 파일을 결합하는 전통적인 사용 사례에서 페이스북에서 볼 수 있듯 데이터 웨어하우싱에 하둡을 사용하는 사례 및 데이터에 대한 새로운 사실을 찾아내고 연구하는 데이터 사이언스 분야로의 발전을 의미한다.
이 책에서는 다양한 중급 및 고급 수준의 하둡 예제를 살펴보고 이를 문제/해결책 형식으로 제시한다. 85개의 기법은 모두 개별 과제(플룸을 활용해 로그 파일을 하둡으로 옮기는 법, 머하웃을 활용한 예측적 분석 등)를 소개한다. 이처럼 제시된 각 문제를 단계별로 살펴보고, 독자들은 이 과정을 통해 하둡과 빅 데이터 세계에 점점 더 친숙해질 수 있다.
이 책은 하둡을 사용해본 경험이 있고, 맵리듀스와 HDFS를 기본적으로 이해하는 사용자를 대상으로 한다. 척 램이 저술한 매닝 출판사의 하둡 인 액션에는 이 책에서 다루는 기법들을 이해하고 적용하는 데 필요한 사전 지식이 모두 들어 있다.
★ 로드맵 ★
이 책에는 총 13개의 장이 있으며, 5부로 구성된다.
1부에는 이 책의 소개에 해당하는 하나의 장만 들어 있다. 이 장에서는 하둡에 대한 기본적인 사항을 설명하고, 단일 호스트에서 하둡을 실행하는 법을 설명한다. 1장은 맵리듀스 잡을 작성하고 실행하는 과정을 살펴보는 것으로 마친다.
2부 ‘데이터 로지스틱스’에서는 하둡에서 데이터를 가져오고, 데이터를 집어넣는 법, 다양한 데이터 형식을 처리하는 법 등 데이터와 관련한 기본적인 처리에 필요한 기법과 툴을 다룬다. 하둡을 사용할 때 하둡에 데이터를 집어넣는 과정은 가장 먼저 부딪치는 난관 중 하나인데, 2장에서는 자주 사용하는 엔터프라이즈 데이터 소스를 대상으로 다양한 툴을 활용해 데이터를 집어넣는 법을 살펴본다. 3장에서는 XML과 JSON 같은 데이터 형식을 맵리듀스에서 활용하는 법을 다루고, 이어서 빅 데이터 처리에 좀 더 적합한 데이터 형식을 살펴본다.
3부 ‘빅데이터 패턴’에서는 대용량 데이터를 효과적으로 처리하는 데 도움되는 기법을 살펴본다. 4장에서는 맵리듀스 조인과 정렬 작업을 최적화하는 법을 살펴보고, 5장에서는 수많은 작은 파일을 처리하는 법과 압축을 활용하는 법을 다룬다. 6장에서는 맵리듀스 성능 이슈를 디버깅하는 법을 살펴보고, 잡이 빠르게 실행될 수 있게 도와주는 다양한 기법을 소개한다.
4부는 ‘데이터 사이언스’에 할애하며, 데이터의 의미를 파악하는 데 도움되는 툴과 방법론을 자세히 다룬다. 7장에서는 맵리듀스에서 데이터를 그래프와 같은 형태로 표현하는 법을 다루고, 그래프 데이터를 처리할 수 있는 알고리즘도 몇 개 살펴본다. 8장에서는 인기 있는 통계 및 데이터 마이닝 플랫폼인 R을 하둡과 연동하는 법을 다룬다. 9장에서는 맵리듀스와 머하웃을 연계해 확장 가능한 데이터셋을 예측적으로 분석하는 법을 살펴본다.
5부 ‘코끼리 길들이기’에서는 맵리듀스를 활용하기 쉽게 도와주는 여러 기술을 살펴본다. 10장과 11장에서는 고수준 추상화를 제공하기 위한 맵리듀스 도메인 특화 언어(DSL; Domain-Specific Language)인 하이브와 피그를 다룬다. 12장에서는 자체 맵리듀스 추상화를 제공하는 자바 라이브러리인 크런치와 캐스케이딩을 살펴보고, 13장에서는 단위 테스트를 작성하고 맵리듀스 문제를 디버깅하는 기법을 소개한다.
부록은 부록 A부터 시작한다. 부록 A에서는 이 책에서 다루는 하둡 및 관련 기술을 설치하는 내용을 설명한다. 부록 B에서는 2장에서 다루는 저수준 하둡 인그레스/이그레스 메커니즘을 다룬다. 부록 C에서는 HDFS가 읽기 및 쓰기를 어떻게 지원하는지 살펴보고, 부록 D에서는 필자가 작성하고 4장에서 활용하고 있는 맵리듀스 조인 프레임워크에 대해 설명한다.
- 서문 중에서









































