스크랩

구간

하둡 인 프랙티스 - 위키북스 오픈소스 & 웹 시리즈 053 85가지 고급 예제로 배우는 실전 해법서

시리즈 : 위키북스 오픈소스 & 웹 시리즈 [79]

알렉스 홈즈 저 | 유윤선 역 | 위키북스 | 2013년 09월

북트리

정가
$80.00
판매가
$58.32 (27%↓) 최저가 보상
적립금
$1.17 (2%P)
출고예상일
2026년 10월 09일 수령예상일 안내
북카트 담기 바로구매하기 위시리스트담기

평점 -  ·  리뷰 0

리뷰 쓰기

ISBN : 9788998139339 / 652쪽 188 x 240 (㎜)

이 상품에 궁금하신점이 있으세요? 1:1상담문의

추천inside
Adobe Flash Player 가져오기

이 분야의 베스트셀러

아래의 도서와 구매하시면 이 도서들의 적립금을 즉시적용해 드립니다.

책 소개

출판사 리뷰

하둡은 대규모 클러스터로 분산된 데이터를 조회하고 분석할 수 있게 설계된 오픈소스 맵리듀스 플랫폼이다. 특히 빅 데이터 시스템에 효과적인 하둡은 애플, 이베이, 링크드인, 야후, 페이스북 같은 기업에서 핵심적인 소프트웨어를 처리하고 있다. 하둡을 통해 개발자는 데이터를 편리하게 저장, 관리, 분석할 수 있다.

《하둡 인 프랙티스》에서는 85개의 실전 예제를 수집해 이를 문제/해결책 형태로 보여준다. 이 책에서는 데이터 인그레스/이그레스, 직렬화, LZO 압축 같은 중요한 문제에 대한 개념적 토대를 쌓을 수 있게 하는 동시에 현실적인 레시피를 제공한다. 이 책에서는 각 기법을 단계별로 살펴보고, 이를 통해 구체적인 해결책과 더불어 이 해결책에 적용된 사고 방법을 배운다. 아울러 책에서 제공하는 예제는 이해하기 쉽고, 잘 구조화돼 있는 만큼 조금만 수정해 얼마든지 필요한 곳에 바로 활용할 수도 있다.

★ 이 책에서 다루는 내용 ★

◎ 하둡 및 맵리듀스에 대한 개념적 설명
◎ 85개의 검증된 실전 기법
◎ 현실적인 문제와 현실적인 해결책
◎ 맵리듀스와 R의 연동 방법

이 책에서는 독자들이 하둡에 대해 기본적으로 알고 있다고 가정한다.

저자 소개

알렉스 홈즈는 15년 이상의 대용량 분산 자바 시스템 개발 경험을 갖춘 수석 엔지니어다. 지난 4년간 알렉스는 하둡을 활용해 다양한 프로젝트에서 빅 데이터 관련 문제를 해결했고 이를 통해 전문성을 쌓았다. 알렉스는 자바원과 Jazoon에서 발표한 바 있으며 현재 베리사인(VeriSign)의 기술 리더다. 알렉스는 http://grepalex.com에서 하둡 관련 프로젝트를 운영하고 있으며, 트위터 주소는 https://twitter.com/grep_alex다.

역자 소개

인디 개발자이자 프리랜서 번역가로 활동 중이다. 이따금 http://joshy21.com/weblog에 번역과 상관없는 글을 올리고 있다. 역서로는 『시작하세요! Unity 3D 게임 프로그래밍 (위키북스)』, 『시작하세요! 안드로이드 게임 프로그래밍(위키북스)』, 『시작하세요! 아이폰 4 프로그래밍(위키북스)』, 『플래시 빌더 4 & 플렉스 4 바이블(위키북스)』, 『쉽고 빠르게 익히는 CSS3(위키북스)』, 『스프링 시큐리티 3(위키북스)』, 『시작하세요! 아이패드 프로그래밍(위키북스)』, 『플래시 게임 마스터(에이콘출판사)』, 『Adobe AIR 인 액션(위키북스)』, 『스프링 3 레시피(위키북스, 공역)』, 『액션스크립트 3.0 완벽가이드(인사이트, 공역)』 NoSQL 프로그래밍 등이 있다.


 

책 속에서

하둡의 창시자인 더그 커팅은 하둡을 빅 데이터를 위한 커널이라고 부르기를 좋아하는데, 필자도 이에 동의하는 편이다. 분산 저장소와 연산 능력을 갖춘 하둡은 대용량 데이터셋을 얼마든지 처리할 수 있는 기술이다. 필자에게 있어 하둡은 구조적 데이터(RDBMS)와 비구조적 데이터(로그 파일, XML, 텍스트)를 서로 연결해주고, 이들 데이터를 쉽게 조인할 수 있게 해주는 기술이다. 이는 OLTP와 로그 파일을 결합하는 전통적인 사용 사례에서 페이스북에서 볼 수 있듯 데이터 웨어하우싱에 하둡을 사용하는 사례 및 데이터에 대한 새로운 사실을 찾아내고 연구하는 데이터 사이언스 분야로의 발전을 의미한다.

이 책에서는 다양한 중급 및 고급 수준의 하둡 예제를 살펴보고 이를 문제/해결책 형식으로 제시한다. 85개의 기법은 모두 개별 과제(플룸을 활용해 로그 파일을 하둡으로 옮기는 법, 머하웃을 활용한 예측적 분석 등)를 소개한다. 이처럼 제시된 각 문제를 단계별로 살펴보고, 독자들은 이 과정을 통해 하둡과 빅 데이터 세계에 점점 더 친숙해질 수 있다.

이 책은 하둡을 사용해본 경험이 있고, 맵리듀스와 HDFS를 기본적으로 이해하는 사용자를 대상으로 한다. 척 램이 저술한 매닝 출판사의 하둡 인 액션에는 이 책에서 다루는 기법들을 이해하고 적용하는 데 필요한 사전 지식이 모두 들어 있다.

 

★ 로드맵 ★

이 책에는 총 13개의 장이 있으며, 5부로 구성된다.

1부에는 이 책의 소개에 해당하는 하나의 장만 들어 있다. 이 장에서는 하둡에 대한 기본적인 사항을 설명하고, 단일 호스트에서 하둡을 실행하는 법을 설명한다. 1장은 맵리듀스 잡을 작성하고 실행하는 과정을 살펴보는 것으로 마친다.

2부 ‘데이터 로지스틱스’에서는 하둡에서 데이터를 가져오고, 데이터를 집어넣는 법, 다양한 데이터 형식을 처리하는 법 등 데이터와 관련한 기본적인 처리에 필요한 기법과 툴을 다룬다. 하둡을 사용할 때 하둡에 데이터를 집어넣는 과정은 가장 먼저 부딪치는 난관 중 하나인데, 2장에서는 자주 사용하는 엔터프라이즈 데이터 소스를 대상으로 다양한 툴을 활용해 데이터를 집어넣는 법을 살펴본다. 3장에서는 XML과 JSON 같은 데이터 형식을 맵리듀스에서 활용하는 법을 다루고, 이어서 빅 데이터 처리에 좀 더 적합한 데이터 형식을 살펴본다.

3부 ‘빅데이터 패턴’에서는 대용량 데이터를 효과적으로 처리하는 데 도움되는 기법을 살펴본다. 4장에서는 맵리듀스 조인과 정렬 작업을 최적화하는 법을 살펴보고, 5장에서는 수많은 작은 파일을 처리하는 법과 압축을 활용하는 법을 다룬다. 6장에서는 맵리듀스 성능 이슈를 디버깅하는 법을 살펴보고, 잡이 빠르게 실행될 수 있게 도와주는 다양한 기법을 소개한다.

4부는 ‘데이터 사이언스’에 할애하며, 데이터의 의미를 파악하는 데 도움되는 툴과 방법론을 자세히 다룬다. 7장에서는 맵리듀스에서 데이터를 그래프와 같은 형태로 표현하는 법을 다루고, 그래프 데이터를 처리할 수 있는 알고리즘도 몇 개 살펴본다. 8장에서는 인기 있는 통계 및 데이터 마이닝 플랫폼인 R을 하둡과 연동하는 법을 다룬다. 9장에서는 맵리듀스와 머하웃을 연계해 확장 가능한 데이터셋을 예측적으로 분석하는 법을 살펴본다.

5부 ‘코끼리 길들이기’에서는 맵리듀스를 활용하기 쉽게 도와주는 여러 기술을 살펴본다. 10장과 11장에서는 고수준 추상화를 제공하기 위한 맵리듀스 도메인 특화 언어(DSL; Domain-Specific Language)인 하이브와 피그를 다룬다. 12장에서는 자체 맵리듀스 추상화를 제공하는 자바 라이브러리인 크런치와 캐스케이딩을 살펴보고, 13장에서는 단위 테스트를 작성하고 맵리듀스 문제를 디버깅하는 기법을 소개한다.

부록은 부록 A부터 시작한다. 부록 A에서는 이 책에서 다루는 하둡 및 관련 기술을 설치하는 내용을 설명한다. 부록 B에서는 2장에서 다루는 저수준 하둡 인그레스/이그레스 메커니즘을 다룬다. 부록 C에서는 HDFS가 읽기 및 쓰기를 어떻게 지원하는지 살펴보고, 부록 D에서는 필자가 작성하고 4장에서 활용하고 있는 맵리듀스 조인 프레임워크에 대해 설명한다.

- 서문 중에서

목차

top