출고예상일 안내
주문하신 상품이 한국에서 현지 배송을 위한 출고단계가 이루어질 것으로 예상되는 날짜입니다. 상품을 준비하는 과정에서 내부적인 사정으로 인해 출고예상일에 다소 오차가 생길 수 있습니다.
여러 상품(예약상품포함)을 함께 주문하신 경우 출고예상일이 가장 늦은 날짜에 맞춰 함께 배송됩니다.

ISBN : 9788965402930 / 336쪽 / 638g / 182 x 232 (㎜)
이 상품에 궁금하신점이 있으세요? 1:1상담문의

-
정지훈
-
칼릭스(손윤석)
-
정그린
-
서길원, 김운호, 허상훈, 박재상, 박경규, 김종욱, 오윤우, 유지영
- 25,200
- 19,800
- 23,400
- 31,500
출판사 리뷰
이 책의 특징
· 강화학습 이해에 필요한 통계와 수학 이론을 기초부터 다룬다.
· 알고리즘의 기본 개념을 그림으로 표현하여 이해를 돕는다.
· 하나의 예제를 통해 일관성 있게 개념과 이론을 설명해 나간다.
· 파이썬 코드 구현과 튜닝, 최적화까지 실무에 적용할 수 있는 수준까지 다룬다.
이 책의 구성
이 책은 강화학습의 기초 개념과 인공지능 개념, 가치 기반 강화학습, 정책 기반 강화학습, 튜닝 문제, 이렇게 모두 다섯 부분으로 구성됩니다.
· 강화학습의 기초 개념: 강화학습에 필요한 통계 및 수학 이론과 MDP에 대한 설명
· 인공지능 개념: 머신러닝부터 강화학습 내부에서 사용하는 인공신경망으로 이르는 과정을 선형 회귀부터 차근차근 설명
· 가치 기반 강화학습: 상대적으로 이해하기 쉬운 DQN 알고리즘을 코드 중심으로 설명
· 정책 기반 강화학습: REINFORCE, A2C, PPO 알고리즘에 대한 설명과 실행 안내
· 튜닝 문제: 알고리즘의 파라미터 튜닝을 효율적으로 돕는 그리드 서치와 베이지안 최적화 기법
시작하며
01장 강화학습 기본 개념
1.1 강화학습이란
1.2 확률과 확률 과정
1.3. 마르코프 연쇄
1.4 마르코프 보상 과정
02장 강화학습 기본 알고리즘
2.1 마르코프 결정 과정
2.2 MDP 행동 가치 함수
2.3 MDP 최적 가치 함수
2.4 강화학습에 사용되는 다양한 용어
2.5 다이내믹 프로그래밍
2.6 몬테카를로 방법
2.7 TD와 SARSA
2.8 Q 러닝
03장 인공지능의 개념
3.1 머신러닝
3.2 선형 회귀 분석
3.3 분류 분석
3.4 딥러닝
3.5 개발 환경 설치
3.6 텐서플로우
04장 함수 근사법
4.1 미분
4.2 편미분
4.3 스칼라와 벡터
4.4 그래디언트
4.5 경사하강법
4.6 확률적 경사하강법
4.7 강화학습에서 편미분과 경사하강법의 표기법
4.8 함수 근사법
05장 가치 기반 강화학습과 DQN 알고리즘
5.1 DQN 알고리즘
5.2 카트폴
5.3 탐험과 탐욕의 문제
5.4 DQN 알고리즘 기본 구조
5.5 DQN 알고리즘 전체 코드 리뷰
5.6 DQN 알고리즘 세부 구조 살펴보기
5.7 DQN 알고리즘 학습 결과 분석
06장 정책 기반 강화학습 REINFORCE 알고리즘
6.1 인공신경망 다시 보기
6.2 정책 그래디언트
6.3 REINFORCE 알고리즘 동작 방식
6.4 REINFORCE 알고리즘 기본 구조
6.5 REINFORCE 알고리즘 전체 코드 리뷰
6.6 REINFORCE 알고리즘 세부 구조 살펴보기
6.7 REINFORCE 알고리즘 학습 결과 분석
07장 정책 기반 A2C 알고리즘
7.1 액터 크리틱 알고리즘
7.2 어드밴티지 액터 크리틱
7.3 A2C 알고리즘 기본 구조
7.4 A2C 알고리즘 전체 코드 리뷰
7.5 A2C 알고리즘 세부 구조 살펴보기
7.6 A2C 알고리즘 학습 결과 분석
08장 정책 기반 PPO 알고리즘
8.1 중요도 샘플링
8.2 오프 폴리시 정책 그래디언트
8.3 클리핑 기법
8.4 GAE
8.5 PPO 알고리즘 기본 구조
8.6 PPO 알고리즘 전체 코드 리뷰
8.7 PPO 알고리즘 세부 구조 살펴보기
8.8 PPO 알고리즘 알고리즘 학습 결과 분석
09장 인공신경망 튜닝
9.1 인공신경망 튜닝 개요
9.2 입력 데이터 전처리
9.3 비용 함수의 선택
9.4 활성화 알고리즘
9.5 가중치 초기화
9.6 최적화 알고리즘
9.7 노드와 은닉층 개수에 대한 논의
9.8 PPO 알고리즘 인공신경망 튜닝
9.9 PPO 알고리즘 튜닝 코드 적용
9.10 PPO 알고리즘 튜닝 결과 분석
10장 그리드 서치 기반 최적화 기법
10.1 그리드 서치 개념
10.2 그리드 서치 코딩
10.3 그리드 서치 전체 코드
10.4 그리드 서치 결과 분석
10.5 그리드 서치 파라미터 튜닝 적용
11장 베이지안 최적화 기법
11.1 빈도주의 확률과 베이지안 확률
11.2 베이지안 확률 계산
11.3 베이지안 최적화 패키지 소개
11.4 베이지안 최적화 패키지 활용
11.5 베이지안 최적화 전체 코드
11.6 베이지안 최적화 결과 분석
마무리하며
찾아보기



































