ゼロから作る Deep Learning ❹(ゼロカラツクルディープラーニングフォー)
強化学習編
プログラミング- 著者:
- 斎藤 康毅(サイトウ コウキ)
- 出版社:
- オライリー・ジャパン
- 出版日:
- 2022年04月06日頃
- ISBN:
- 9784873119755
- 在庫:
- 在庫あり
なぜ注目されているか
書籍紹介
技書の森解説
シリーズ第 1 巻がニューラルネットワークの原理を自作で腑に落とす本だったのと同じ精神で、本書は強化学習を一から実装して理解する一冊です。マルコフ決定過程、動的計画法、モンテカルロ法、 TD 学習、そして方策勾配法と DQN に至るまで、 Python と NumPy だけでアルゴリズムを組み上げていきます。フレームワーク任せでは見えてこない「報酬がどう伝播し、方策がどう更新されるか」を手を動かして追体験する構成です。
強化学習は教師あり学習とは問題設定そのものが異なるため、別途の入門が必要になります。本書はシリーズの読者が期待する「理論を数式で追って、自分でコードに落とす」スタイルを強化学習に適用したものであり、数学的な厳密さよりも実装を通じた直観の獲得を優先しています。読み進めるには確率・期待値の基礎知識が必要ですが、第 1 巻を終えていれば接続は自然です。強化学習の全体像を把握したあと、 OpenAI Gym や本番の研究コードに進む足場として機能します。
言及 Qiita 記事 (18 件)
ゼロから作るDeep Learningで素人がつまずいたことメモ: まとめ
♡ 345Python, 機械学習, DeepLearning理系大学生が暇でディープラーニングの勉強始めてみた
♡ 87Python, DeepLearning, Keras, PyTorchSE 3年目で読んだ技術書52冊
♡ 80技術書, Se, 新人プログラマ応援docker(18)でpython(10)/Rで機械学習する 書籍/ソース一覧 AI(36)
♡ 47Python, 機械学習, DeepLearning, Docker, CountdownCalendar2022ゼロつくDeepLearningシリーズ完走したので感想を書く
♡ 31DeepLearning, ゼロから作るDeep-LearningMDPとPOMDPって結局なんやねん
♡ 14強化学習, ReinforcementLearning, POMDP, MDP, 部分観測マルコフ決定過程輪読会のすゝめ
♡ 13機械学習, AI, 輪読会強化学習のコンセプト【テーブル形式の解法】
♡ 5強化学習, ベルマン方程式, マルコフ決定過程E資格合格までの道のりと備忘録
♡ 4Python, 機械学習, 人工知能, PyTorch, E資格強化学習ライブラリOpenAI Gymで独自環境を作って学んだ“やってみないと分からないこと”
♡ 4強化学習, OpenAIGym
言及 Zenn 記事 (1 件)
この本に興味がある方におすすめ
この本に関連
斎藤 康毅 の他の書籍
関連記事
ゼロから作る Deep Learning シリーズの読む順番 - 全 6 巻の内容と選び方を整理
ゼロから作る Deep Learning シリーズ全 6 巻 (基礎 / 自然言語処理 / フレームワーク / 強化学習 / 生成モデル / LLM) の読む順番を解説。各巻の内容 / 発売年 / 前提知識を一覧表で整理し、目的別にどの巻から読むべきかを案内します。
Python 本の選び方 - 独学の最初の 1 冊から実務品質まで
Python 本の選び方を「動機」から逆算して整理。プログラミング未経験の最初の 1 冊、業務自動化に直結する本、型ヒントとコード品質で実務水準へ進む本まで、2026 年 8 月時点の定番を独学ルートに沿って解説します。
ディープラーニング本の選び方 - 原理 / 理論 / 実装 / 数学の 4 系統で整理 (2026 年 8 月時点)
ディープラーニング本の選び方を 4 系統 (原理を手で理解する本 / 理論を体系的に学ぶ本 / フレームワーク実装本 / 数学を補う本) に整理。2026 年 8 月時点の定番書を目的別 / レベル別に紹介し、賞味期限の見極め方も解説します。