統計的データクリーニングの理論と実践(トウケイテキデータクリーニングノリロントジッセン)
R によるデータ編集/欠測補完システム
- 著者:
- Mark van der Loo/Edwin de Jonge/地道 正行/高橋 雅夫/藤野 友和/安川 武彦(マーク ファン デル ロー/エドウィン デ ヨンゲ/ジミチ マサユキ/タカハシ マサオ/フジノ トモカズ/ヤスカワ タケヒコ)
- 出版社:
- 共立出版
- 出版日:
- 2022年02月24日頃
- ISBN:
- 9784320114630
- 在庫:
- 在庫あり
なぜ注目されているか
書籍紹介
統計的なデータクリーニングシステムを構築するための包括的なガイド
データクリーニングとは、入手した原データを、分析に耐えうる品質にするために、エラーや矛盾する値を検出・修正し、欠測を補完する作業のことで、データ分析においてしばしば最も時間のかかるプロセスである。公的統計分野において、この分野は「データ編集」とも呼ばれ、この 50 年余に多くの知見が蓄積されてきたが、一般の統計のコミュニティにおける文献は多くない。
本書は、 2013 年に開催された世界規模の R ユーザーカンファレンスである useR!2013 において行われたデータクリーニングのチュートリアルがきっかけとなり,オランダ統計局の研究部門に所属する著者によって書かれている。近年のビックデータ時代の到来により、調査集計を行う公的統計部局は行政記録その他の幅広いデータを取り扱うようになるとともに、より広い分野においてもデータの入手が容易になったためにデータクリーニングの要請は広がり、公的統計分野での知見はより多くの分野で役立つ可能性を持っている。
著者は、本書で紹介されるデータ検証やエラーの局所化、エラー修正のための様々な方法や欠測値の補完といった様々なデータクリーニングのための R のパッケージの多くを開発しており、実際に使用するためのコード例も豊富に掲載され、数値やテキスト、日付等のデータの取り扱いや、数値計算時の留意点など、プログラミングに関する内容も収録されている。
本書の特徴
データ分析を行う際に、しばしば最も手のかかるデータクリーニングに焦点を当て、理論と R による実装の双方向から解説
アドホックで、データ毎に異なるカスタムメイドのクリーニングシステムではなく、汎用性を重視した構築の方法論も解説
データの矛盾を解消し、欠測を補完するための統計的手法、バッチ処理化やデータ変遷のモニタリングについても解説
〔原著〕 Statistical Data Cleaning with Applications in R, Wiley, 2018.
この本に興味がある方におすすめ
この本に関連
関連記事
データベース本ガイド - SQL から設計まで学べる技術書の選び方
データベースの基礎から設計、パフォーマンスチューニングまで学べる技術書の選び方と学習順序を紹介します。
本についてくるダウンロード素材を使い倒す
プログラミングの本には、サンプルコードや素材のダウンロード特典がついていることがあります。この特典を活用するだけで、学習効率が大きく変わります。
機械学習・AI 本ガイド - エンジニアが読むべき技術書の選び方
機械学習の基礎から実践まで学べる技術書の選び方を紹介。「Python ではじめる機械学習」などのハンズオン本を軸に、数学が苦手な人向けの学習ルートと ML 本の賞味期限の見極め方を解説します。