公開データセットの利用 | データの取得と準備 | Pythonによる機械学習を学ぶ

スポンサーリンク
スポンサーリンク
amazon
スマイルSALE
--:--:--
ad. 価格範囲を指定して商品を探せます

公開データセットの利用(Kaggle、UCI Repositoryなど)

機械学習では、学習や評価に使用するデータセットが欠かせません。しかし、実際には十分なデータを自分で収集することが難しい場合もあります。

そのような場合に役立つのが、KaggleやUCI Repositoryなどで公開されているデータセットです。これらを利用することで、データ収集の手間をかけずに機械学習の学習や実験を行うことができます。

この記事では、代表的な公開データセットの提供サイトと、Pythonで利用する方法について解説します。

公開データセットの利用を図で理解する

公開データセットの利用を図で理解する

公開データセットとは?

公開データセットとは、研究機関や企業、コミュニティなどが一般公開しているデータのことです。

機械学習の学習用サンプルとして利用できるものが多く、初心者から研究者まで幅広く利用されています。

公開データセットを利用することで、データ収集や入力作業に時間をかけることなく、モデル構築や分析の練習に集中できます。

代表的な公開データセットサイト

サービス 特徴
Kaggle 世界最大級のデータサイエンスコミュニティ。コンペティションや豊富なデータセットが利用できる。
UCI Machine Learning Repository 機械学習教育や研究で広く利用される定番データセット集。
Google Dataset Search インターネット上の公開データセットを検索できる。
政府統計データ 各国政府が公開する人口・経済・気象などの統計データ。

Kaggleとは?

Kaggleは、世界中のデータサイエンティストが集まるプラットフォームです。

機械学習コンペティションだけでなく、数万件以上の公開データセットが提供されています。

Kaggleの特徴

  • 豊富な実務データセットが利用できる
  • 機械学習コンペティションに参加できる
  • 他のユーザーの分析コードを参考にできる
  • 初心者向けの学習コンテンツが充実している

Kaggle APIのインストール

pip install kaggle

Kaggle APIの設定

  1. Kaggleへログインする
  2. アカウント設定画面を開く
  3. 「Create New API Token」をクリックする
  4. ダウンロードされた kaggle.json を設定フォルダへ配置する

設定後はAPI経由でデータセットをダウンロードできるようになります。

Kaggleデータセットのダウンロード例

kaggle competitions download -c titanic

この例では、有名なタイタニック生存予測コンペティションのデータを取得しています。

CSVファイルの読み込み例

import pandas as pd

df = pd.read_csv('titanic.csv')

print(df.head())

UCI Machine Learning Repositoryとは?

UCI Machine Learning Repositoryは、機械学習分野で長年利用されている代表的なデータセット集です。

大学や研究機関での教材としても利用されることが多く、学習用データとして非常に有名です。

UCIの特徴

  • 教育向けデータセットが豊富
  • データの規模が比較的小さい
  • 機械学習の基本学習に適している
  • 学術論文でも利用実績が多い

代表的なデータセット

データセット 用途
Iris 分類問題の入門用
Wine ワインの種類分類
Breast Cancer 乳がん診断分類
Adult 所得予測

UCIデータセットの取得例

import pandas as pd

url = "https://archive.ics.uci.edu/ml/machine-learning-databases/iris/iris.data"

df = pd.read_csv(url, header=None)

print(df.head())

scikit-learnに含まれるデータセット

学習目的であれば、scikit-learnに標準搭載されているデータセットも便利です。

インターネットからダウンロードする必要がなく、すぐに利用できます。

代表的なデータセット

  • Iris(アヤメ分類)
  • Wine(ワイン分類)
  • Breast Cancer(乳がん分類)
  • Digits(手書き数字認識)
  • California Housing(住宅価格予測)

読み込み例

from sklearn.datasets import load_iris

iris = load_iris()

print(iris.data[:5])

公開データセット利用時の注意点

欠損値や異常値を確認する

公開データセットには欠損値や異常値が含まれていることがあります。

分析前にはデータの内容を確認し、適切な前処理を行うことが重要です。

ライセンスを確認する

データセットによっては商用利用が禁止されている場合があります。

利用前にライセンス条件を確認しましょう。

学習データの偏りに注意する

公開データセットは教育用に作成されたものも多く、実際の業務データとは分布が異なることがあります。

そのため、実務で利用する場合はデータの偏りや適用範囲を確認する必要があります。

再現性を確保する

データセットが更新される場合もあるため、利用したデータのバージョンや取得日を記録しておくことが推奨されます。

初心者におすすめのデータセット

データセット 学べる内容
Iris 分類問題の基礎
Titanic 前処理・特徴量エンジニアリング
Wine 分類と特徴量分析
California Housing 回帰分析
Digits 画像認識の基礎

まとめ

公開データセットは、機械学習を学ぶうえで非常に重要な学習資源です。

Kaggleでは実務に近い大規模データを利用でき、UCI Repositoryでは教育向けの定番データセットを利用できます。また、scikit-learnには学習用データセットが標準搭載されているため、すぐに機械学習の実験を始めることも可能です。

まずはIrisやTitanicなどの有名なデータセットから始めて、データ分析やモデル構築の流れを身につけるとよいでしょう。