データの種類(構造化/非構造化、定量/定性、ストック/フロー)

データを3軸で分類する習慣をつけ、適切な分析手法を選べるようにしましょう。

扱うデータの種類を整理することで、適切な分析手法と保存方法を選べるようになります。

白峰 リリ(普段) 白峰 リリ

『データ』って一口に言っても、いろんな形があるよね。
エクセル表もあれば写真もあるし。

神楽 モニカ 先生(笑顔) 神楽 モニカ 先生

その通り。
DS検定では構造化データと非構造化データ、定量データと定性データ、ストックデータとフローデータという3つの軸で整理するの。

紅林 かえで(普段) 紅林 かえで

構造化データは、表形式で行と列が定義されているもの。
売上テーブルなんかが典型ね。
非構造化データは、画像・音声・自由記述テキストみたいに、決まった形式を持たないものを指すわ。

藍沢 しずく(普段) 藍沢 しずく

アンケートの『はい/いいえ』は構造化データ、自由記述欄は非構造化データですねぇ。

紅林 かえで(普段) 紅林 かえで

そう。
定量データは数値で表せるもので、売上や気温、年齢ね。
定性データは質的なカテゴリで、性別・職業・色なんかがそう。

白峰 リリ(笑い) 白峰 リリ

性別は『男/女』みたいに分類だから定性、ってことね。

神楽 モニカ 先生(普段) 神楽 モニカ 先生

そしてストックデータとフローデータ。
ストックは『ある時点での残高』(在庫数・銀行預金)、フローは『一定期間の流れ』(月次売上・流入トラフィック)。
会計の『B/S』『P/L』に対応するわ。

藍沢 しずく(笑顔) 藍沢 しずく

わぁ、お風呂の水位がストック、蛇口から出る水がフローみたいなイメージですぅ♪

紅林 かえで(笑顔) 紅林 かえで

うまいたとえね。
データの種類を間違えると分析手法もズレちゃうから、最初に整理するのが大事よ。

白峰 リリ(普段) 白峰 リリ

例えば、定性データを定量みたいに平均しちゃうとマズい?

神楽 モニカ 先生(普段) 神楽 モニカ 先生

そうね。
性別の『男=1、女=0』という符号化があっても、平均0.5に意味はないわ。
カテゴリ変数はそのまま頻度や比率で扱うのが基本。

紅林 かえで(普段) 紅林 かえで

なお、データの尺度水準として名義尺度・順序尺度・間隔尺度・比例尺度という4分類もよく出題されるわ。

藍沢 しずく(普段) 藍沢 しずく

覚えること多いですぅ…がんばって覚えますぅ♪

神楽 モニカ 先生(笑顔) 神楽 モニカ 先生

1度に全部覚えなくていいの。
関連記事を行ったり来たりしながら、自然と頭に残るわよ。

確認クイズ

次のうち、定性データかつ非構造化データの典型例はどれか。

  1. 毎日の気温(摂氏)
  2. 顧客アンケートの自由記述欄
  3. 売上テーブルの金額カラム
  4. 出席簿の生年月日
こたえを見る

正解: 2. 顧客アンケートの自由記述欄

顧客アンケートの自由記述欄は、書き方が決まっておらず非構造化、内容も質的(感想・意見)なため定性データの代表例です。テキストマイニングなど特殊な手法で扱います。

# Pandas で構造化データを扱う最小例
import pandas as pd
df = pd.DataFrame({
    'age': [22, 35, 41],          # 比例尺度 (定量)
    'gender': ['F', 'M', 'F'],    # 名義尺度 (定性)
    'satisfaction': [4, 5, 3],    # 順序尺度
})
print(df.dtypes)

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。