扱うデータの種類を整理することで、適切な分析手法と保存方法を選べるようになります。
『データ』って一口に言っても、いろんな形があるよね。
エクセル表もあれば写真もあるし。
その通り。
DS検定では構造化データと非構造化データ、定量データと定性データ、ストックデータとフローデータという3つの軸で整理するの。
構造化データは、表形式で行と列が定義されているもの。
売上テーブルなんかが典型ね。
非構造化データは、画像・音声・自由記述テキストみたいに、決まった形式を持たないものを指すわ。
アンケートの『はい/いいえ』は構造化データ、自由記述欄は非構造化データですねぇ。
そう。
定量データは数値で表せるもので、売上や気温、年齢ね。
定性データは質的なカテゴリで、性別・職業・色なんかがそう。
性別は『男/女』みたいに分類だから定性、ってことね。
そしてストックデータとフローデータ。
ストックは『ある時点での残高』(在庫数・銀行預金)、フローは『一定期間の流れ』(月次売上・流入トラフィック)。
会計の『B/S』『P/L』に対応するわ。
わぁ、お風呂の水位がストック、蛇口から出る水がフローみたいなイメージですぅ♪
うまいたとえね。
データの種類を間違えると分析手法もズレちゃうから、最初に整理するのが大事よ。
例えば、定性データを定量みたいに平均しちゃうとマズい?
そうね。
性別の『男=1、女=0』という符号化があっても、平均0.5に意味はないわ。
カテゴリ変数はそのまま頻度や比率で扱うのが基本。
なお、データの尺度水準として名義尺度・順序尺度・間隔尺度・比例尺度という4分類もよく出題されるわ。
覚えること多いですぅ…がんばって覚えますぅ♪
1度に全部覚えなくていいの。
関連記事を行ったり来たりしながら、自然と頭に残るわよ。
確認クイズ
次のうち、定性データかつ非構造化データの典型例はどれか。
- 毎日の気温(摂氏)
- 顧客アンケートの自由記述欄
- 売上テーブルの金額カラム
- 出席簿の生年月日
こたえを見る
正解: 2. 顧客アンケートの自由記述欄
顧客アンケートの自由記述欄は、書き方が決まっておらず非構造化、内容も質的(感想・意見)なため定性データの代表例です。テキストマイニングなど特殊な手法で扱います。
# Pandas で構造化データを扱う最小例
import pandas as pd
df = pd.DataFrame({
'age': [22, 35, 41], # 比例尺度 (定量)
'gender': ['F', 'M', 'F'], # 名義尺度 (定性)
'satisfaction': [4, 5, 3], # 順序尺度
})
print(df.dtypes)