データ分析実務で必須の環境とツール。 Jupyter・matplotlib・seaborn・Docker の役割を理解。
Pythonでデータ分析するときの環境って、どう揃えればいい?
主要ツールは(1)Jupyter Notebook、(2)matplotlib、(3)seaborn、(4)Plotly、(5)Docker、(6)Gitよ。
Jupyter Notebookは対話的にPythonを実行し、結果(数値・グラフ)を文書化できるツール。 データ分析の標準的作業環境。 拡張版の JupyterLab もある。
Google Colab もJupyterと同じものなんですかぁ?
そう、Google ColabはGoogleが提供するクラウドJupyter環境。 GPUも無料で使えるので深層学習の入門に最適。
可視化はmatplotlibとseabornがあるんでしょ?
import matplotlib.pyplot as plt
import seaborn as sns
import pandas as pd
# 基本: matplotlib (低レベル・細かい制御可)
fig, ax = plt.subplots(figsize=(8, 5))
ax.plot(df['date'], df['sales'], marker='o', label='Sales')
ax.set_xlabel('日付')
ax.set_ylabel('売上(円)')
ax.set_title('月次売上推移')
ax.legend()
plt.show()
# 高機能: seaborn (matplotlibラッパー、統計プロットが簡単)
sns.boxplot(data=df, x='category', y='amount')
sns.heatmap(df.corr(), annot=True, cmap='coolwarm')
sns.pairplot(df, hue='target') # 全変数ペアプロット
# インタラクティブ: Plotly (Webブラウザで操作可)
import plotly.express as px
fig = px.scatter(df, x='age', y='salary', color='dept', hover_data=['name'])
fig.show()
matplotlibは低レベルで細かく制御可能な可視化ライブラリ、seabornはその上に統計プロット用の便利関数を載せたラッパー。 散布図・箱ひげ・ヒートマップ・ペアプロットが1〜2行で書ける。
Dockerって何の役に立つんですかぁ?
Dockerは『開発環境を1つのコンテナにまとめて、誰でも同じ環境を再現できる』ようにするツールなのよ。 OS差やライブラリのバージョン差を吸収してくれる。 MLOps の基盤技術でもあるの。
開発者間で『私の環境では動くのに…』という問題を防げます。 さらに、クラウド本番環境にもそのままデプロイできる利点が大きいですね。
Gitは何に使うの?
Gitはソースコードのバージョン管理ツールよ。 GitHubでチームの共同開発やリリース管理ができるの。 データサイエンティストもPythonコードやJupyterノートブックをGit管理するのが標準ね。
DS検定★では『Jupyter=対話的開発環境』『matplotlib=低レベル可視化、seaborn=統計プロット』『Docker=環境再現性』『Git=バージョン管理』という役割分担を押さえておきましょう。
確認クイズ
次のうちseabornの最も得意とする可視化はどれか。
- 3D の球体描画
- 統計プロット(箱ひげ・ヒートマップ・ペアプロット)が1〜2行で書ける
- 音声データの再生
- リアルタイムストリーミング
こたえを見る
正解: 2. 統計プロット(箱ひげ・ヒートマップ・ペアプロット)が1〜2行で書ける
統計プロット(箱ひげ・ヒートマップ・ペアプロット等)が1〜2行で書けるのがseabornの強み。 matplotlibの上に統計可視化用の便利関数を提供しています。