PROGスクールナビ

Pythonデータ分析入門|pandas・NumPy・Matplotlibの使い方

PythonはデータSanalysis・機械学習の分野で最も使われるプログラミング言語です。データサイエンティスト・AI/MLエンジニアを目指すなら必須のスキルです。

Pythonデータ分析の主要ライブラリ

ライブラリ用途特徴
NumPy数値計算・配列処理高速な多次元配列操作
pandasデータ操作・集計ExcelのようにデータをDataFrameで扱う
Matplotlibグラフ描画基本的なグラフ作成
Seaborn統計グラフ美しい統計グラフを簡単に
Scikit-learn機械学習分類・回帰・クラスタリング

pandasの基本操作

import pandas as pd

# CSVファイルの読み込み
df = pd.read_csv('data.csv')

# データの概要確認
df.head()       # 先頭5行を表示
df.info()       # データ型・欠損値確認
df.describe()   # 統計情報(平均・最大・最小等)

# 列を選択
df['age']       # age列を取得
df[['name', 'age']]  # 複数列を取得

# 条件でフィルタリング
df[df['age'] > 30]  # 30歳超を抽出

# グループ集計
df.groupby('category')['sales'].sum()

NumPyの基本操作

import numpy as np

# 配列の作成
arr = np.array([1, 2, 3, 4, 5])
matrix = np.array([[1, 2, 3], [4, 5, 6]])

# 基本統計
np.mean(arr)    # 平均
np.std(arr)     # 標準偏差
np.sum(arr)     # 合計
np.max(arr)     # 最大値

# ゼロ配列・ランダム配列
np.zeros((3, 3))    # 3x3のゼロ配列
np.random.rand(5)   # 0〜1のランダム値5つ

Matplotlibでグラフを作成

import matplotlib.pyplot as plt
import pandas as pd

df = pd.read_csv('sales.csv')

# 折れ線グラフ
plt.plot(df['month'], df['sales'])
plt.title('月別売上推移')
plt.xlabel('月')
plt.ylabel('売上(万円)')
plt.show()

# 棒グラフ
plt.bar(df['category'], df['count'])
plt.show()

データ分析の基本的な流れ

  1. データ収集:CSV・DB・API等からデータを取得
  2. データ確認:df.info()、df.describe()で全体を把握
  3. データクリーニング:欠損値処理・外れ値の除去
  4. 探索的分析(EDA):グラフで傾向を可視化
  5. 集計・分析:グループ集計・相関分析
  6. 結論・報告:Jupyter Notebookでまとめる

Jupyter Notebookの活用

データ分析にはJupyter Notebook(またはGoogle Colab)が最適です。コードと結果・グラフを一つのファイルにまとめられます。

まとめ

Pythonデータ分析はpandas・NumPy・Matplotlibの3つから始めましょう。Jupyter Notebookを使って手を動かしながら学ぶのが最短ルートです。データサイエンティスト・機械学習エンジニアへのキャリアにつながります。

📚 プログラミング初心者におすすめの本

🛒 楽天で人気のプログラミング入門書