PythonはデータSanalysis・機械学習の分野で最も使われるプログラミング言語です。データサイエンティスト・AI/MLエンジニアを目指すなら必須のスキルです。
Pythonデータ分析の主要ライブラリ
| ライブラリ | 用途 | 特徴 |
|---|---|---|
| NumPy | 数値計算・配列処理 | 高速な多次元配列操作 |
| pandas | データ操作・集計 | ExcelのようにデータをDataFrameで扱う |
| Matplotlib | グラフ描画 | 基本的なグラフ作成 |
| Seaborn | 統計グラフ | 美しい統計グラフを簡単に |
| Scikit-learn | 機械学習 | 分類・回帰・クラスタリング |
pandasの基本操作
import pandas as pd
# CSVファイルの読み込み
df = pd.read_csv('data.csv')
# データの概要確認
df.head() # 先頭5行を表示
df.info() # データ型・欠損値確認
df.describe() # 統計情報(平均・最大・最小等)
# 列を選択
df['age'] # age列を取得
df[['name', 'age']] # 複数列を取得
# 条件でフィルタリング
df[df['age'] > 30] # 30歳超を抽出
# グループ集計
df.groupby('category')['sales'].sum()
NumPyの基本操作
import numpy as np
# 配列の作成
arr = np.array([1, 2, 3, 4, 5])
matrix = np.array([[1, 2, 3], [4, 5, 6]])
# 基本統計
np.mean(arr) # 平均
np.std(arr) # 標準偏差
np.sum(arr) # 合計
np.max(arr) # 最大値
# ゼロ配列・ランダム配列
np.zeros((3, 3)) # 3x3のゼロ配列
np.random.rand(5) # 0〜1のランダム値5つ
Matplotlibでグラフを作成
import matplotlib.pyplot as plt
import pandas as pd
df = pd.read_csv('sales.csv')
# 折れ線グラフ
plt.plot(df['month'], df['sales'])
plt.title('月別売上推移')
plt.xlabel('月')
plt.ylabel('売上(万円)')
plt.show()
# 棒グラフ
plt.bar(df['category'], df['count'])
plt.show()
データ分析の基本的な流れ
- データ収集:CSV・DB・API等からデータを取得
- データ確認:df.info()、df.describe()で全体を把握
- データクリーニング:欠損値処理・外れ値の除去
- 探索的分析(EDA):グラフで傾向を可視化
- 集計・分析:グループ集計・相関分析
- 結論・報告:Jupyter Notebookでまとめる
Jupyter Notebookの活用
データ分析にはJupyter Notebook(またはGoogle Colab)が最適です。コードと結果・グラフを一つのファイルにまとめられます。
まとめ
Pythonデータ分析はpandas・NumPy・Matplotlibの3つから始めましょう。Jupyter Notebookを使って手を動かしながら学ぶのが最短ルートです。データサイエンティスト・機械学習エンジニアへのキャリアにつながります。
📚 プログラミング初心者におすすめの本