PythonにおけるK-meansクラスタリングの実装と評価手法
K-meansモデルの構築とラベリング
クラスタリング分析を行う場合、まず対象となる特徴量を抽出し、アルゴリズムのパラメータを定義します。scikit-learnのKMeansクラスを利用すると、効率的にモデルを構築できます。
import pandas as pd
from sklearn.cluster import KMeans
import matplotlib.pyplot as plt
# データセットの読み込み
dataset = pd.read_csv("transport ...
8月1日 17:12 投稿
機械学習アルゴリズムのAPIまとめ
sklearn API
1. K-近傍法 (K-Nearest Neighbors)
1.1 データ読み込み
データセットは sklearn.datasets から取得できます。
datasets.load_*: 小さなデータセットを読み込む
datasets.fetch_*: 大きなデータセットを読み込む
戻り値は以下の形式で提供されます。
data: 特徴量の配列
target: ラベルの配列
DESCR: データセットの説明
2. デ ...
7月28日 01:07 投稿
逻辑回帰による二値分類入門
線形回帰や多項式回帰を学んだ後、次に取り組むべきはロジスティック回帰(Logistic Regression)です。これは主に二値分類問題を解くための手法で、「ある事象が起こるか否か」を確率的に予測します。たとえば、商品が売れるかどうか、患者が特定の病気に罹患しているか、といった「Yes/No」の判断に広く使われます。
ロジスティック回帰の特徴
ロジスティック回帰は名前 ...
7月24日 21:21 投稿
Pythonによる線形回帰モデルの評価と実装
線形回帰モデルの評価指標
決定係数(R-squared)は、線形回帰モデルの適合度を示す指標です。0から1の範囲で値を取り、1に近いほどモデルの説明力が高いことを示します。
調整済み決定係数(Adjusted R-squared)は、変数の数を考慮した適合度指標です。同様に0から1の範囲で値を取り、1に近いほどモデルの適合度が高いことを示します。
P値は、説明変数の統計的有意性を ...
7月22日 23:54 投稿
Pythonを用いたアンサンブル学習とハイパーパラメータ最適化の実践ガイド
アンサンブル学習の全体像
単一モデルでは限界が見えた際、複数の「弱い学習器」を組み合わせることで精度を大きく向上させる手法がアンサンブル学習である。本記事では代表的な3パターン——Bagging、Boosting、Voting——を取り上げ、scikit-learnを使った実装例を示す。
Bagging系手法
Bagged Decision Trees
Bootstrap標本を複数生成し、それぞれで決定木を学習させた後、 ...
7月17日 22:41 投稿
サポートベクトルマシン(SVM)におけるソフトマージンと正則化の理論と実装
1. サポートベクトルマシンの柔軟性と堅牢性
サポートベクトルマシン(SVM)は、高い汎化性能と数学的背景を持つ強力な学習アルゴリズムです。しかし、現実世界のデータにはノイズや外れ値が含まれており、完全に線形分離できるケースは稀です。このような制約を克服するために導入された概念が「ソフトマージン」と「正則化」です。これらはモデルの複雑さと誤差の許容度 ...
7月17日 18:24 投稿
Python によるサポートベクターマシンの実装とハイパーパラメータ最適化
サポートベクターマシン(SVM)の概要
サポートベクターマシン(Support Vector Machine: SVM)は、統計的学習理論に基づく強力な分類アルゴリズムです。主に二値分類問題に用いられますが、多クラス分類や回帰分析にも拡張可能です。SVM の核心は、異なるクラス間のマージン(余白)を最大化する決定境界(超平面)を構築することにあります。
主要な特徴と適用領域
...
7月8日 21:08 投稿
決定樹アルゴリズムの基礎から応用まで:R および Python 実装解説
樹木モデルの概要
監督学習の手法において、樹木ベースのアルゴリズムは最も効果的で頻繁に利用されるアプローチの一つです。これらの手法は、予測モデルに高い精度と安定性をもたらすだけでなく、結果の解釈性も優れています。線形モデルとは異なり、非線形な関係性を適切に表現できる点が大きな特徴です。分類問題および回帰問題の双方に対応可能であり、データサイエン ...
6月21日 23:13 投稿
分類器の選択と評価:多クラス分類におけるロジスティック回帰の実装
はじめに
前回の記事では、料理データセットの前処理(クリーニングとバランシング)を完了しました。今回は、複数の分類アルゴリズムを用いてモデルを構築し、特定の材料の組み合わせから料理の国籍を予測するタスクに取り組みます。この過程で、異なる分類アルゴリズムの評価と比較を行い、タスクに最適なモデルを選択する方法を学びます。
分類アルゴリズムの選択
Sci ...
6月20日 19:36 投稿
K-MeansとDBSCANクラスタリングアルゴリズムの徹底解説
クラスタリングアルゴリズムの概要
K-MeansとDBSCANは、データマイニングや機械学習の分野で広く利用される教師なし学習アルゴリズムです。これらのアルゴリズムは、ラベル付けされていないデータから自然なグループ(クラスター)を発見するために使用されます。
K-Meansアルゴリズムの詳細
K-Meansは分割ベースのクラスタリング手法であり、データ空間内のk個の中心点 ...
6月14日 00:02 投稿