コンピュータビジョンの基礎と実装アプローチ

コンピュータビジョンの本質と実用領域 コンピュータビジョン(Computer Vision)は視覚情報を解析する人工知能技術であり、画像・動画から対象物の識別や意思決定を実現します。実用事例として顔認証システムや自動運転技術、医療画像解析などが挙げられます。 主要な画像認識タスク タスク目的実用例 画像分類単一/複数ラベル付与写真自動分類、品質検査 物体検 ...

8月12日 00:25 投稿

YOLOv5バックボーンネットワークの実装

データセット準備 import torch import torch.nn as nn from torchvision import transforms, datasets # デバイス設定 device = torch.device("cuda" if torch.cuda.is_available() else "cpu") # データ変換処理 training_transforms = transforms.Compose([ transforms.Resize([224, 224]), transforms.ToTensor(), transforms.Normalize(mean=[0.485, 0 ...

7月10日 18:14 投稿

糖尿病網膜病変の画像分類における深層学習応用

0 はじめに 本プロジェクトは、機械視覚を活用した卒業研究として、糖尿病網膜病変の画像分類を行うものです。 プロジェクト実行結果: 卒業研究:糖尿病網膜病変予測 プロジェクト入手方法: https://gitee.com/assistant-a/project-sharing 1 目標設定 この課題では、1000枚の網膜画像データセットを使用し、4つの段階に分類されています。深層学習フレームワークであるP ...

7月6日 17:36 投稿

ViT事前学習モデルを用いた画像分類の実装手法

ViTモデルの基本構造 Vision Transformer(ViT)はトランスフォーマーアーキテクチャを画像処理に応用したモデルです。画像を固定サイズのパッチに分割し、各パッチを埋め込みベクトルに変換します。位置情報を付加した後、トランスフォーマーエンコーダーで特徴抽出を行います。 class VisionTransformer(nn.Module): def __init__(self, image_dim=224, patch_dim=1 ...

7月6日 00:16 投稿

画像分類におけるMLPとCNNの性能比較:猫犬識別プロジェクトを通じた実践的検証

画像認識タスクにおいて、畳み込みニューラルネットワーク(CNN)は空間的特徴を効率的に抽出できるため、多層パーセプトロン(MLP)よりも優れた性能を発揮することが知られています。本稿では、猫と犬の二値分類というシンプルな課題を通じて、両者の構造的差異と学習挙動を実コードで比較・分析します。 環境設定とデータ準備 Google Colab上でTensorFlow 2.xを使用し ...

6月25日 21:40 投稿

PyTorchでMNISTの手書き数字認識モデルを構築する

開発環境設定 WSL2(Ubuntu 22.04) + PyTorch 2.1.2 + Python 3.9.18環境構築 ハードウェアアクセラレーション設定 import torch # CUDA互換GPUの利用設定 device = torch.device("cuda" if torch.cuda.is_available() else "cpu") print(f"使用デバイス: {device}") データ処理パイプライン構築 データセット準備 from torchvision import datasets, transforms # ...

6月20日 16:09 投稿

DenseNetにSEモジュールを統合した猴痘ウイルス画像分類モデルの実装

データ準備と前処理 必要なライブラリをインポートし、画像データをロードする。 import torch import torch.nn as nn import torchvision.transforms as T from torchvision.datasets import ImageFolder from pathlib import Path from PIL import Image import matplotlib.pyplot as plt import warnings warnings.filterwarnings("ignore") データディレクトリからク ...

5月18日 21:27 投稿

ディープラーニングによる猫画像分類モデルの構築

必要なライブラリ 本プロジェクトでは、以下のライブラリを使用します。 NumPy: Pythonでの科学計算のための基本ライブラリ H5py: H5形式のファイルに保存されたデータセットと対話するためのライブラリ Matplotlib: Pythonでグラフを描画するためのライブラリ PIL: 画像処理のためのライブラリ SciPy: 画像処理のための追加機能を提供するライブラリ プロジェクトの概 ...

5月14日 13:30 投稿