コンピュータビジョンの基礎と実装アプローチ
コンピュータビジョンの本質と実用領域
コンピュータビジョン(Computer Vision)は視覚情報を解析する人工知能技術であり、画像・動画から対象物の識別や意思決定を実現します。実用事例として顔認証システムや自動運転技術、医療画像解析などが挙げられます。
主要な画像認識タスク
タスク目的実用例
画像分類単一/複数ラベル付与写真自動分類、品質検査
物体検 ...
8月12日 00:25 投稿
YOLOv5バックボーンネットワークの実装
データセット準備
import torch
import torch.nn as nn
from torchvision import transforms, datasets
# デバイス設定
device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
# データ変換処理
training_transforms = transforms.Compose([
transforms.Resize([224, 224]),
transforms.ToTensor(),
transforms.Normalize(mean=[0.485, 0 ...
7月10日 18:14 投稿
糖尿病網膜病変の画像分類における深層学習応用
0 はじめに
本プロジェクトは、機械視覚を活用した卒業研究として、糖尿病網膜病変の画像分類を行うものです。
プロジェクト実行結果:
卒業研究:糖尿病網膜病変予測
プロジェクト入手方法:
https://gitee.com/assistant-a/project-sharing
1 目標設定
この課題では、1000枚の網膜画像データセットを使用し、4つの段階に分類されています。深層学習フレームワークであるP ...
7月6日 17:36 投稿
ViT事前学習モデルを用いた画像分類の実装手法
ViTモデルの基本構造
Vision Transformer(ViT)はトランスフォーマーアーキテクチャを画像処理に応用したモデルです。画像を固定サイズのパッチに分割し、各パッチを埋め込みベクトルに変換します。位置情報を付加した後、トランスフォーマーエンコーダーで特徴抽出を行います。
class VisionTransformer(nn.Module):
def __init__(self, image_dim=224, patch_dim=1 ...
7月6日 00:16 投稿
画像分類におけるMLPとCNNの性能比較:猫犬識別プロジェクトを通じた実践的検証
画像認識タスクにおいて、畳み込みニューラルネットワーク(CNN)は空間的特徴を効率的に抽出できるため、多層パーセプトロン(MLP)よりも優れた性能を発揮することが知られています。本稿では、猫と犬の二値分類というシンプルな課題を通じて、両者の構造的差異と学習挙動を実コードで比較・分析します。
環境設定とデータ準備
Google Colab上でTensorFlow 2.xを使用し ...
6月25日 21:40 投稿
PyTorchでMNISTの手書き数字認識モデルを構築する
開発環境設定
WSL2(Ubuntu 22.04) + PyTorch 2.1.2 + Python 3.9.18環境構築
ハードウェアアクセラレーション設定
import torch
# CUDA互換GPUの利用設定
device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
print(f"使用デバイス: {device}")
データ処理パイプライン構築
データセット準備
from torchvision import datasets, transforms
# ...
6月20日 16:09 投稿
DenseNetにSEモジュールを統合した猴痘ウイルス画像分類モデルの実装
データ準備と前処理
必要なライブラリをインポートし、画像データをロードする。
import torch
import torch.nn as nn
import torchvision.transforms as T
from torchvision.datasets import ImageFolder
from pathlib import Path
from PIL import Image
import matplotlib.pyplot as plt
import warnings
warnings.filterwarnings("ignore")
データディレクトリからク ...
5月18日 21:27 投稿
ディープラーニングによる猫画像分類モデルの構築
必要なライブラリ
本プロジェクトでは、以下のライブラリを使用します。
NumPy: Pythonでの科学計算のための基本ライブラリ
H5py: H5形式のファイルに保存されたデータセットと対話するためのライブラリ
Matplotlib: Pythonでグラフを描画するためのライブラリ
PIL: 画像処理のためのライブラリ
SciPy: 画像処理のための追加機能を提供するライブラリ
プロジェクトの概 ...
5月14日 13:30 投稿