Beautiful Soupを使ったウェブスクレイピングの基本

Beautiful Soupの概要 Beautiful SoupはPythonのライブラリで、HTMLやXMLドキュメントを解析し、データを抽出するために使用されます。複雑なHTML構造を簡単に操作できる強力なツールです。 基本的な使用方法 # 必要なライブラリのインポート from bs4 import BeautifulSoup # サンプルHTMLドキュメント html_content = """ <html> <head><title>テス ...

7月23日 17:59 投稿

Python Web クローリング実装:urllib から Scrapy までの進化

HTTP リクエストライブラリの比較と選定 Python において Web クローリングや HTTP 通信を行う場合、標準ライブラリからサードパーティ製の強力なライブラリまで、複数の選択肢が存在します。主に urllib、urllib2、requests、そしてフレームワークである Scrapy が挙げられます。それぞれの特性を理解し、目的に応じて使い分けることが重要です。 urllib と urllib2 の違 ...

7月11日 22:28 投稿

業務効率化に役立つ17のPython自動化スクリプト集

1. ファイルシステムの自動整理 拡張子ベースのファイル分類 指定ディレクトリ内のファイルを拡張子ごとにサブフォルダへ振り分ける処理です。標準ライブラリのpathlibを活用し、ファイルパス操作を安全かつ簡潔に記述しています。 import shutil from pathlib import Path def organize_by_extension(target_dir: str) -> None: base_path = Path(target_dir) if ...

7月8日 17:25 投稿

PythonによるWebスクレイピング実践:4つの代表的なユースケース

1. Eコマースサイトの商品情報取得 例えば、中国の主要ECプラットフォーム「JD.com」の特定商品ページ(例:一加9Rスマートフォン)を対象に、HTTPリクエストによるHTMLコンテンツの取得を試みます。URLはhttps://item.jd.com/100020542894.htmlです。 まずrobots.txtを確認します:https://item.jd.com/robots.txt。実際の内容は次のような形式で、Googlebotなど特定のク ...

6月13日 22:30 投稿

Python Requests モジュールによる Web スクレイピング入門

Python Requests モジュールによる Web スクレイピング入門 Python において HTTP リクエストを送信するための標準的なライブラリとして、requests モジュールが広く利用されています。本記事では、requests の基本的な使い方から、実践的なデータ収集の手法、およびよくある問題の解決策について解説します。 環境構築とインストール 開発環境として Anaconda を利用す ...

6月7日 16:34 投稿

カスタムWebスクレイピングフレームワークにおけるクローラクラスの実装ガイド

ベースクラスの継承と初期設定 フレームワークが提供する基底機能を拡張し、実際のデータ抽出ロジックを構築する方法について解説します。以下の実装では、指定したポータルサイトの見出しと関連リンクを段階的に取得する処理を定義します。まず、BaseCrawlerを継承した派生クラスを作成し、識別子と起点URLを登録します。 class PortalScraper(BaseCrawler): identifi ...

6月4日 20:20 投稿