Scrapyを使用して企業名录データをスクレイピングしMySQLに保存する方法
Scrapyフレームワークを使用して企業名录 웹사이트から企業情報を取得し、MySQLデータベースに保存する方法を説明します。 примерно 22万件のデータを処理する必要があります。
第一步:Itemクラス定義
まず、スクレイピング対象のフィールドをItemクラスで定義します。
import scrapy
class CompanyItem(scrapy.Item):
prefecture_name = scrapy.Field()
di ...
8月13日 05:59 投稿
Python における HTML/XML 解析ライブラリ「Beautiful Soup 4」徹底解説
Beautiful Soup 4 とは
Beautiful Soup は、Python 開発者が HTML や XML データから情報を抽出するために使用する強力なライブラリです。このツールは、文書木構造の作成、検索、修正を直感的な方法で行うことを可能にし、手動でのスクレイピングに費やす時間を大幅に削減します。
本ガイドでは、バージョン 4.12.0 を対象に、主要機能と使用法を解説します。また、例示 ...
7月28日 22:07 投稿
Requests ライブラリでの日本語テキスト表示と文字化け対策
テキストの取得と文字化けの原因
Python の requests ライブラリは、HTTP リクエストの実行とレスポンス処理を簡潔に記述できることから広く利用されています。しかし、日本語や中国語などの複数バイト文字を含むウェブページを取得する際、r.text で正しく表示されず、文字化けが発生するケースがよくあります。
requests は内部で以下のことを自動的に処理します:
r ...
7月27日 23:24 投稿
Beautiful Soupを使ったウェブスクレイピングの基本
Beautiful Soupの概要
Beautiful SoupはPythonのライブラリで、HTMLやXMLドキュメントを解析し、データを抽出するために使用されます。複雑なHTML構造を簡単に操作できる強力なツールです。
基本的な使用方法
# 必要なライブラリのインポート
from bs4 import BeautifulSoup
# サンプルHTMLドキュメント
html_content = """
<html>
<head><title>テス ...
7月23日 17:59 投稿
Python Web クローリング実装:urllib から Scrapy までの進化
HTTP リクエストライブラリの比較と選定
Python において Web クローリングや HTTP 通信を行う場合、標準ライブラリからサードパーティ製の強力なライブラリまで、複数の選択肢が存在します。主に urllib、urllib2、requests、そしてフレームワークである Scrapy が挙げられます。それぞれの特性を理解し、目的に応じて使い分けることが重要です。
urllib と urllib2 の違 ...
7月11日 22:28 投稿
業務効率化に役立つ17のPython自動化スクリプト集
1. ファイルシステムの自動整理
拡張子ベースのファイル分類
指定ディレクトリ内のファイルを拡張子ごとにサブフォルダへ振り分ける処理です。標準ライブラリのpathlibを活用し、ファイルパス操作を安全かつ簡潔に記述しています。
import shutil
from pathlib import Path
def organize_by_extension(target_dir: str) -> None:
base_path = Path(target_dir)
if ...
7月8日 17:25 投稿
PythonによるWebスクレイピング実践:4つの代表的なユースケース
1. Eコマースサイトの商品情報取得
例えば、中国の主要ECプラットフォーム「JD.com」の特定商品ページ(例:一加9Rスマートフォン)を対象に、HTTPリクエストによるHTMLコンテンツの取得を試みます。URLはhttps://item.jd.com/100020542894.htmlです。
まずrobots.txtを確認します:https://item.jd.com/robots.txt。実際の内容は次のような形式で、Googlebotなど特定のク ...
6月13日 22:30 投稿
Python Requests モジュールによる Web スクレイピング入門
Python Requests モジュールによる Web スクレイピング入門
Python において HTTP リクエストを送信するための標準的なライブラリとして、requests モジュールが広く利用されています。本記事では、requests の基本的な使い方から、実践的なデータ収集の手法、およびよくある問題の解決策について解説します。
環境構築とインストール
開発環境として Anaconda を利用す ...
6月7日 16:34 投稿
カスタムWebスクレイピングフレームワークにおけるクローラクラスの実装ガイド
ベースクラスの継承と初期設定
フレームワークが提供する基底機能を拡張し、実際のデータ抽出ロジックを構築する方法について解説します。以下の実装では、指定したポータルサイトの見出しと関連リンクを段階的に取得する処理を定義します。まず、BaseCrawlerを継承した派生クラスを作成し、識別子と起点URLを登録します。
class PortalScraper(BaseCrawler):
identifi ...
6月4日 20:20 投稿