PythonによるWebスクレイピング:動画収集のシングルスレッドとマルチスレッド実装

スクレイピング対象の分析と実装方針 Webサイトから動画コンテンツを収集するPythonスクリプトを実装します。対象サイトの構造変化に対応するため、リクエスト例外処理を強化しています。 シングルスレッド版実装 # coding: utf-8 import re import requests import hashlib import time import os REQUEST_HEADERS = { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0 ...

5月18日 05:50 投稿

Pythonのrequestsライブラリを使って糗事百科の投稿を取得する

Pythonの標準ライブラリであるurllib2は多くの機能を提供しているが、APIの使い勝手が悪く感じられる場合がある。一方でRequestsライブラリは「HTTP for Humans」という名称を持ち、より簡潔で便利な使い方を提供する。Requestsはurllib2のすべての機能を継承しており、HTTP接続の維持やプーリング、Cookieによるセッション管理、ファイルアップロード、レスポンスの文字エ ...

5月16日 16:05 投稿

Pythonによるスクレイピング:Seleniumを使用したWebデータの収集

Pythonによるスクレイピング:Seleniumを使用したWebデータの収集 1.1 使用するライブラリ from selenium import webdriver from selenium.webdriver.common.by import By from selenium.webdriver.support.select import Select 1.2 処理の流れ # 1. ブラウザを起動する browser_driver = webdriver.Chrome() # この方法ではブラウザのGUIが表示されます # option = webd ...

5月13日 07:20 投稿