PythonによるWebスクレイピング:動画収集のシングルスレッドとマルチスレッド実装
スクレイピング対象の分析と実装方針
Webサイトから動画コンテンツを収集するPythonスクリプトを実装します。対象サイトの構造変化に対応するため、リクエスト例外処理を強化しています。
シングルスレッド版実装
# coding: utf-8
import re
import requests
import hashlib
import time
import os
REQUEST_HEADERS = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0 ...
5月18日 05:50 投稿
Pythonのrequestsライブラリを使って糗事百科の投稿を取得する
Pythonの標準ライブラリであるurllib2は多くの機能を提供しているが、APIの使い勝手が悪く感じられる場合がある。一方でRequestsライブラリは「HTTP for Humans」という名称を持ち、より簡潔で便利な使い方を提供する。Requestsはurllib2のすべての機能を継承しており、HTTP接続の維持やプーリング、Cookieによるセッション管理、ファイルアップロード、レスポンスの文字エ ...
5月16日 16:05 投稿
Pythonによるスクレイピング:Seleniumを使用したWebデータの収集
Pythonによるスクレイピング:Seleniumを使用したWebデータの収集
1.1 使用するライブラリ
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.select import Select
1.2 処理の流れ
# 1. ブラウザを起動する
browser_driver = webdriver.Chrome()
# この方法ではブラウザのGUIが表示されます
# option = webd ...
5月13日 07:20 投稿