Python製CLIツールによる気象・グルメデータ収集のスクレイピング実装
データ収集の前提と対象ドメインの選定
ウェブ上の公開情報を自動収集する際、最初の工程は抽出が容易な対象URLの特定です。単純なHTTPリクエストを送信し、レスポンスとして返されるHTML構造がブラウザでのレンダリング結果と一致しているか確認することで、初期段階のアクセス制限やクライアントサイドレンダリングの有無を判定できます。学習目的では、複雑な認証フロー ...
5月21日 04:29 投稿
書籍データの構造化抽出:HTMLからExcelへの変換実践
電子書籍からデータを抽出し、構造化してデータベースに格納するまでのプロセスについて解説します。全体的な流れはEPUB形式の書籍をHTMLに変換し、Excelファイルを経由してデータベースに保存するというものです。
抽出プロセスの全体像
EPUB形式の書籍をHTMLファイルに変換する
HTMLの構造と特徴的なタグや記号(見出しタグ、括弧類など)を分析する
Pythonでパース ...
5月20日 00:38 投稿