requestsで画像認証コードを自動認識する実装例

Webサイトへの自動ログインやスクレイピングを行う際、ログインフォームに画像認証コード(CAPTCHA)が要求されるケースが多いです。社内システムのテストであれば、開発チームに検証用の固定コードを発行してもらうことも可能ですが、外部サイトでは自前で画像を認識する必要があります。 そのような場面で有効なのが、画像認識をクラウドで提供するサービスを利用する方 ...

8月11日 22:51 投稿

Python における HTML/XML 解析ライブラリ「Beautiful Soup 4」徹底解説

Beautiful Soup 4 とは Beautiful Soup は、Python 開発者が HTML や XML データから情報を抽出するために使用する強力なライブラリです。このツールは、文書木構造の作成、検索、修正を直感的な方法で行うことを可能にし、手動でのスクレイピングに費やす時間を大幅に削減します。 本ガイドでは、バージョン 4.12.0 を対象に、主要機能と使用法を解説します。また、例示 ...

7月28日 22:07 投稿

Beautiful Soupを使ったウェブスクレイピングの基本

Beautiful Soupの概要 Beautiful SoupはPythonのライブラリで、HTMLやXMLドキュメントを解析し、データを抽出するために使用されます。複雑なHTML構造を簡単に操作できる強力なツールです。 基本的な使用方法 # 必要なライブラリのインポート from bs4 import BeautifulSoup # サンプルHTMLドキュメント html_content = """ <html> <head><title>テス ...

7月23日 17:59 投稿

PythonのlxmlライブラリにおけるXPathの実践的使い方

1. ワイルドカードの応用 記号 用途 * 任意の要素名を同階層でマッチ @* 任意の属性を同階層でマッチ node() ノードタイプに関係なく同階層でマッチ */ 複数階層の任意要素をマッチ // 任意階層の要素を圧縮的にマッチ ...

6月7日 22:07 投稿