Scrapyを使用して企業名录データをスクレイピングしMySQLに保存する方法
Scrapyフレームワークを使用して企業名录 웹사이트から企業情報を取得し、MySQLデータベースに保存する方法を説明します。 примерно 22万件のデータを処理する必要があります。
第一步:Itemクラス定義
まず、スクレイピング対象のフィールドをItemクラスで定義します。
import scrapy
class CompanyItem(scrapy.Item):
prefecture_name = scrapy.Field()
di ...
8月13日 05:59 投稿
Linux awkコマンド
参考資料
Linux awkコマンドの詳細
[初心者向け]Awkの基本的な使い方
awkコマンドの実践的な使用方法
阮一峰_awk 初心者ガイド
8つの強力なAwk組み込み変数
AWK組み込み関数
1. オプション設定
1.1 基本パラメータ
-F:フィールドセパレータの指定
awk -F',' '{ print $1 }' file はコンマ区切りで処理。
-f:スクリプトファイルの指定
awk -f handle.awk file は handl ...
7月26日 17:23 投稿
Pythonによるテキストファイル処理の実践例
Pythonを用いたテキストファイル(.txt)の操作に関する実用的なコード例を紹介します。以下のスクリプトは、日常業務や学習で頻出するテキスト処理タスクに対応しており、すべての入力ファイルはスクリプトと同じディレクトリに配置されていることを前提とします。
1. テキスト抽出処理
1.1 キーワードを含む行の抽出
センサーデータのフィルタリング
with open("senso ...
7月3日 20:11 投稿
MongoDB大規模データ抽出時のカーソルタイムアウトエラーと制御手法
エラー現象とスタックトレースの解読
ETLツールやカスタムスクリプトを用いてMongoDBから大規模データを取得する際、以下のような例外がスローされることがあります。
com.mongodb.MongoCursorNotFoundException: Query failed with error code -5
Caused by: com.mongodb.MongoCursorNotFoundException: Query failed with error code -5 and error message 'Cursor 40055 ...
6月13日 22:26 投稿
書籍データの構造化抽出:HTMLからExcelへの変換実践
電子書籍からデータを抽出し、構造化してデータベースに格納するまでのプロセスについて解説します。全体的な流れはEPUB形式の書籍をHTMLに変換し、Excelファイルを経由してデータベースに保存するというものです。
抽出プロセスの全体像
EPUB形式の書籍をHTMLファイルに変換する
HTMLの構造と特徴的なタグや記号(見出しタグ、括弧類など)を分析する
Pythonでパース ...
5月19日 15:38 投稿