requestsで画像認証コードを自動認識する実装例

Webサイトへの自動ログインやスクレイピングを行う際、ログインフォームに画像認証コード(CAPTCHA)が要求されるケースが多いです。社内システムのテストであれば、開発チームに検証用の固定コードを発行してもらうことも可能ですが、外部サイトでは自前で画像を認識する必要があります。 そのような場面で有効なのが、画像認識をクラウドで提供するサービスを利用する方 ...

8月11日 22:51 投稿

Java を活用した知的テキスト自動処理アーキテクチャ

概要 本システムは、テキストデータの品質向上および構造化を目的とした自動処理ツールキットです。主な機能として、自然言語処理による誤り訂正、画像からの文字抽出(OCR)、そして表構造の解析が含まれます。CPU 環境での効率的な動作を重視し、各種モデルの最適化が行われています。 テキスト誤り訂正機能 文章の精度を高めるため、複数のアプローチを組み合わせてい ...

7月31日 20:14 投稿

OpenCVとTesseractを用いたC++による画像文字認識(OCR)の実装

C++環境において、画像処理ライブラリであるOpenCVと、オープンソースのOCRエンジンであるTesseractを組み合わせて、画像内の文字を抽出する方法を解説します。OpenCVで画像の前処理(ノイズ除去や二値化)を行い、その結果をTesseractに渡すことで、認識精度を向上させることができます。 1. 開発環境の構築 Windows環境では、パッケージマネージャーのvcpkgを使用すると ...

7月24日 23:14 投稿

PythonでPDFをWord文書に変換する実践ガイド

PDFからWordへの変換は、業務効率化のための代表的な自動化タスクです。しかし、PDFの種類によって最適なアプローチが異なります。本稿では、「テキスト埋込型PDF」と「スキャン画像型PDF」の2種類に対応したPython実装を、技術的背景と実装の意図を含めて解説します。 PDFの二つの性質 PDFは見た目が同じでも内部構造が大きく異なります。 テキスト埋込型PDF:Wordや ...

7月10日 19:47 投稿

PHPによる画像からのコンテンツ抽出とPDFテキストの抽出処理

2018年7月7日 18:52:17 画像からテキストを抽出する場合、PHPで独自アルゴリズムを実装することも可能だが、その場合の最適化は煩雑であり、ライブラリの選定や精度調整が必要になる。 一般的なプロジェクトにおいて、OCRサービスを構築しない限り、専用ツールやAPIを構築する必要はない。 一、 ツールについて:tesseract-ocr/tesseractは現在検証中だが、完全なセットア ...

7月9日 00:38 投稿

Eコマース画像審査の自動化:Aliの中国語認識モデルを統合した実践例

Eコマース画像審査の自動化:Aliの中国語認識モデルを統合した実践例 Eコマースプラットフォームの運用において、商品画像のコンプライアンス審査は頻度が高く、コストのかかる作業です。従来の人的審査は効率が悪く、疲労や主観的な判断により漏れや誤判定が発生するリスクがあります。AIビジョン技術の進化により、**画像内容の自動認識と審査**がプラットフォームの ...

6月25日 16:46 投稿

アフィン変換におけるせん断変換の研究と応用

アフィン変換は、平行移動、反転、回転、スケーリング、せん断変換の5つの変換の組み合わせです。 せん断変換は上記の5つ目の変換です。 画像のせん断は、投影面上での平面物体の非直角投影を表します。せん断により、画像内の図形が歪みます。一般的には、水平方向のせん断と垂直方向のせん断の2種類があります。(下図参照) 具体的な数学的説明については、以下のブログ ...

6月9日 22:31 投稿

StepFun/GOT-OCR-2.0-hfのセットアップと環境構築

StepFunが開発したGOT-OCR-2.0-hfは、多言語対応の高性能OCRモデルであり、日常的な文書から複雑な図表や数式、楽譜に至るまで幅広いコンテンツを高精度で認識可能です。1024×1024ピクセルの高解像度入力に対応し、複数ページの一括処理や動的領域分割、色・座標指定による選択的認識など柔軟な機能を備えています。Apache 2.0ライセンスで公開されており、Hugging Face経 ...

5月31日 08:15 投稿

TextInとSpring Bootを連携させた画像認識の実装

概要 画像認識とは 画像認識は、コンピュータビジョンと機械学習技術を活用して画像内の情報を解釈・識別するプロセスです。この技術により、画像から文字、物体、シーンなどの情報を抽出し、編集可能かつ検索可能なデータに変換できます。画像認識は、監視システム、ソーシャルメディアの分析、医療画像処理、自動運転車の視覚システムなど幅広い分野で応用されています ...

5月24日 20:47 投稿

DeepSeek OCR APIの完全ガイド:画像とPDFの文字認識を実装する技術ドキュメント

DeepSeek OCR APIの概要と導入 DeepSeek OCRは画像とPDFの文字認識を高精度で実行できるAPIを提供します。画像処理、複雑な表組み認識、PDFの多ページ処理など、さまざまなシナリオに対応する機能を備えています。HTTPリクエストで簡単に統合可能であり、開発者は画像やPDFから構造化されたテキストを抽出できます。 APIエンドポイント一覧 POST /ocr/image:画像の文字 ...

5月22日 23:14 投稿