SparkとHugging Faceを統合したNLP分散処理手法

自然言語処理(NLP)におけるHugging Faceと分散処理基盤Sparkの統合手法について解説する。Spark 3.4以降の新機能活用と、Spark 3.3.1向けカスタム実装の2種類のアプローチを紹介する。 Spark 3.4以降でのネイティブ統合 Sparkのバージョン3.4以上では組み込みの機械学習サポートが強化されており、分散環境でのモデル推論が容易に実装できる。 実装の要点 ワーカー単 ...

8月7日 08:03 投稿

HuggingFace TransformersのBertEmbeddingsクラスの内部構造解説

BertEmbeddingsクラスはBERTモデルの中心的なコンポーネントです。このクラスは単語埋め込み、位置埋め込み、セグメント埋め込みを統合し、各入力トークンに対して最終的な埋め込み表現を生成します。これにより、後続のエンコーダ層への入力が提供されます。 BertEmbeddingsクラスの処理フロー ソースコード位置:transformers/src/transformers/models/bert/modeling_ber ...

8月3日 20:48 投稿

ONNX形式のRobertaおよびMacBERTを用いた文脈マスク推論と中国語誤字訂正

RobertaモデルのONNX変換と文脈マスク予測 モデルのONNX形式への変換 モデルはHugging Faceから入手可能です。 def setup_nlp_components(): tokenizer = BertTokenizer.from_pretrained("../model/chinese_roberta_L-2_H-512") model = BertForMaskedLM.from_pretrained("../model/chinese_roberta_L-2_H-512") return model, tokenizer def save_as_onnx ...

7月5日 17:37 投稿

StepFun/GOT-OCR-2.0-hfのセットアップと環境構築

StepFunが開発したGOT-OCR-2.0-hfは、多言語対応の高性能OCRモデルであり、日常的な文書から複雑な図表や数式、楽譜に至るまで幅広いコンテンツを高精度で認識可能です。1024×1024ピクセルの高解像度入力に対応し、複数ページの一括処理や動的領域分割、色・座標指定による選択的認識など柔軟な機能を備えています。Apache 2.0ライセンスで公開されており、Hugging Face経 ...

5月31日 08:15 投稿

XTunerを用いた大規模言語モデルのパーソナライズドアシスタント化ガイド

XTunerによるファインチューニングワークフロー オープンソース大規模言語モデル(LLM)を特定の役割や自己認識を持つアシスタントに進化させるためには、パラメータ効率的なファインチューニング手法が不可欠です。本記事では、上海AI研究所が開発したXTunerフレームワークとQLoRAアルゴリズムを組み合わせて、1.8Bパラメータ級の言語モデルをパーソナルアシスタントとし ...

5月19日 15:52 投稿