HDFSをJava APIで操作する

1. 環境の準備 Hadoopのインストールパッケージ内のshareディレクトリには、Hadoopに関連するすべてのコンテンツが含まれています。インストールパッケージのshareフォルダに入ると、docとhadoopの2つのフォルダが見つかります。docにはHadoopの全ドキュメントが、hadoopフォルダにはHadoop開発に必要なすべてのJARファイルと、それらの依存関係が対応するlibフォルダに配 ...

8月2日 22:50 投稿

HDFS での一般的な Java API 操作

0 - Hadoop 環境の設定 (Windowsシステム) 以下の手順は Windows システムに適用されます。 Windows システムで Hadoop 関連のコードを直接実行すると、`winutils.exe` と `hadoop.dll` ファイルが不足しているというエラーが表示されることがあります。 java.io.IOException: Could not locate executable null\bin\winutils.exe in the Hadoop binaries. WARN util.Nat ...

7月28日 00:23 投稿

DolphinScheduler 2.x 単一ノード疑似クラスタ構築手順

動作要件 OS バージョン ディストリビューション推奨バージョン Red Hat Enterprise Linux7.x 以降 CentOS7.x 以降 Oracle Linux7.x 以降 Ubuntu LTS16.04 以降 ハードウェア仕様 CPUメモリディスクネットワークノード数 4 コア以上8 GB 以上SAS1 Gbps NIC1 台以上 デプロイ方式の選択 DolphinScheduler は以下の 3 パターンに対応しています。 Standalone:す ...

7月20日 20:19 投稿

CentOS 7におけるHadoopクラスターおよびHive環境の構築手順

前提環境の構築サーバーの基本設定Hadoopクラスターは3台構成で構築する。各ノードのホスト名は以下のように定義する。node-master (マスターノード)node-worker1 (ワーカーノード1)node-worker2 (ワーカーノード2)まず、マスターノードとなるサーバー側で基本設定を行う。1. ホスト名の変更以下のコマンドを実行し、ホスト名を変更する。vim /etc/hostname # 内容を node- ...

7月15日 17:40 投稿

HDFSの基本操作とJava APIによるファイル管理

第1課:HDFSコマンドライン操作 右側のコマンドラインでHadoopを起動し、以下の操作を行ってください。 HDFS上に/usr/output/ディレクトリを作成する; ローカルにhello.txtファイルを作成し、「HDFSのブロックはディスクのブロックより大きい。これはシークオーバーヘッドを最小限に抑えるためである。」と記述する; hello.txtをHDFSの/usr/output/ディレクトリへアップ ...

7月1日 23:54 投稿

HDFSの主要メカニズム:レプリケーション、ラック認識、負荷分散

HDFSのレプリケーションメカニズム HDFSでは、ファイルは物理的にブロック単位で保存されます。ブロックサイズは`hdfs-site.xml`ファイル内の`dfs.block.size`パラメータで設定できます: <!-- ブロックサイズ、単位:バイト --> <property> <name>dfs.block.size</name> <value>134217728</value> </property> ブロッ ...

6月29日 20:25 投稿

Hadoopのディレクトリアイテム制限エラー:解決策と対策

問題の概要: Hiveジョブを実行した際にスケジューリングシステムが失敗し、以下のようなエラーが発生しました: java.io.IOException: java.net.ConnectException: Call From #HostName/#IP to #HostName:10020 failed on connection exception: java.net.ConnectException: 拒否された接続; 詳細は http://wiki.apache.org/hadoop/ConnectionRefused を参照してください ...

6月9日 21:13 投稿

Hadoop Archive(HAR)による小ファイルのアーカイブ管理

アーカイブコマンドの概要 Hadoop Archive(HAR)は、HDFS上での多数の小規模ファイルによって引き起こされるNameNodeのメタデータ負荷を軽減するための仕組みです。複数の小ファイルを1つの.harファイルにパッケージ化することで、名前空間のエントリ数を削減しつつ、実際のデータアクセスには影響を与えません。クライアント側からは通常のHDFSパスと同様に扱うことがで ...

5月23日 01:43 投稿

Hiveデータベース操作ガイド:テーブル管理からクエリ最適化まで

データベースメタ情報の管理 データベースにプロパティ情報を追加 create database analytics_db with dbproperties('owner'='YamadaTaro','created_date'='20240101') プロパティ情報の確認 describe database extended analytics_db プロパティ情報の更新 alter database analytics_db set dbproperties('owner'='SatoHanako') 詳細情報の表示 desc database extend ...

5月15日 01:18 投稿

Ubuntu22でのHadoop3.3.6環境構築手順

必要なソフトウェア Ubuntu 22.04 64bit、Hadoop 3.3.6、Java 8 システムアップデート sudo apt update sudo apt upgrade -y SSHサーバーのインストール sudo apt install openssh-server -y SSH接続確認 systemctl status ssh pdshのインストール sudo apt install pdsh -y 環境変数の設定 /etc/profileに以下を追加: export PDSH_RCMD_TYPE=ssh SSH鍵の設定 ssh-k ...

5月10日 12:30 投稿