HDFSをJava APIで操作する
1. 環境の準備
Hadoopのインストールパッケージ内のshareディレクトリには、Hadoopに関連するすべてのコンテンツが含まれています。インストールパッケージのshareフォルダに入ると、docとhadoopの2つのフォルダが見つかります。docにはHadoopの全ドキュメントが、hadoopフォルダにはHadoop開発に必要なすべてのJARファイルと、それらの依存関係が対応するlibフォルダに配 ...
8月2日 22:50 投稿
HDFS での一般的な Java API 操作
0 - Hadoop 環境の設定 (Windowsシステム)
以下の手順は Windows システムに適用されます。
Windows システムで Hadoop 関連のコードを直接実行すると、`winutils.exe` と `hadoop.dll` ファイルが不足しているというエラーが表示されることがあります。
java.io.IOException: Could not locate executable null\bin\winutils.exe in the Hadoop binaries.
WARN util.Nat ...
7月28日 00:23 投稿
DolphinScheduler 2.x 単一ノード疑似クラスタ構築手順
動作要件
OS バージョン
ディストリビューション推奨バージョン
Red Hat Enterprise Linux7.x 以降
CentOS7.x 以降
Oracle Linux7.x 以降
Ubuntu LTS16.04 以降
ハードウェア仕様
CPUメモリディスクネットワークノード数
4 コア以上8 GB 以上SAS1 Gbps NIC1 台以上
デプロイ方式の選択
DolphinScheduler は以下の 3 パターンに対応しています。
Standalone:す ...
7月20日 20:19 投稿
CentOS 7におけるHadoopクラスターおよびHive環境の構築手順
前提環境の構築サーバーの基本設定Hadoopクラスターは3台構成で構築する。各ノードのホスト名は以下のように定義する。node-master (マスターノード)node-worker1 (ワーカーノード1)node-worker2 (ワーカーノード2)まず、マスターノードとなるサーバー側で基本設定を行う。1. ホスト名の変更以下のコマンドを実行し、ホスト名を変更する。vim /etc/hostname
# 内容を node- ...
7月15日 17:40 投稿
HDFSの基本操作とJava APIによるファイル管理
第1課:HDFSコマンドライン操作
右側のコマンドラインでHadoopを起動し、以下の操作を行ってください。
HDFS上に/usr/output/ディレクトリを作成する;
ローカルにhello.txtファイルを作成し、「HDFSのブロックはディスクのブロックより大きい。これはシークオーバーヘッドを最小限に抑えるためである。」と記述する;
hello.txtをHDFSの/usr/output/ディレクトリへアップ ...
7月1日 23:54 投稿
HDFSの主要メカニズム:レプリケーション、ラック認識、負荷分散
HDFSのレプリケーションメカニズム
HDFSでは、ファイルは物理的にブロック単位で保存されます。ブロックサイズは`hdfs-site.xml`ファイル内の`dfs.block.size`パラメータで設定できます:
<!-- ブロックサイズ、単位:バイト -->
<property>
<name>dfs.block.size</name>
<value>134217728</value>
</property>
ブロッ ...
6月29日 20:25 投稿
Hadoopのディレクトリアイテム制限エラー:解決策と対策
問題の概要:
Hiveジョブを実行した際にスケジューリングシステムが失敗し、以下のようなエラーが発生しました:
java.io.IOException: java.net.ConnectException: Call From #HostName/#IP to #HostName:10020 failed on connection exception: java.net.ConnectException: 拒否された接続; 詳細は http://wiki.apache.org/hadoop/ConnectionRefused を参照してください
...
6月9日 21:13 投稿
Hadoop Archive(HAR)による小ファイルのアーカイブ管理
アーカイブコマンドの概要
Hadoop Archive(HAR)は、HDFS上での多数の小規模ファイルによって引き起こされるNameNodeのメタデータ負荷を軽減するための仕組みです。複数の小ファイルを1つの.harファイルにパッケージ化することで、名前空間のエントリ数を削減しつつ、実際のデータアクセスには影響を与えません。クライアント側からは通常のHDFSパスと同様に扱うことがで ...
5月23日 01:43 投稿
Hiveデータベース操作ガイド:テーブル管理からクエリ最適化まで
データベースメタ情報の管理
データベースにプロパティ情報を追加
create database analytics_db
with dbproperties('owner'='YamadaTaro','created_date'='20240101')
プロパティ情報の確認
describe database extended analytics_db
プロパティ情報の更新
alter database analytics_db
set dbproperties('owner'='SatoHanako')
詳細情報の表示
desc database extend ...
5月15日 01:18 投稿
Ubuntu22でのHadoop3.3.6環境構築手順
必要なソフトウェア
Ubuntu 22.04 64bit、Hadoop 3.3.6、Java 8
システムアップデート
sudo apt update
sudo apt upgrade -y
SSHサーバーのインストール
sudo apt install openssh-server -y
SSH接続確認
systemctl status ssh
pdshのインストール
sudo apt install pdsh -y
環境変数の設定
/etc/profileに以下を追加:
export PDSH_RCMD_TYPE=ssh
SSH鍵の設定
ssh-k ...
5月10日 12:30 投稿