シェルスクリプトでNameNodeとDataNodeを一括起動・停止する

この記事では、シェルスクリプトを使用してHadoopのNameNodeとDataNodeを一括で起動および停止する方法を紹介します。シンプル版と、より高度な機能を備えた拡張版の2種類を提供します。拡張版は、より多くの状態チェックと情報表示を追加しています。スクリプトを再利用する場合は、以下の点に注意してください。 1. HADOOP_HOME変数を自身のHadoopインストールパスに変 ...

8月8日 20:12 投稿

HDFSをJava APIで操作する

1. 環境の準備 Hadoopのインストールパッケージ内のshareディレクトリには、Hadoopに関連するすべてのコンテンツが含まれています。インストールパッケージのshareフォルダに入ると、docとhadoopの2つのフォルダが見つかります。docにはHadoopの全ドキュメントが、hadoopフォルダにはHadoop開発に必要なすべてのJARファイルと、それらの依存関係が対応するlibフォルダに配 ...

8月2日 22:50 投稿

Apache Kylinによる大規模データ分析の実装と最適化戦略

Apache KylinのアーキテクチャとSQLクエリ Apache Kylinは、HadoopおよびSparkエコシステム上で動作するオープンソースの分散型分析データウェアハウスです。元々eBayによって開発されたこのプラットフォームは、標準的なSQLインターフェースと多次元分析(OLAP)機能を提供し、テラバイト級の大規模データに対して亜秒级别の応答速度を実現します。その核心は、事前に計算 ...

7月30日 21:54 投稿

Hadoop 単一ノード環境の構築手順(Ubuntu 22.04)

Ubuntu 22.04 環境の初期設定 まず、Ubuntu 22.04 をインストールし、root ユーザーで作業を開始します。 export LANG=C.UTF-8 echo "root:111111" | chpasswd -m apt update apt install -y openssh-server iproute2 ufw ssh-keygen -t rsa -f /root/.ssh/id_rsa -N '' sed -i 's/#PasswordAuthentication yes/PasswordAuthentication yes/' /etc/ssh/sshd_config sed -i ...

7月16日 23:38 投稿

CentOS 7におけるHadoopクラスターおよびHive環境の構築手順

前提環境の構築サーバーの基本設定Hadoopクラスターは3台構成で構築する。各ノードのホスト名は以下のように定義する。node-master (マスターノード)node-worker1 (ワーカーノード1)node-worker2 (ワーカーノード2)まず、マスターノードとなるサーバー側で基本設定を行う。1. ホスト名の変更以下のコマンドを実行し、ホスト名を変更する。vim /etc/hostname # 内容を node- ...

7月15日 17:40 投稿

Hadoop MapReduceにおけるカスタム出力フォーマットの実装方法

カスタム出力フォーマットの基本概念 HadoopのOutputFormatは、MapReduceジョブの出力データの形式と書き込み方法を制御します。デフォルトではTextOutputFormatが使用され、キーと値のペアをテキストファイルに書き込みますが、特定の要件に対応するにはカスタム出力フォーマットの実装が必要になります。 実装手順 FileOutputFormatを継承したクラスを作成 getRec ...

7月12日 17:00 投稿

IntelliJ IDEAでSparkクラスタに接続する方法

まずScalaプラグインをインストールします。File → Settings → PluginsでScalaプラグインを検索し、Installをクリックしてインストールします。 File → New Project → Mavenを選択し、新しいMavenプロジェクトを作成します。GroupIdとArtifactIdを入力します。 pom.xmlファイルを編集し、プロジェクトに必要な依存関係を追加します: <properties> ...

7月7日 20:25 投稿

HDFSの基本操作とJava APIによるファイル管理

第1課:HDFSコマンドライン操作 右側のコマンドラインでHadoopを起動し、以下の操作を行ってください。 HDFS上に/usr/output/ディレクトリを作成する; ローカルにhello.txtファイルを作成し、「HDFSのブロックはディスクのブロックより大きい。これはシークオーバーヘッドを最小限に抑えるためである。」と記述する; hello.txtをHDFSの/usr/output/ディレクトリへアップ ...

7月1日 23:54 投稿

MySQLとHiveのインストールと設定

MySQLのインストール MySQLをインストールする前に、MariaDBとの競合を避けるため、既にインストールされているMariaDBをアンインストールする必要があります。 // MariaDBがインストールされているか確認 rpm -qa | grep mariadb // MariaDBを強制的にアンインストール rpm -e --nodeps mariadb-libs 次に、MySQLのRPMパッケージをインストールします。まず、配布ファイ ...

7月1日 00:19 投稿

Hive 実行環境における NoSuchMethodError とクラスパス設定の解消法

Hive 2.3 および Hadoop 2.7 構成環境において、コマンド実行時に予期せぬ例外が発生する事象について解説します。特に Sqoop を経由して Hive へのデータ取り込みを試みた際、Facebook Thrift サービス関連のメソッドが見つからないというエラーが観測されました。 エラー現象の確認 Hive CLI または Sqoop ジョブ実行時に、コンソール出力に以下のスタックトレースが記 ...

6月28日 16:36 投稿