Spark SQL高度活用ガイド:内部構造から最適化まで
単語カウントの実装例
Spark Core APIを使用した単語頻度カウントの実装方法を示します。
// SparkContextはSparkアプリケーションのエントリーポイント
val sourceData = sc.textFile("hdfs://data/sample.txt") // HDFSからテキストファイルを読み込み
val tokenized = sourceData.flatMap(sentence => sentence.split("\\s+")) // 各行を単語に分割
val paired = tok ...
8月4日 00:35 投稿
MySQLにおける大規模データ処理の最適化手法:1000万件レコードの高速集計実践
MySQLで1000万件を超えるデータを扱う場合、適切な設計が欠かせません。本稿では、既存スキーマの制約下でクエリ性能を劇的に改善する手法を解説します。
テスト環境構築
以下のスキーマで1500万件のトランザクションデータを生成します。
CREATE TABLE `transactions` (
`transaction_id` INT NOT NULL AUTO_INCREMENT,
`customer_id` INT DEFAULT NULL,
`transact ...
6月18日 20:36 投稿