数字出現回数の統計

ある科学研究の調査で得られた自然数がn個あり、それぞれの数は1500000000(1.5×10⁹)以下である。異なる数の個数は10000個以下である。与えられた自然数それぞれの出現回数をカウントし、自然数の昇順に結果を出力する。 入力形式最初の行には整数nが与えられる。続くn行には自然数が一つずつ書かれている。 出力形式異なる数の個数m行が出力される。各行には自然数とその ...

8月8日 06:20 投稿

Pandasを用いたTXTファイルデータ読み込みの実践的処理方法

はじめに 読み込むテキストファイルでは、先頭数行がデータの説明文となっており、データの区切りにはスペースが使用されています。このような形式のファイルをpandasで読み込む際の具体的な操作方法について解説します。 ファイル読み込みと区切り設定 データを正確に分割し、列名を設定するためのパラメータ設定方法です。 先頭の説明行をスキップ: skiprows=6 スペース ...

8月4日 06:57 投稿

lodashライブラリ徹底解説

目次 1、概要 2、文字列操作 3、算術と数値処理 4、配列操作 5、オブジェクト操作 6、関数操作 7、汎用ユーティリティ 1、概要 インストール // ESモジュール対応でtree-shaking可能 npm install --save lodash-es // ソースコードの閲覧 // カリー化 // lodash不要プロジェクト: https://github.com/you-dont-need/You-Dont-Need-Lodash-Underscore // 配列の高階関数 ...

8月1日 22:01 投稿

HiveでのJSON配列解析方法

この記事では、HiveでJSON配列を解析する方法について詳しく解説します。アプリケーションのページ埋め込みデータなど、複数のフィールドがJSON配列として保存されるケースはよくあります。データプラットフォームでこれらの埋め込みデータを解析する必要がある場合、HiveのJSON解析機能を理解しておくことが重要です。 Hiveの組み込みJSON解析関数 1. get_json_object 構 ...

7月29日 04:38 投稿

Pythonでのファイル操作

Pythonは、ファイルの読み書きや管理を容易に行うための強力な機能を提供します。この記事では、ファイルへの書き込みと追加について詳しく説明します。 ファイルへの書き込み open関数を使用して「w」モードでファイルに書き込むことができます。主なメソッドは以下の通りです: write():内容を書き込む flush():内容をディスクに即時反映する 注意点: 「w」モード ...

7月21日 00:03 投稿

Pandas 2.0の主な特徴とコード実装例

2023年4月、pandas 2.0.0がリリースされ、データサイエンスコミュニティに大きな注目を集めました。このバージョンは、データ操作の柔軟性と性能向上を目的とした多くの改良を含んでいます。 以下に、pandas 2.0の主な特徴と具体的なコード例を紹介します。 性能向上とメモリ効率の改善 pandasはnumpyに基づいて構築されており、大規模データセットの処理においてメモリ制 ...

7月15日 16:26 投稿

プロフェッショナル向けアルゴリズムトレーディングプラットフォーム構築の完全ガイド

高度なアルゴリズムトレーディングシステムをゼロから構築する 市場データのリアルタイム処理、複雑なリスク管理、実行環境の最適化など、金融アルゴリズム開発における主要課題に直面したことはありませんか? Leanエンジンによるソリューション 戦略開発と実行環境の統合 多言語サポート(C#・Python) モジュール型アーキテクチャ コアコンポーネントア ...

7月12日 22:09 投稿

LaravelのExcelデータ処理を簡単にするFastExcelの完全ガイド

LaravelのExcelデータ処理を簡単にするFastExcelの完全ガイド LaravelプロジェクトでのExcelデータ処理に悩ましい思いをしたことはありませんか?データのインポートやエクスポートを何度も手動で処理する必要がある場合、FastExcelという優れたツールが役立ちます。FastExcelは、Laravel向けのExcel処理ライブラリであり、Spoutライブラリを基盤としています。このライ ...

7月2日 17:56 投稿

大規模IT企業における5年目エンジニアの技術面接体験談

大規模検索ログ解析におけるTopN問題の解法 大容量ファイルから頻出検索語を抽出する手法について考察する。メモリ制約下での効率的な処理が鍵となる。 分散処理による解決策 from collections import defaultdict import heapq def process_chunk(file_path, chunk_size=1024): counter = defaultdict(int) with open(file_path) as f: while True: ...

6月18日 19:15 投稿

Python学習の実践的な活用法

実務で活かすPython学習のススメ 学習契機と環境構築 業務でのデータ処理を効率化する手段としてPythonに注目しました。特定のリモートストレージに保存された200件のデータ検証を手作業で行う代わりに、自動化ツールとしてPythonを選択しました。開発環境はHomebrewでPython3をインストール後、PyCharmを使用してコーディング環境を構築。以下の初期設定確認コードを実行 ...

6月13日 23:56 投稿