gensim を用いたTF-IDFとTextRankによるキーワード抽出手法

本稿では、単語の出現頻度と文書間の希少性に基づくTF-IDFと、グラフベースのアルゴリズムであるTextRankを用いたキーワード抽出の実装方法を解説する。これらの手法は文脈を考慮しないが、シンプルで効率的な抽出が可能である。より高度な意味解析が必要な場合は、LDAやLSIなどのトピックモデルを検討されたい。 TF-IDFによるキーワード抽出 TF-IDF(Term Frequency-Inv ...

7月15日 22:58 投稿

LDAを用いたトピックベースのキーワード抽出手法

LDA(潜在的ディリクレ配分法)は、文書集合から潜在的なトピック構造を抽出するための確率的生成モデルであり、直接的な意味解析ではなく、統計的手法によって文書内の重要な語彙を特定します。この手法は、文書が複数のトピックの混合で構成され、各トピックが単語の確率分布を持つという仮定に基づいています。 トピック数の選定 LDAでは、事前にトピック数Kを設定する ...

6月8日 19:39 投稿