著者
横山 正太朗 江口 浩二 大川 剛直
出版者
The Institute of Electronics, Information and Communication Engineers
雑誌
電子情報通信学会論文誌 D (ISSN:18804535)
巻号頁・発行日
vol.J93-D, no.3, pp.180-188, 2010-03-01

近年ブログの利用が爆発的に増加しており,重要な情報源の一つになりつつある.ブログは,ハイパリンクを利用することで,参考にした情報を明示的に参照することが可能であり,このネットワークを対象にした研究が最近注目されつつある.しかし,こういった研究のほとんどが,リンク情報のみを対象にしており,本文の情報を参照していない.そこで本研究では,リンク構造だけでなく,本文のトピックを推定し,適切に情報伝搬をとらえる手段を確立することを目的とする.文書集合の潜在的なトピックを統計的に推定するのに用いられる確率的トピックモデルの代表的なものに,潜在的ディリクレ配分法(Latent Dirichlet Allocation:LDA)が挙げられ,広く用いられている.本研究では,このLDAを用いてポストのトピックを推定し,リンク間のトピック分布を比較することで,情報伝搬の単位(カスケード)を的確に抽出する枠組みを提案する.日本語ブログデータを用いた実験において,提案手法の有効性を示す.