著者
田中 裕隆 曹 鋭 白 静 馬 ブン 新納 浩幸
雑誌
研究報告自然言語処理(NL) (ISSN:21888779)
巻号頁・発行日
vol.2019-NL-243, no.8, pp.1-6, 2019-11-27

近年,BERT のような事前学習モデルを利用することで,自然言語処理システムの性能が大きく向上している.BERT は,Transformer の Multi-head Attention を用いることで文脈に応じた単語の埋め込み表現列を得ることのできるモデルである.文書分類のタスクの場合,文書を BERT に入力し,その出力から文書の特徴ベクトルを構築する方法によって処理できる.しかし,BERTに入力できるシーケンスの長さには上限がある.この制限によって,長い文書を扱う場合,標準的な手法では文書分類に必要な情報を十分に得られないと考えられる.そこで,BERT から長い文書内の全ての単語に対応する埋め込み表現を得て,そこから文書の特徴ベクトルを作成する手法を提案する.