タグ

関連タグで絞り込む (0)

  • 関連タグはありません

タグの絞り込みを解除

vectorとciniiに関するblueleのブックマーク (1)

  • 高次元ベクトル空間モデルによるテキスト分類問題について : 分類性能と距離構造の漸近解析(理論・技術) | CiNii Research

    近年,インターネットの普及により膨大なテキストデータからの知識発見を扱うテキストマイニングの技法が注目されている.研究では,テキストマイニングが取り扱う問題の中でも,特に文書分類の問題を取り上げ,形態素解析後の単語の出現分布としてある確率モデルのクラスを仮定し,文書分類の性能,並びに分類に用いられる距離について漸近的な分析を行う.一般に,文書分類に不必要な単語の混入を完全に排除することは難しく,様々な重要単語の重み付け法などが提案されている.論文で扱う最初の問題は,このような分類に不必要な単語が混入することが,文書分類に与える性能劣化の程度を把握することである.さらには,単語の出現頻度に基づく文書分類においては,個々の単語の生起頻度は少なく,多くの単語の頻度がゼロとなってしまうというスパースネスの問題がある.すなわち,このベクトル空間上で一つの文書を表す点は,ゼロを多くの要素に持つベク

  • 1