タグ

関連タグで絞り込む (0)

  • 関連タグはありません

タグの絞り込みを解除

webとossに関するyasushiitoのブックマーク (1)

  • Webstemmer(クローラーツール)

    語サイトでは、具体的な性能は測定していませんが、 以下のようなサイトで正しく動くことがわかっています: アサヒ・コム Nikkei NET Mainichi INTERACTIVE Yomiuri On-line IT media 東京新聞 日刊スポーツ 信濃毎日新聞 livedoor ニュース 使いかた Webstemmer をつかったテキスト抽出は以下のようなステップになります: まず、特定のニュースサイトから種となる HTML ページを多数取得する。 取得したページのレイアウトを学習する。 別の日に、同一のニュースサイトから新しい HTML ページを取得する。 2. で学習した結果をつかって、新しい HTML ページから文を抽出する。 1. および 2. のステップが必要なのは最初の 1回だけです。 ひとたびサイトのレイアウトを学習してしまえば、 あとはレイアウトが大きく変更さ

    yasushiito
    yasushiito 2007/09/03
    へぇ~~。すごいね。||判別方法は想像するとこまではできても、いざ実装となると詰まるからなぁ。||句読点を含む一番長い行が本文ってのは、言われてみると目から鱗。
  • 1