タグ

関連タグで絞り込む (1)

タグの絞り込みを解除

pdfに関するtakkan_mのブックマーク (2)

  • PDFやオフィス文書からテキストを抜き出すツールをテスト公開 - ChupaText 0.5.0 - 2010-11-08 - ククログ

    全文検索エンジンgroongaを囲む夕べ #1 : ATNDの定員が50人から120人に増えましたね。たぶん、何人かはキャンセルするはずなので、今のうちに登録しておくとおそらく参加できるでしょう。興味のある方はお早めに登録してください。 さて、以前、サーバ上でPDFやオフィス文書からテキストを抜き出す方法を紹介しました。これらを使うことにより様々なフォーマットの文書からテキストを抽出し、groongaなどの全文検索エンジンを利用して高速に目的の文書を見つけることができます。例えば、ファイルサーバやデスクトップ上にある文書を検索する用途にも有用です。 しかし、文書のフォーマット毎に抽出方法を変えなければいけないため、実際にテキストを抽出する部分(インデクサーの機能の一部)を作る場合に不便です。文書のフォーマットに依らず、同じ方法でテキストを抽出できると便利ですよね。 ということで、文書のフォ

    PDFやオフィス文書からテキストを抜き出すツールをテスト公開 - ChupaText 0.5.0 - 2010-11-08 - ククログ
    takkan_m
    takkan_m 2010/11/09
  • ブラウザだけでPDFからテキストを抽出してくれる『PDFTextOnline』 | 100SHIKI

    ちょっと知っておくと便利かもしれないツールのご紹介。 PDFTextOnlineはブラウザ上でPDFファイルからテキストを抽出してくれるツールだ。 Acrobat Readerが手元にないときや、PDFは重いからテキストにしたいなぁ、というときに便利かもしれない(使いどころが難しいが)。 英語版のサービスではあるが、日語のテキストもちゃんと抽出してくれる。またブックマークが文書中に含まれていたら、その情報まで抜き出してくれる。 なんにせよ、ブラウザだけで、という手軽さが良い。ブラウザさえあればあとはなんとかなる、という時代に近づいているようですな。

    ブラウザだけでPDFからテキストを抽出してくれる『PDFTextOnline』 | 100SHIKI
  • 1