テキスト検索のベンチマークをしたいと思い立ちました。 テストデータにはWikipediaのデータを使おうと思います。 現在 日本語Wikipediaのページ数は約130万ページです。 Solrに入れるときには1ページ1ドキュメントになるので 130万ドキュメントのインデックスが作られることになります。 Webクローラをガシガシ動かすようなシステムなら こんなドキュメント数は何の参考にもならないですが 一般的な?社内システムみたいなものだとそれなりに参考になる数値だと思います。 テキスト検索の性能を上げるためにRDBのデータをSolrに移すなんてこともよくありますが この場合はRDBの1レコードが1ドキュメントになるイメージになります。 検索エンジンを使いたくなるほどの文章量が入ったテーブルのレコード数が 100万レコードを超えるのってそう多くはないでしょ? ちなみに、Wikipedia の

