Microsoft Office Wordファイルの検索クローラをPythonで作成する際、表題の通り、*.docからテキストデータに変換する必要がある。本記事ではwin32comライブラリを用いてPythonスクリプトからWordファイルのテキストデータを抽出するスクリプトを紹介する。 (尚、世には多数のOfficeファイルコンバーターが有るので、このソースを使うことが最適とは限らない) ソースコード エラーハンドリングは必要最低限である為、扱うファイル特性に応じて追加が必要な場合もある。 # coding: Shift_JIS import win32com.client def word2text(file_path): text = "" doc = win32com.client.gencache.EnsureDispatch("Word.Application") doc.Vi
![Python: Microsoft Wordファイル(*.doc)のテキストデータ抽出 – pywin32, win32com](https://cdn-ak-scissors.b.st-hatena.com/image/square/252c967a24c40bf8f7a03dee6705872ef2f3bb44/height=288;version=1;width=512/https%3A%2F%2Fyukun.info%2Fwp-content%2Fuploads%2F2013%2F08%2Fpython_unix_char_code.png)