OCRの人気記事 342件 - はてなブックマーク

1 - 40 件 / 342件

新着順人気順

絞り込み

検索対象
ブックマーク数
期間
セーフサーチ

OCRの検索結果1 - 40 件 / 342件

OCRに関するエントリは342件あります。 AI、ツール、画像などが関連タグです。人気エントリには『中日新聞:自動車工場のガロア体　ＱＲコードはどう動くか』などがあります。

中日新聞:自動車工場のガロア体　ＱＲコードはどう動くか
- 1998 users
- static.chunichi.co.jp
- 学び
- 2021/12/08
その誕生を地元新聞も経済新聞も記事にしなかった。２年後、『コードの情報を白黒の点の組み合わせに置き換える』と最下段のベタ記事で初めて紹介された時、その形を思い浮かべることができる読者はいなかった。いま、説明の必要すらない。ＱＲコードはなぜ開発され、どう動くのだろうか。ＱＲコードは、自動車生産ラインの切実な要請と非自動車部門の技術者の「世界標準の発明をしたい」という野心の微妙な混交の下、1990年代前半の日本電装（現デンソー）で開発された。トヨタグループの生産現場では、部品名と数量の記された物理的なカンバンが発注書、納品書として行き来することで在庫を管理する。そのデータ入力を自動化するバーコード（ＮＤコード）を開発したのがデンソーだ。バブル全盛の1990年ごろ、空前の生産台数、多様な車種・オプションに応えるため、部品も納入業者も急激に増え、ＮＤコードが限界を迎えていた。63桁の数字しか
- 技術
- あとで読む
- 数学
- 開発
- QRコード
- 読み物
- 歴史
- 画像
- これはすごい
- 科学
さようなら、全てのエヴァーノート - 本しゃぶり
- 1819 users
- honeshabri.hatenablog.com
- テクノロジー
- 2024/04/14
2011年6月10日、Evernoteを使用開始。 2014年9月19日、有料プランに加入。 2024年3月23日、クソみたいなメールが届く。プラン、廃止いつも Evernote をご利用いただき、ありがとうございます。このたびは今後の Evernote 登録プランに関する変更についてご案内させていただきます。お使いの Evernote アカウントは Plus から Personal に移行されました。Evernote Plus など、一般のお客様に数年間ご利用いただけなかった従来の登録プランが廃止となったためです。この変更により、Personal プランで利用可能な機能すべてをご利用いただけます。今後はAnnualの登録プランが現在の Evernote Personal プランの料金 129.99 USD/Yearに合うように更新されます。この料金は次の更新日である2024/4/
- obsidian
- evernote
- webサービス
- あとで読む
- Notion
- ツール
- AI
- サービス
- メモ
- 生活
日本語に特化したOCR、文書画像解析Pythonパッケージ「YomiToku」を公開しました｜Kotaro.Kinoshita
- 1443 users
- note.com/kotaro_kinoshita
- テクノロジー
- 2024/11/26
はじめに最近、LLMへのRAGを用いた文書データの連携等を目的に海外を中心にOCRや文書画像解析技術に関連する新しいサービスが活発にリリースされています。しかし、その多くは日本語をメインターゲットに開発されているわけではありません。日本語文書は、英数字に加えて、ひらがな、漢字、記号など数千種類の文字を識別する必要があったり、縦書きなど日本語ドキュメント特有のレイアウトに対処する必要があったりと日本語特有の難しさがあります。ですが、今後、海外の開発者がこれらの課題に対処するため、日本のドキュメント画像解析に特化したものをリリースする可能性は低く、やはり自国の言語向けのサービスは自国のエンジニアが開発すべきだと筆者は考えています。もちろん、Azure Document Intelligenceをはじめとした、クラウドサービスのドキュメント解析サービスはありますが、クラウドを利用できないユ
- OCR
- python
- あとで読む
- AI
- 日本語
- 開発
- ツール
- LLM
- 画像
- 仕事
GPUなしで動作する軽量なAI OCRツール「NDLOCR-Lite」、国会図書館のラボから無償公開／コマンドライン版に加えWindows/Mac/Linux対応のデスクトップ版を用意
- 999 users
- forest.watch.impress.co.jp
- テクノロジー
- 2026/02/24
- OCR
- あとで読む
- AI
- ツール
- 図書館
- フリーソフト
- tool
- 画像
- mac
- linux

グーグルレンズの「パソコンにコピー」が地味に便利だという話 - 世界のねじを巻くブログ
- 662 users
- www.nejimakiblog.com
- テクノロジー
- 2022/11/13
Google Lensでテキストをスキャンいきなりですが、グーグルクローム関連の小ネタを３つ紹介。 Google Lensでテキストをスキャン二窓検索機能タブ検索まず一つ目は、現実世界にある文字・テキストをスマホのGoogle Lensのアプリで読み取り文字起こしして、 PCのGoogle Chromeに飛ばすというライフハック。パソコンで作業してるときけっこう使えます。まずはグーグルレンズで文字を読み込み、場所・範囲を選択。そして上記画像の下部に「パソコンにコピー」ってあるのわかりますかね？？これをタップすれば、Google Chromeにコピーされ、あとは　PC上でCtrl+V コピペできるようになります。例として上記画像の、サンタナのアルバム『キャラバンサライ』ライナーノーツから。肉体は溶けて宇宙に変わる宇宙は溶けて静寂の音に変わる音は溶けてまばゆい
- chrome
- google
- あとで読む
- PC
- 便利
- お役立ち
- 検索
- パソコン
- ブログ
- OCR
スキャン書籍のPDFファイルを電子書籍並みにクリアで読みやすくするAI・高品質化・各種調整ツール「DN_SuperBook_PDF_Converter」
- 559 users
- gigazine.net
- テクノロジー
- 2026/01/21
書類や本を自分でスキャンしてPDFファイル化してPCやタブレットで読めるようにする時、画質が低かったり、スキャンの精度が低かったり、インクのにじみや裏写りがあったりして可読性が低下してしまうことがあります。自分で本を裁断してスキャンする「自炊」で用意したPDFファイルを読みやすくするためのツール「DN_SuperBook_PDF_Converter」を、研究者でプログラマーの登大遊氏がAGPL-3.0ライセンスの下で公開しました。 dnobori/DN_SuperBook_PDF_Converter: DN_SuperBook_PDF_Converter - スキャン書籍 PDF をデジタル書籍並みに大変クリアに読みやすくする AI PDF 高品質化・各種調整ツール https://github.com/dnobori/DN_SuperBook_PDF_Converter 登氏は「コンピュ
- pdf
- あとで読む
- AI
- ツール
- 自炊
- 本
- 電子書籍
- 書籍
- ソフトウェア
- 便利
国立国会図書館のOCRライブラリが凄くよかった件(Windows向け) - Qiita
- 540 users
- qiita.com/yanosen_jp
- テクノロジー
- 2025/03/26
はじめに日本語OCR, 有料の業務用ソフトには色々と高性能なものがあるんですが、無料の場合の選択肢は意外に限られてます。最近ではGeminiなどにOCRさせることも試みてますが、縦書きに弱いのが欠点。加えて、私がやっているような著作権が切れた戦前の本のデジタル化の場合、認識率の低い旧字体が多いのが悩みの種。そこで最近知ったのが、国立国会図書館が公開しているOCRライブラリ、NDLOCRです。国会図書館のデジタル資料（国立国会図書館デジタルコレクション)から全文テキストデータを作成するために開発されたとのこと。 NDLOCRは、現在ver2.1がGithubに公開されています。古い本が多い国会図書館の資料向けに作られているだけあって、旧字体でも高い精度で認識してくれます。今回は、このライブラリを試してみました。基本、Githubサイトに書いてある通りなんですが、いくつか注意すべき点をメモ
GPTが人知れず既存の名刺管理アプリを抹殺していた話 - Qiita
- 502 users
- qiita.com/watanabe-tsubasa
- テクノロジー
- 2024/02/27
名刺管理アプリ作ってほしいといわれたそれは2/22のお話。ことの発端は別の部署からかかってきた一本の電話でした。新規事業の部署でいろいろな取引先様と付き合いがあるものの、紙の名刺が非常に多く管理に困っているとのことのことです。私は小売業に勤務しているしがない一社員で、現在Eコマースの戦略立案に関する部署に所属しています。電話先の方は、以前一緒の部署で勤務したことがある方です。現在新規事業のプロジェクト推進をしており、冒頭のような課題感を持っているため既存の名刺管理アプリ導入を考えたのですが、あまりのお値段の高さに卒倒して私に藁をもすがる思いで連絡されたようです。これまでのアプリは名刺の識別専門のAI（）を使っていた話を聞いてみたところ、名刺の写真を撮る会社名、部署名、名前、…など項目別にスプレッドシートへ記載されるスプレッドシートに次の打ち合わせ日を記載しておくと通知さ
- ChatGPT
- あとで読む
- AI
- OCR
- python
- api
- アプリ
- GPT
- LINE
- プログラミング
pdfからtextを抜き出す試行錯誤のメモ｜Kan Hatakeyama
- 460 users
- note.com/kan_hatakeyama
- テクノロジー
- 2024/02/23
これは二段構えの構成を持っています。この二段構えを正確に検出し、テキストを理解することが望ましいです。 Unstructuredを使うPythonのライブラリであるUnstructuredを試してみましょう。参考記事導入は非常に簡単です。 pip install 'unstructured[pdf]' 実装も簡単です。解析コード： from unstructured.partition.pdf import partition_pdf pdf_elements = partition_pdf("pdf/7_71_5.pdf") 表示コード： for structure in pdf_elements: print(structure) 結果：残念ながら、2段組のカラムを正確に検出することはできませんでした。 Grobidを使うGrobidは、peS2oというオープンアクセス論文のコ
- PDF
- あとで読む
- python
- LLM
- テキスト
- AI
- ツール
- ドキュメント
- メモ
- 自然言語処理
【Python】Kindleの洋書1冊を1分で日本語PDFに変換するコードを書いた話 - Qiita
- 414 users
- qiita.com/1plus1is3
- テクノロジー
- 2022/11/14
Deleted articles cannot be recovered. Draft of this article would be also deleted. Are you sure you want to delete this article? 動機外資系のAmazonが展開している電子書籍Kindleでは比較的洋書の取り扱いが多いです。 Kindle Unlimitedに登録されている書籍も多く、Springerなんかも含まれているので活用しない手はありません。そこでkindle-translatorをつくりました。 https://github.com/1plus1is3/kindle-translator これで一冊50万字あるKindleの洋書を1分で日本語PDFに変換できます。キーボードの矢印キーでページ送りができるならKindleに限らずあらゆる電子書籍リーダ
- python
- あとで読む
- Kindle
- PDF
- 翻訳
- プログラミング
- 電子書籍
- OCR
- Qiita
- programming
書類を撮影→テキストを抽出して「メモ」に保存。iPhoneの「ショートカット」便利レシピ。Apple Intelligenceのアクションを活用しよう– iPhone AI Hack 第3回
- 409 users
- macfan.book.mynavi.jp
- テクノロジー
- 2026/04/14
iOS 26で登場した、「ショートカット」のApple Intelligenceのアクション病院の明細や荷物の送り状、買い物のレシートや領収書など、デジタル化が進んだ現代でも、まだ紙で受け取るものは少なくありません。きちんと保存している人もいる一方で、つい山積みにしてしまったり、受け取ってすぐ、あるいは一定期間が過ぎたあとに処分してしまったりする人も多いのではないでしょうか。しかし、そのようにしていると、ふと「あれ、どこの病院だっけ？いつ送ったんだっけ？いくらだったっけ？」と思ったときに、確認に時間がかかったり、処分してしまってわからなくなることがあります。とはいえ、こうした事態を避けるために、紙の情報をいちいち書き留めたり、デジタル化して保存したりするのは面倒です。そこでおすすめしたいのが、Apple Intelligenceの活用です。iPhoneに標準搭載されている「ショー
- AI
- あとで読む
- iphone
- Apple
- ショートカット
- iOS
- アプリ
- 便利
- OCR
- メモ
Pythonを用いたPDFデータからの情報抽出 / Extraction data from PDF using Python
- 388 users
- speakerdeck.com/sansandsoc
- テクノロジー
- 2021/09/26
■イベント  ：第54回情報科学若手の会 https://wakate.connpass.com/event/222829/ ■登壇概要タイトル：Pythonを用いたPDFデータからの情報抽出 / Extraction data from PDF using Python 発表者：  技術…
- python
- pdf
- あとで読む
- データ
- プログラミング
- data
- https
- 表
- ライブラリ
- event
電子も紙も積読を消化する技術 - sasasin’s blog
- 388 users
- sasasin.hatenablog.com
- テクノロジー
- 2025/05/22
以前の記事では主に電子書籍の積読を聴いて消化する技術を紹介しました。紙書籍の積読は Kindle 固定レイアウトと絡めて方向性を示した程度でした。 sasasin.hatenablog.com あれから日が経って、電子書籍の積読を消化する技術をもうちょっと整理できたのと、紙書籍の積読も聴き読書により消化する技術を整理できたので、ふたたび紹介します。前回同様「わたしはこうやってる」です。 2行まとめ電子書籍は、Kindle アシストリーダー、 Android TalkBack、 Android 版 ReadEra Premium で聴く紙書籍は、裁断してスキャンして画像化するか、非破壊ブックスキャナー vFlat Scan で画像化して、bunkoOCR でテキスト化して、テキストを ReadEra Premium で聴く電子書籍 Kindle 固定レイアウト以外は読み上げ可能です。
- 本
- あとで読む
- kindle
- 読書
- 書籍
- OCR
- PDF
- 技術
- Android
- book
確定申告を自動化する Agent Skill "shinkoku" を OSS にした
- 351 users
- zenn.dev/kazukinagata
- テクノロジー
- 2026/02/22
確定申告、めんどくさくないですか？年に1回しかやらないから毎年やり方を忘れる。レシートの山を前にしてうんざりする。帳簿をつけて、決算書を作って、税額を計算して、申告書を提出する――気が遠くなるほど長い道のりです。個人事業主やフリーランスの方なら、この苦しみに共感してもらえると思います。「もう全部 AI にやらせたい」。そう思って作ったのが、確定申告を自動化する Agent Skill「shinkoku」です。この記事では、作った動機、できること、セットアップ方法、テストによる品質保証について紹介します。作った動機私は毎年、確定申告の時期になると憂鬱な気持ちになっていました。年に1回しかやらないから、去年の記憶なんて綺麗さっぱり消えているんですよね。「去年どうやったっけ？」が毎年の恒例行事で、結局ゼロから調べ直す羽目になります。そして1年分のレシートと領収書の山。1枚ずつ確認して
- AI
- あとで読む
- 確定申告
- oss
- tax
- finance
- Skill
- LLM
- 税金
岸本元 on X: "国会図書館デジタルコレクションで「ドラゴンクエスト」と検索すると、大正11年に刊行された『本居宣長稿本全集』がヒットする。いくらなんでも大正時代の本居宣長の本にドラクエの話は書かれてないだろと驚いたが、何者かが原本に落書きしたのを読み取ったようだったhttps://t.co/t2DHCNuxgK https://t.co/3oMcKg6yvs"
- 328 users
- twitter.com/bowwowolf
- 学び
- 2023/03/03
- 図書館
- ネタ
- 書籍
- 本
- twitter
- あとで読む
- 国会図書館
- book
- ゲーム
- OCR
PCの操作をすべて録画＆文字起こしして過去の操作を丸ごと検索可能にするアプリ「Windrecorder」
- 328 users
- gigazine.net
- テクノロジー
- 2024/05/06
PCを使っていると、過去の操作内容やブラウザで閲覧していた情報を思い出したくなるタイミングが頻繁に発生します。そんな時に役立ちそうなPC操作記録アプリ「Windrecorder」がオープンソースで開発されています。 GitHub - yuka-friends/Windrecorder: Windrecorder is a memory search app by records everything on your screen in small size, to let you rewind what you have seen, query through OCR text or image description, and get activity statistics. https://github.com/yuka-friends/Windrecorder I made an o
- PC
- あとで読む
- アプリ
- windows
- データベース
- セキュリティ
- tool
- 検索
- データ
- OCR
NotebookLMにKindleを取り込むスプリクトをChatGPTで書いてみた(コード全文)｜SAGE
- 315 users
- note.com/ssblog
- テクノロジー
- 2024/06/23
2025/12/12 追記---------- たくさんの「いいね」ありがとうございます。うれしいです。本記事、公開してから1年半ほど経過します。ご存知の通りLLMに関連する技術やサービスの進化の速度は凄まじく、18ヶ月も経つともうすっかり別物になっていたりします。この記事はもはや古文書。(Cursorはまだ息を潜めていたし、ClaudeCodeもなかったかな...？) 最新の情報ではなく、昔の一事例として読んで頂けると幸いです。 (新しいAIの話もちょくちょく書いていきます) --------- こんにちは。ChatGPTでこんなもの作ってみましたっていう記事です。できる事・Kindleを全ページ自動で画面スクショ・スクショ画像からOCRで文字起こし・ドキュメントにしてGoogleDriveに自動アップロード・ついでにPDFファイルとTXTファイルも作成・スクショデー
- AI
- あとで読む
- ChatGPT
- Kindle
- 電子書籍
- Markdown
はまちや２ on Twitter: "これは東京証券取引所公式の代表の名前が入った一見まともな書類に見えるけど、GoogleはPDF内にある外から見えない注釈等も検索対象にしているらしくて、キャッシュでみると書類に埋め込まれた「うんこ」という文字が可視化される… https://t.co/HCMBx4yqsX"
- 312 users
- twitter.com/Hamachiya2
- テクノロジー
- 2021/09/11
これは東京証券取引所公式の代表の名前が入った一見まともな書類に見えるけど、GoogleはPDF内にある外から見えない注釈等も検索対象にしているらしくて、キャッシュでみると書類に埋め込まれた「うんこ」という文字が可視化される… https://t.co/HCMBx4yqsX
- うんこ
- google
- PDF
- ネタ
- あとで読む
- 仕事
- twitter
- セキュリティ
- security
- 検索
Pythonで始めるドキュメント・インテリジェンス入門 / Introduction to Document Intelligence with Python
- 311 users
- speakerdeck.com/yag_ays
- テクノロジー
- 2021/10/15
ビジネス文書をデータ化し構造や内容を理解するアプリケーションはドキュメント・インテリジェンスと呼ばれ、画像処理や自然言語処理といった複数の要素技術を組み合わせて開発する必要があります。何が必要でどう実現すれば良いのかといった第一歩を、Pythonでの具体的な構築事例とともに紹介します。 https…
OCR処理プログラム及び学習用データセットの公開について | NDLラボ
- 310 users
- lab.ndl.go.jp
- テクノロジー
- 2022/04/25
2022年04月25日 NDLラボのGitHubから、次の2件を公開しました。ライセンスや詳細については、各リポジトリのREADMEをご参照ください。 NDLOCR 国立国会図書館（以下、「当館」とします。）が令和3年度に株式会社モルフォAIソリューションズに委託して実施したOCR処理プログラムの研究開発事業の成果である、日本語のOCR処理プログラムです。このプログラムは、国立国会図書館がCC BY 4.0ライセンスで公開するものです。なお、既存のライブラリ等を利用している部分については寛容型オープンライセンスのものを採用しているため、商用非商用を問わず自由な改変、利用が可能です。機能ごとに7つのリポジトリに分かれていますが、下記リポジトリの手順に従うことで、Dockerコンテナとして構築・利用することができます。リポジトリ : https://github.com/ndl-lab/
- OCR
- あとで読む
- github
- 勉強
- 学習
- 資料
- 機械学習
- 図書館
- python
- AI
GPUなしローカルでも高速・高精度なOCRができるOnnxOCRが凄い
- 306 users
- zenn.dev/harumikun
- テクノロジー
- 2025/09/30
from onnxocr.onnx_paddleocr import ONNXPaddleOcr def sample(): ocr = ONNXPaddleOcr(use_gpu=False, lang="japan") result = ocr.ocr("sample.png") for data in result: for box, (text, score) in data: print(f"text: {text}, score: {score}") ONNXとは OnnxOCRを紹介する上でONNXとは何ぞやということも軽く解説します。 ONNX（Open Neural Network Exchange）とは、機械学習モデルを異なるフレームワーク間で共有・運用するためのオープンなフォーマットです。このフォーマットに従うことで、PyTorch、TensorFlow、Sciki
熊本大学とTOPPAN、くずし字AI-OCRで未解読だった「細川家文書」約5万枚の解読に成功。検索システムも構築
- 303 users
- internet.watch.impress.co.jp
- テクノロジー
- 2024/07/29
- AI
- あとで読む
- 歴史
- 技術
- history
- 文化
- technology
- ocr
- 人工知能
- 学問／研究
GPT-4oをOCRとして使う - Re:ゼロから始めるML生活
- 295 users
- www.nogawanogawa.com
- テクノロジー
- 2024/06/09
OpenAIからChatGPT-4oが発表されましたが、皆さんガンガンつかっていますでしょうか？さて、このChatGPT-4oですが、テキスト以外のデータも使用できるようになっているという特徴があります。普通にテキストでのやり取りをしつつも画像データを扱えるということで、「実はこれいい感じのOCRとして使えるんじゃね？」って思っちゃったわけです。ということで、今回はChatGPT-4oを使ってOCRを使うとどんなもんなのかやってみたいと思います。やりたいことやってみるとりあえずやってみる請求書名刺参考文献感想やりたいこと今回やりたいことはOCRです。早い話が画像ファイルを突っ込んでテキストを読み取りたいって感じです。ただ、当たり前のようにOCRって言葉を使用していますがOCRって結構奥が深いです。 mediadrive.jp 単純に画像から文字を見つけて対応するテ
- ChatGPT
- あとで読む
- AI
- OCR
- 人工知能
- 文章生成AI
- 画像
- GPT
- レイアウト
macOS のデフォルト状態でコマンドラインからOCR処理を行う - TeX Alchemist Online
- 291 users
- doratex.hatenablog.jp
- テクノロジー
- 2023/06/29
macOS 12 Monterey では，OSビルトインでのOCR機能が搭載されました。Preview.app で，画像やスキャンPDF（中身がスキャン画像のPDF）に対して，ただマウスでドラッグするだけで，中身の文字を認識して選択し，コピーできるようになっています。さらに，macOS 13 Ventura では，それが日本語にも対応しました。たとえば，（今や入手困難となってしまった）The TeXbook のアスキーによる日本語版をスキャンしたものを Preview.app で開くと，何もしなくても，文字選択できます。これをコピーして他のエディタにペーストすると， TEXの名称で気をつけなければならないことがほかにもある。Eの文字が不揃いになっていることだ。Eの文字を少し下げてあるのは、TeXが組版のためのシステムであることを印象づけるためであり、またほかのシステムの名称と区別するた
- ocr
- mac
- あとで読む
- macOS
- pdf
- コマンド
- app
- command
- コード
- shell
RAGの性能を改善するための8つの戦略 | Fintan
- 284 users
- fintan.jp
- テクノロジー
- 2024/02/09
近年、OpenAIのGPT-4やGoogleのGemini、MetaのLLaMAをはじめとする大規模言語モデル（Large Language Model：LLM）の能力が大幅に向上し、自然言語処理において優れた結果を収めています[1][2][3]。これらのLLMは、膨大な量のテキストデータで学習されており、さまざまな自然言語処理タスクにおいて、タスクに固有なデータを用いてモデルをファインチューニングすることなく、より正確で自然なテキスト生成や、複雑な質問への回答が可能となっています。 LLM-jp-eval[4]およびMT-bench-jp[5]を用いた日本語LLMの評価結果。Nejumi LLMリーダーボード Neoより取得。大規模言語モデルは近年急速な進歩を遂げていますが、これらの進歩にもかかわらず、裏付けのない情報や矛盾した内容を生成する点においては依然として課題があります。たとえ
- RAG
- LLM
- AI
- あとで読む
- 検索
- チューニング
- ChatGPT
- 自然言語処理
- OCR
- search
GitHub - microsoft/markitdown: Python tool for converting files and office documents to Markdown.
- 277 users
- github.com/microsoft
- テクノロジー
- 2024/12/14
You signed in with another tab or window. Reload to refresh your session. You signed out in another tab or window. Reload to refresh your session. You switched accounts on another tab or window. Reload to refresh your session. Dismiss alert
- markdown
- microsoft
- python
- github
- tool
- あとで読む
- LLM
- Excel
- AI
- pdf
画像でテキストをトークン圧縮するDeepSeek-OCRがいろいろすごい - きしだのHatena
- 268 users
- nowokay.hatenablog.com
- テクノロジー
- 2025/10/22
おとといくらいにDeepSeek-OCRというのが出てました。 https://github.com/deepseek-ai/DeepSeek-OCR ただのOCRじゃなくて、「テキストを画像にしたほうがトークンサイズを小さくできるのでは？」というのをやっていて、テキストを画像にしてトークン化したものをテキストトークンに戻すというのをやってたらOCRになったという感じですね。 LLMの開発効率化に革新？中国DeepSeekが「DeepSeek-OCR」発表 “テキストを画像化”でデータ圧縮：Innovative Tech（AI+） - ITmedia AI＋中身的には、3Bでアクティブパラメータが0.6BのMoEモデルに0.4Bの画像エンコーダーを載せた画像言語モデルです。導入や使い方は、モデルのページに書いてあります。何も考えずに最新のTransformers 4.57.1を入れ
- OCR
- AI
- あとで読む
- 画像
- LLM
- 言語
- 人工知能
- 画像認識
- 開発
- image
ウェブブラウザ単体でOCR処理を実行してAIで校正までできる「NDLOCR-Lite Web AI」レビュー、国立国会図書館のNDLOCR-Liteを簡単に利用可能にしたウェブアプリ
- 259 users
- gigazine.net
- テクノロジー
- 2026/04/02
書類の写真や古文書の画像データを入力するだけでテキストデータとして文字起こしできるウェブアプリが「NDLOCR-Lite Web AI」です。NDLOCR-Lite Web AIは2026年2月に国立国会図書館のNDLラボが公開して話題となった「NDLOCR-Lite」の派生アプリで、インストール操作不要でウェブブラウザからアクセスするだけで使用可能。さらに、各種AIのAPIキーを登録することでAIを用いた校正作業も実行できます。 NDLOCR-Lite Web AI https://cozy-starburst-e4f699.netlify.app/ 上記のリンクをクリックしてNDLOCR-Lite Web AIにアクセスすると、最初に必要なOCRモデルのダウンロードが始まります。ダウンロードが完了すると画像データの入力待ち画面が表示されます。入力できる画像形式は「JPEG」「PNG」
- OCR
- AI
- あとで読む
- webサービス
- 画像
- web
- これはすごい
- データ
- API
- 図書館
ミスが許されない領域にAIを溶け込ませるプロダクトマネジメントの裏側｜Shohei Yoneda
- 259 users
- note.com/t01062sy
- テクノロジー
- 2024/12/31
このnoteは、2024年12月5日にpmconfで登壇させていただいた内容を再編したものです。イベントの登壇テーマとしては、少し早くてニッチかもしれないと思ったのですが、登壇のスライドは本日時点で1万回以上見ていただいており、思いの外関心を持っていただけたのではないかと思っております。概要私がLayerXで開発に携わっているバックオフィスAI SaaS「バクラク」では、「AIによって業務自体をなくす」という信念の元、開発を行なっています。これは、2040年までに約20%にもなる日本の労働受給ギャップを技術によって解決するためです。一方、AI機能の開発は容易ではありません。生成AIを始めとする技術革新により、デモ開発までの速度は驚くほど向上しましたが、顧客が価値を感じられる機能に至るまでは大きなギャップが存在します。例えば、バックオフィス業務はミスなく完遂することが求められる一方
GitHub - dnobori/DN_SuperBook_PDF_Converter: DN_SuperBook_PDF_Converter - スキャン書籍 PDF をデジタル書籍並みに大変クリアに読みやすくする AI PDF 高品質化・各種調整ツール
- 256 users
- github.com/dnobori
- テクノロジー
- 2026/01/20
You signed in with another tab or window. Reload to refresh your session. You signed out in another tab or window. Reload to refresh your session. You switched accounts on another tab or window. Reload to refresh your session. Dismiss alert
- pdf
- AI
- あとで読む
- ツール
- github
- 電子書籍
- converter
- scan
- OCR
- 書籍
ブラウザ上で完結するAI校正付き無料OCRツール「NDLOCR-Lite Web AI」登場。国立国会図書館「NDLOCR-Lite」を活用（生成AIクローズアップ） | テクノエッジ TechnoEdge
- 253 users
- www.techno-edge.net
- テクノロジー
- 2026/04/06
1週間の気になる生成AI技術・研究をいくつかピックアップして解説する連載「生成AIウィークリー」から、特に興味深いAI技術や研究にスポットライトを当てる生成AIクローズアップ。今回は、Webブラウザだけで日本語OCR（光学文字認識）が完結するツール「NDLOCR-Lite Web AI」（MITライセンス）を取り上げます。国立国会図書館が開発したOCRエンジン「NDLOCR-Lite」をベースに、橋本雄太氏（国立歴史民俗博物館）がWeb移植した「ndlocrlite-web」を、小形克宏氏（一般社団法人ビブリオスタイル）がフォークしてAI校正機能を追加しました。宮川創氏（筑波大学）によるダークモードや画像前処理などのUI拡張も統合されています。 ▲NDLOCR-Lite Web AIの画面。左パネルに元画像（芥川龍之介『蜘蛛の糸』）、右パネルにOCR結果が表示されている
- OCR
- あとで読む
- AI
- ツール
- 図書館
- web
- ブラウザ
- 無料
- 技術
「〇〇は戦前には存在しなかった」系のデマは今はコレのおかげで簡単に否定できるようになった、って話
- 249 users
- togetter.com
- 学び
- 2023/03/03
乾杯乾杯（かんぱい）は、盃を飲み干すこと //スペインが起源家庭内から宴席に至るまで広く行われている。場の主催者、またはその指名者が音頭を取り、酒などを注いだ盃やコップを掲げ、「乾杯」と唱和したのち口にする。晩餐会のように改まった会食から酒宴に至るまで、参加者全員が揃った事を契機に、食事や飲み物に手をつけるきっかけとして行われることが多い。遅れて来る者が居る場合、定刻に行ったうえで到着後も改めて行ったり、定刻前に練習と称して飲み始めることもある。基本的にしきたりなので、地域差（都道府県から社内部署に至るま 3 users 3 Wikipedia
- デマ
- 歴史
- 図書館
- 言葉
- togetter
- あとで読む
- リテラシー
- search
- 日本語
- 検索
国立国会図書館のOCR技術を使って、完全オフラインOCRのChrome拡張を作ってみた
- 248 users
- zenn.dev/lecto
- テクノロジー
- 2026/04/29
はじめに画像やPDFのテキストをコピーしたいとき、オンラインのOCRサービスに画像を送るのはちょっと抵抗がありませんか？特に社外秘の資料や個人情報が写っている場合。通信ゼロ、ブラウザの中だけで完結するOCR があれば安心して使えるのに — そう思って、Chrome拡張機能を作りました。以前からいくつかの日本語OCRを試してきて、ブラウザ内でも実用レベルで動くことがわかっていたので、それを誰でも気軽に使える形にしたかったのが動機です。 yomitokuで作る日本語OCR Webアプリ — サーバーサイドで高精度な日本語OCR Tesseract.jsでカスタムモデルのトレーニング — ブラウザOCRの可能性と限界ブラウザだけで完結する日本語OCR＋透視変換 — NDLOCRをブラウザで動かす Chrome Web Store で「オフラインOCR」と検索してもヒットします。これま
- OCR
- あとで読む
- chrome
- web
- 技術
- これはすごい
古文書を解読できるスマホアプリ　凸版印刷が開発　くずし字対応AI-OCRを活用
- 239 users
- www.itmedia.co.jp
- テクノロジー
- 2022/09/13
凸版印刷ではこの課題を解決するため、2015年から国文学研究資料館と共同研究を開始。古文書対応のAI-OCRの開発に取り組んできた。その中で「手元の古文書を手軽に読みたい」という一般利用者向けのサービスに対する多数の要望があり、今回のアプリ開発に至ったとしている。凸版印刷は今後、2025年度までにAPI提供や関連事業を含め、一般利用者や教育機関、博物館・資料館、地方自治体などのサービス提供を拡大し、約3億円の売り上げを目指す。関連記事ライトを当てると文字や絵が現れるホログラム　凸版が開発　スマホライトで真贋判定強い光（点光源）を当てると、立体的な画像が現れる新たなホログラム「イルミグラム」を凸版が開発。スマートフォンのライトなどで誰でも簡単・正確に真贋判定できる。メタバースでのなりすましを防ぐ　3Dアバターの本人証明ができるセキュリティ基盤　凸版印刷が開発凸版印刷が、メタバース
- 技術
- あとで読む
- AI
- 文字
- アプリ
- 画像
- 歴史
- 学習
- 開発
- 人工知能
英語のノベルゲームもこれで遊べる！テキストを即時翻訳表示する「Hotkey Translator」／オーバーレイ表示で画面上のあらゆるテキストを多言語に翻訳可能【レビュー】
- 235 users
- forest.watch.impress.co.jp
- テクノロジー
- 2026/05/01
- 英語
- あとで読む
- 翻訳
- ゲーム
- ツール
- ocr
- game
- pc
- translation
- ソフトウェア
Claude.aiをつかって画像内の文字を正確に抽出する方法を見つけました - Qiita
- 226 users
- qiita.com/moritalous
- テクノロジー
- 2025/02/03
例えば、こちらのブログですが、グラフィカルな解説部分が、画像になっています。 Claudeはマルチモーダルに対応しているので、画像を添付した状態で「文字を抽出して」というと文字を抽出してくれますが、日本語で要約して回答したり、元の文章を正確に抽出するのは、意外と難しいと感じていました。以下は、Claude.aiを使って「添付画像から文字を抽出して」と依頼した際の結果です。原文そのままを正確に抽出したいときってありますよね？それを解決する方法を編み出しました。方法は、「 HTMLで再現させる」です！本投稿の先頭の画像を添付して「添付画像をHTMLで再現して」と依頼した際の結果がこちらです。感動！！！（注：右側が画像をもとに生成したHTMLを、プレビューした状態です。Claude.aiのArtifactsという機能です）アイコンがちょっと違うとか省略されてるとかはありますが、
- AI
- あとで読む
- claude
- 画像
- 人工知能
- html
- ocr
- 日本語
- llm
- qiita
日本語の手書きメモを書き起こせるOCRを探すために23モデルを片っ端から試した話
- 224 users
- nyosegawa.com
- テクノロジー
- 2026/03/17
こんにちは！逆瀬川ちゃん (@gyakuse) です！今日は日本語の手書きメモをいい感じに書き起こしてくれるOCRを探して、23モデルを片っ端から比較してみた話をまとめていきたいと思います。手書きメモは楽しいが電子化がつらいわたしはいまだに手書きメモをよく書きます。打ち合わせの最中にさっと書いたり、アイデアを整理するときにペンで図を描いたり。手を動かしながら考えるのはとても楽しいし、タイピングとは違う思考の広がり方があります。ただ問題は電子化です。ノートに書いたメモをあとからSlackやNotionに転記するのがとにかくつらい。自分の字を自分で読み返す作業がすでにつらいのに、それを打ち直すのは二重苦です。 OCRで自動化したいのですが、日本語の手書き文字って既存のOCRモデルにとってはかなり難しいタスクです。活字ならどのモデルでも高精度ですが、手書きとなると精度がガクッと落ちます。
- OCR
- AI
- あとで読む
- Gemini
- 日本語
- Claude
- API
- LLM
- ツール
- アプリ
ドキュメントをMarkdownやJSONに変換してくれる「Docling」を試す
- 224 users
- zenn.dev/kun432
- テクノロジー
- 2024/11/05
ここで知った。試しに、神戸市が公開している観光に関する統計・調査資料のうち、「令和5年度神戸市観光動向調査結果について」のPDFで一度試していたのだけども: （出典）神戸市Webサイトの「観光に関する統計・調査」のページ上記にある「令和5年度神戸市観光動向調査結果について」のPDF 日本語でも、概ね問題なく、表などもきれいにパースされるただし、表が画像になってる場合に、うまく解釈されない（表は解釈されるが、中の文字が化ける） OCRが正しくできていない可能性というのがあって、ドキュメント読んだけどわからなくて、それ以上深追いしてなかった。ただ、X界隈を見る限りは評判は良さそうで、いろいろ記事も出てきたみたいなので、改めて試してみる。 GitHubレポジトリドキュメント Docling Doclingは、ドキュメントを解析し、簡単かつ迅速に希望の形式にエクスポートします。
- markdown
- あとで読む
- pdf
- json
- ドキュメント
- ocr
- AI
- LLM
- document
- 論文
画像からテキストを抽出、ファイル名を一括変更…Windowsを快適にする公式無料ツール「PowerToys」おすすめ機能7選 | 文春オンライン
- 190 users
- bunshun.jp
- テクノロジー
- 2022/09/16
「PowerToys」という無料ツールをご存知でしょうか。Windowsをさらに使いやすくする十数個の機能をまとめた、Microsoftの公式ツールです。カユイところに手が届く数々の機能はいちど使うと手が放せなくなるほどで、どうしてこれがWindowsに最初から組み込まれていないのだろうと首をひねってしまうほどです。そんな「PowerToys」は、今年9月に入って登場した最新版の「0.62.0」で、これまでなかった新機能がいくつか追加され、より充実したツールへと生まれ変わりました。今回は最新の「0.62.0」で追加された機能も含め、筆者が「これは特に便利」と感じたPowerToysの便利機能を厳選して紹介します。ピンと来る機能があれば、ぜひこの機会にインストールして試してみてください。ダウンロードはMicrosoftストア、もしくはこちらから行えます。
- windows
- あとで読む
- ツール
- PowerToys
- ソフトウェア
- MicroSoft
- 便利
- tool
［速報］マイクロソフト、手書きのスケッチをAIでアプリ画面に手軽に変換できる「Power Apps Express design」発表。Microsoft Build 2022
- 188 users
- www.publickey1.jp
- テクノロジー
- 2022/05/25
［速報］マイクロソフト、手書きのスケッチをAIでアプリ画面に手軽に変換できる「Power Apps Express design」発表。Microsoft Build 2022 マイクロソフトは現在開催中の開発者向けイベント「Microsoft Build 2022」で、ローコード／ノーコード開発ツール「Power Apps」の新機能として、手書きのスケッチやPDFのフォーム画面、Figmaのデザインファイルなどを元に、AIがアプリケーションの画面作成を支援してくれる「Power Apps Express design」を発表しました。公開された動画を元に、Power Apps Express designの機能を見ていきましょう。 Power Apps Express designでは、画面スケッチをキャプチャするとAIがUIコンポーネントを認識します。
- microsoft
- あとで読む
- AI
- ツール
- 開発
- design