画像・スキャン PDF の文字を読み取る(OCR)|日本語・英語・縦書き、ブラウザの中で(アップロードなし)
写真に撮った書類・スクショ・スキャン PDF から文字を取り出す。日本語+英語。HEIC もそのまま。
特長
画像・スキャン PDF の文字を読み取る
写真に撮った書類、スクリーンショット、スキャンしただけの PDF(文字データ無し)から文字を取り出します。日本語+英語。
iPhone の HEIC もそのまま
HEIC・JPEG・PNG・WebP・PDF を受け付けます。複数まとめて、ページごとに。
アップロードしない
文字認識(Tesseract)はブラウザの中で動きます。初回だけ認識エンジンと日本語データ(合わせて約8MB)をこのサイトから読み込みます。
使い方
- 画像か PDF を選ぶ(複数可)
- 言語・縦書きを選んで「文字を読み取る」
- 結果を直して、コピー/.txt でダウンロード
よくある質問
- 画像はどこかへ送られますか?
- 送られません。認識は Tesseract という OCR エンジンをブラウザの中(WebAssembly)で動かしています。
- 精度はどれくらいですか?
- 印刷された文字・スクショはかなり読めます。手書き・小さい文字・傾いた写真・背景がある物は落ちます。読めない時は、真上から明るく撮る/文字が 30px 以上になるよう大きく/余計な部分を切る、が効きます。結果は必ず目で確かめてください。
- 縦書きは?
- 「縦書き」にチェックすると縦書き用の読み方になります。横書きと混在する物は、横書きで読んでから縦の部分だけ切り出して読み直してください。
- 文字データのある PDF なら?
- OCR は要りません。「PDF の文字を取り出す」の方が正確で速いです。こちらはスキャンした(画像だけの)PDF 用です。
- 時間がかかります
- 1枚あたり数秒〜十数秒(パソコン次第)。PDF はページごとに読むので、ページ数に比例します。
- 英語だけの文書なら?
- 言語を「英語」にすると速く正確になります。日本語と英語が混ざる物は「日本語+英語」。