PDF テキスト抽出|全ページの文字をまとめてコピー・.txt に(日本語の空白を詰める・アップロードなし)
PDF から文字だけを取り出す。「見 積 書」のような空白も詰めます。
特長
PDF の文字をまとめて取り出す
コピーしようとすると1行ずつしか選べない、貼ると変な改行が入る、を解決。全ページの文字をテキストにします。
日本語の空白を詰める
PDF は1文字ずつ置かれているため、コピーすると「見 積 書」のように空白が入ることがあります。日本語の文字の間だけ詰めます。
アップロードしない
PDF の読み取りはブラウザの中(pdf.js)。契約書・請求書をそのまま扱えます。
使い方
- PDF を選ぶ
- ページ範囲(任意)を入れて「文字を取り出す」
- コピー、または .txt でダウンロード
よくある質問
- PDF はどこかへ送られますか?
- 送られません。読み取りはブラウザの中で行います。
- 文字が1つも出ません
- スキャンした PDF(画像だけ)には文字データが入っていないので取り出せません。文字にするには OCR(文字認識)が要ります。このツールは OCR をしません。
- 文字化けします
- フォントの埋め込み方が特殊な PDF は、正しい文字コードが取れないことがあります。元のソフトから「テキスト付き PDF」で出し直すと直ることが多いです。
- 表(テーブル)はどうなりますか?
- 行ごとの文字にはなりますが、列の区切りは保たれません。表を取り出すなら、行を貼り付けてから「表 → Markdown」などで整えてください。
- 改行の位置がおかしい
- PDF の見た目の行で切っています。文章として繋げたいなら、取り出した後に「改行・空白の掃除」の「文の途中の改行を消す」を使ってください。