PDFテキスト抽出
PDFに埋め込まれた文字をページごとに取り出し、コピーまたはTXTで保存します。ファイルはブラウザ内だけで読み取ります。
文字情報を持つPDFが対象です
文字を選択できるPDFからテキストを抽出します。紙をスキャンした画像だけのPDFにOCRをかける機能ではありません。
ツール本体
入力・操作・結果
上から入力し、必要な操作を行って、表示された結果と次の操作を確認してください。
PDFを選び、抽出を開始してください。
入力データは原則ブラウザ内で処理し、URLやアクセス解析へ保存しません。ページを更新すると入力は失われます。機密情報は入力しないでください。
使い方
- 50MB・500ページ以内のPDFを選びます。
- 全ページまたは1-3,5形式の範囲を選びます。
- 抽出結果を確認し、コピーまたはTXT保存します。
ページ上の見た目と文字の内部順序は一致しない場合があります。段組みや表は、抽出後に原本と照合してください。
このツールを使う場面
- 確認できること
- 文字情報を持つPDFから、ページごとのテキストをブラウザ内で取り出せます。
- 使う前に見るポイント
- OCRではないため、画像だけのスキャンPDFではないか確認します。
- 結果を見たあとにやること
- 段組みや表の文字順を原本と照合してから利用します。
つまずきやすいポイント
スキャン画像から文字を認識できると思う
OCRではないため、画像内の文字は抽出しません。
抽出順を原本どおりと断定する
PDF内部の文字配置によって段組みや表の順序が変わることがあります。
境界値・事前チェック項目
文字のないページ
ページ見出しを残し、文字がないことを表示します。
暗号化・破損PDF
読み取れない場合はエラーを表示し、内容を保存しません。
よくあるミスと回避策
ページ番号を0から数える
範囲入力はPDF表示どおり1ページから数えます。
機密文書を結果欄に残す
処理はローカルですが、作業後はクリアまたはタブを閉じてください。
FAQ
スキャンしたPDFにも使えますか?
画像だけのPDFから文字は認識できません。OCRは非対応です。
ファイルはアップロードされますか?
いいえ。PDFの読み取りとTXT作成はブラウザ内で行います。
表の形も保持できますか?
保持を保証しません。埋め込まれた文字をページ単位で取り出します。
基本FAQ
入力データは外部へ送信されますか?
原則として送信されません。入力内容はブラウザ内で処理し、URLやアクセス解析へ保存しません。例外がある場合は各ツールページ内に明記しています。
入力内容は自動保存されますか?
原則として自動保存しません。ページを更新すると入力は失われます。コピーやダウンロードで保存する場合は、ご利用端末内に保存されます。
同じ目的のPDF提出前チェックツール
PDFの容量、結合、ページ順、印刷前確認をまとめて扱うツール群です。 迷ったらラベル付きの入口ツールから確認できます。
関連ツール
同じ作業の前後で使うことがあるツールです。