PDFからテキストを抽出する
🔒 ファイルはこの端末から出ません
PDFに含まれる文字をテキストファイルとして書き出します。 引用、再利用、AIツールへの読み込みに。ファイルはサーバーへ送信されません。
結果
使い方
1. PDFをドラッグ&ドロップするか、枠をクリックして選びます。
2. ページ番号の区切りを入れるか選びます。
3.「テキストを抽出する」を押すと、テキストファイル(.txt)が保存されます。
取り出せるPDF・取り出せないPDF
| 取り出せる | WordやExcel、PowerPointから書き出したPDF。Webページを印刷して作ったPDF。つまり元から文字データを持っているPDF |
|---|---|
| 取り出せない | 複合機やスマホアプリでスキャンしたPDF。中身が写真と同じ「画像」なので、文字データが存在しません |
見分け方は簡単です。PDFを開いて文字をマウスでなぞって選択できるか試してください。 選択できれば文字データがあり、選択できなければ画像です。 画像のPDFから文字を起こすには文字認識(OCR)が必要ですが、このツールは対応していません。
こんなときに
報告書の一節を引用する、PDFの内容をExcelやWordに移す、 議事録を検索できる形で保管する、 ChatGPTなどのAIに資料を読ませたいが、PDFのままでは扱いにくい—— といった場面で使えます。
機密資料をAIに読ませる前に
社内資料をAIツールに読み込ませる場面が増えていますが、その前段の「テキスト化」を オンラインの変換サービスで行ってしまうと、そこで一度ファイルが外部へ渡ります。 本末転倒になりかねません。
このツールは抽出処理をブラウザ内で完結させます。 必要な部分だけを取り出してから使う、という運用ができます。
出力の仕様
| 文字コード | BOM付きUTF-8(メモ帳・Excelでそのまま開けます) |
|---|---|
| 改行の復元 | 文字の縦位置の変化から行を推定して復元します |
| ページ区切り | 選択に応じて「--- Nページ ---」を挿入 |
| レイアウト | 段組み・表の罫線は再現されません(文字のみ) |
よくある質問
スキャンしたPDFから文字を取り出せますか?
取り出せません。中身が画像のため文字データが存在しないためです。その場合はエラーメッセージが表示されます。
表がぐちゃぐちゃになります
PDFは内部的に「どの位置にどの文字を置くか」しか持っておらず、表という構造を保持していません。そのため罫線やセルの区切りは復元できません。文字の並びだけが取り出されます。
抽出したテキストが文字化けします
出力はBOM付きUTF-8なので通常は化けません。化ける場合、PDF側が特殊なフォント埋め込みをしている可能性があります。
画像として書き出したい
PDF→JPG・PNG変換ツールをご利用ください。