PDFからテキストを抽出する
🔒 ファイルはこの端末から出ません
PDFに含まれる文字をテキストファイルとして書き出します。 引用、再利用、AIツールへの読み込みに。ファイルはサーバーへ送信されません。
結果
使い方
1. PDFをドラッグ&ドロップするか、枠をクリックして選びます。
2. ページ番号の区切りを入れるか選びます。
3.「テキストを抽出する」を押すと、テキストファイル(.txt)が保存されます。
取り出せるPDF・取り出せないPDF
| 取り出せる | WordやExcel、PowerPointから書き出したPDF。Webページを印刷して作ったPDF。つまり元から文字データを持っているPDF |
|---|---|
| 取り出せない | 複合機やスマホアプリでスキャンしたPDF。中身が写真と同じ「画像」なので、文字データが存在しません |
見分け方は簡単です。PDFを開いて文字をマウスでなぞって選択できるか試してください。 選択できれば文字データがあり、選択できなければ画像です。 画像のPDFから文字を起こすには文字認識(OCR)が必要ですが、このツールは対応していません。
PDFは「文字の入れ物」ではありません
ここを理解すると、うまくいかない理由がすべて説明できます。
Wordのように「1行目にこの文、2行目にこの文」と持っているわけではなく、 PDFが記録しているのは「この座標に、この文字を、この大きさで置く」という指示の集まりです。 文章の流れ(読み順)という情報を、PDFは持っていません。
取り出す側は、散らばった文字を座標から推測して並べ直しています。 だから次のような崩れ方をします。
| 2段組みが混ざる | 左右の段が同じ高さにあるため、左の行と右の行が交互に出てくることがあります |
|---|---|
| 表が崩れる | 表の枠線は「線」、中の文字は「文字」として別々に置かれています。 どのセルに属するかという情報がありません |
| 変な位置で改行される | 見た目の1行が、データ上は複数の断片に分かれていることがあります |
| ヘッダー・フッターが挟まる | ページ番号や見出しが、本文の途中に紛れ込みます |
これは不具合ではなく、PDFという形式の性質です。 どのツールを使っても、程度の差はあれ同じことが起こります。 取り出したあとに人の目で直す前提でお使いください。
文字化けするときの原因
文字は取り出せるのに、記号の羅列になる——これには決まった原因があります。
PDFはフォントを埋め込むとき、「このフォントの3番目の絵は、文字コードのこれにあたる」という対応表を 一緒に入れることになっています。この対応表が欠けていると、 表示はできても「その文字が何なのか」が分からない状態になります。
古いソフトで作られたPDFや、フォントの一部だけを埋め込んだPDFで起こりがちです。 作成元にファイルの作り直しを依頼する以外に、確実な対処はありません。
スキャンしたPDFからは取り出せません
当サイトの明確な限界なので、はっきり書いておきます。
複合機でスキャンした書類は、中身が「紙を撮影した画像」です。 人間の目には文字が見えていても、データとしては色のついた点の集まりでしかありません。 取り出す文字が最初から存在しないため、このツールでは何も出てきません。
30秒で見分けられます
PDFを開いて本文の文字をドラッグしてみてください。
- 選択できる(青く反転する) → 文字として入っています。このツールで取り出せます
- 選択できない → 画像です。OCRが必要で、当サイトは対応していません
OCRとは、画像の中の文字を認識して文字データに起こす技術です。 必要な場合は、OCR機能のあるソフトやサービスをお使いください。 なお複合機の設定に「検索可能なPDF」「OCR」の項目があれば、 スキャンの時点で文字を埋め込めます。次回のために確認しておくと手戻りが減ります。
こんなときに
報告書の一節を引用する、PDFの内容をExcelやWordに移す、 議事録を検索できる形で保管する、 ChatGPTなどのAIに資料を読ませたいが、PDFのままでは扱いにくい—— といった場面で使えます。
機密資料をAIに読ませる前に
社内資料をAIツールに読み込ませる場面が増えていますが、その前段の「テキスト化」を オンラインの変換サービスで行ってしまうと、そこで一度ファイルが外部へ渡ります。 本末転倒になりかねません。
このツールは抽出処理をブラウザ内で完結させます。 必要な部分だけを取り出してから使う、という運用ができます。
出力の仕様
| 文字コード | BOM付きUTF-8(メモ帳・Excelでそのまま開けます) |
|---|---|
| 改行の復元 | 文字の縦位置の変化から行を推定して復元します |
| ページ区切り | 選択に応じて「--- Nページ ---」を挿入 |
| レイアウト | 段組み・表の罫線は再現されません(文字のみ) |
よくある質問
スキャンしたPDFから文字を取り出せますか?
取り出せません。中身が画像のため文字データが存在しないためです。その場合はエラーメッセージが表示されます。
表がぐちゃぐちゃになります
PDFは内部的に「どの位置にどの文字を置くか」しか持っておらず、表という構造を保持していません。そのため罫線やセルの区切りは復元できません。文字の並びだけが取り出されます。
抽出したテキストが文字化けします
出力はBOM付きUTF-8なので通常は化けません。化ける場合、PDF側が特殊なフォント埋め込みをしている可能性があります。
画像として書き出したい
PDF→JPG・PNG変換ツールをご利用ください。