PDFからテキストを抽出する

🔒 ファイルはこの端末から出ません

PDFに含まれる文字をテキストファイルとして書き出します。 引用、再利用、AIツールへの読み込みに。ファイルはサーバーへ送信されません。

結果

    使い方

    1. PDFをドラッグ&ドロップするか、枠をクリックして選びます。
    2. ページ番号の区切りを入れるか選びます。
    3.「テキストを抽出する」を押すと、テキストファイル(.txt)が保存されます。

    取り出せるPDF・取り出せないPDF

    取り出せるWordやExcel、PowerPointから書き出したPDF。Webページを印刷して作ったPDF。つまり元から文字データを持っているPDF
    取り出せない複合機やスマホアプリでスキャンしたPDF。中身が写真と同じ「画像」なので、文字データが存在しません

    見分け方は簡単です。PDFを開いて文字をマウスでなぞって選択できるか試してください。 選択できれば文字データがあり、選択できなければ画像です。 画像のPDFから文字を起こすには文字認識(OCR)が必要ですが、このツールは対応していません。

    PDFは「文字の入れ物」ではありません

    ここを理解すると、うまくいかない理由がすべて説明できます。

    Wordのように「1行目にこの文、2行目にこの文」と持っているわけではなく、 PDFが記録しているのは「この座標に、この文字を、この大きさで置く」という指示の集まりです。 文章の流れ(読み順)という情報を、PDFは持っていません。

    取り出す側は、散らばった文字を座標から推測して並べ直しています。 だから次のような崩れ方をします。

    2段組みが混ざる 左右の段が同じ高さにあるため、左の行と右の行が交互に出てくることがあります
    表が崩れる 表の枠線は「線」、中の文字は「文字」として別々に置かれています。 どのセルに属するかという情報がありません
    変な位置で改行される 見た目の1行が、データ上は複数の断片に分かれていることがあります
    ヘッダー・フッターが挟まる ページ番号や見出しが、本文の途中に紛れ込みます

    これは不具合ではなく、PDFという形式の性質です。 どのツールを使っても、程度の差はあれ同じことが起こります。 取り出したあとに人の目で直す前提でお使いください。

    文字化けするときの原因

    文字は取り出せるのに、記号の羅列になる——これには決まった原因があります。

    PDFはフォントを埋め込むとき、「このフォントの3番目の絵は、文字コードのこれにあたる」という対応表を 一緒に入れることになっています。この対応表が欠けていると、 表示はできても「その文字が何なのか」が分からない状態になります。

    古いソフトで作られたPDFや、フォントの一部だけを埋め込んだPDFで起こりがちです。 作成元にファイルの作り直しを依頼する以外に、確実な対処はありません。

    スキャンしたPDFからは取り出せません

    当サイトの明確な限界なので、はっきり書いておきます。

    複合機でスキャンした書類は、中身が「紙を撮影した画像」です。 人間の目には文字が見えていても、データとしては色のついた点の集まりでしかありません。 取り出す文字が最初から存在しないため、このツールでは何も出てきません。

    30秒で見分けられます

    PDFを開いて本文の文字をドラッグしてみてください。

    OCRとは、画像の中の文字を認識して文字データに起こす技術です。 必要な場合は、OCR機能のあるソフトやサービスをお使いください。 なお複合機の設定に「検索可能なPDF」「OCR」の項目があれば、 スキャンの時点で文字を埋め込めます。次回のために確認しておくと手戻りが減ります。

    こんなときに

    報告書の一節を引用する、PDFの内容をExcelやWordに移す、 議事録を検索できる形で保管する、 ChatGPTなどのAIに資料を読ませたいが、PDFのままでは扱いにくい—— といった場面で使えます。

    機密資料をAIに読ませる前に

    社内資料をAIツールに読み込ませる場面が増えていますが、その前段の「テキスト化」を オンラインの変換サービスで行ってしまうと、そこで一度ファイルが外部へ渡ります。 本末転倒になりかねません。

    このツールは抽出処理をブラウザ内で完結させます。 必要な部分だけを取り出してから使う、という運用ができます。

    出力の仕様

    文字コードBOM付きUTF-8(メモ帳・Excelでそのまま開けます)
    改行の復元文字の縦位置の変化から行を推定して復元します
    ページ区切り選択に応じて「--- Nページ ---」を挿入
    レイアウト段組み・表の罫線は再現されません(文字のみ)

    よくある質問

    スキャンしたPDFから文字を取り出せますか?

    取り出せません。中身が画像のため文字データが存在しないためです。その場合はエラーメッセージが表示されます。

    表がぐちゃぐちゃになります

    PDFは内部的に「どの位置にどの文字を置くか」しか持っておらず、表という構造を保持していません。そのため罫線やセルの区切りは復元できません。文字の並びだけが取り出されます。

    抽出したテキストが文字化けします

    出力はBOM付きUTF-8なので通常は化けません。化ける場合、PDF側が特殊なフォント埋め込みをしている可能性があります。

    画像として書き出したい

    PDF→JPG・PNG変換ツールをご利用ください。

    ほかのツール