PDFからテキストを抽出する

🔒 ファイルはこの端末から出ません

PDFに含まれる文字をテキストファイルとして書き出します。 引用、再利用、AIツールへの読み込みに。ファイルはサーバーへ送信されません。

結果

    使い方

    1. PDFをドラッグ&ドロップするか、枠をクリックして選びます。
    2. ページ番号の区切りを入れるか選びます。
    3.「テキストを抽出する」を押すと、テキストファイル(.txt)が保存されます。

    取り出せるPDF・取り出せないPDF

    取り出せるWordやExcel、PowerPointから書き出したPDF。Webページを印刷して作ったPDF。つまり元から文字データを持っているPDF
    取り出せない複合機やスマホアプリでスキャンしたPDF。中身が写真と同じ「画像」なので、文字データが存在しません

    見分け方は簡単です。PDFを開いて文字をマウスでなぞって選択できるか試してください。 選択できれば文字データがあり、選択できなければ画像です。 画像のPDFから文字を起こすには文字認識(OCR)が必要ですが、このツールは対応していません。

    こんなときに

    報告書の一節を引用する、PDFの内容をExcelやWordに移す、 議事録を検索できる形で保管する、 ChatGPTなどのAIに資料を読ませたいが、PDFのままでは扱いにくい—— といった場面で使えます。

    機密資料をAIに読ませる前に

    社内資料をAIツールに読み込ませる場面が増えていますが、その前段の「テキスト化」を オンラインの変換サービスで行ってしまうと、そこで一度ファイルが外部へ渡ります。 本末転倒になりかねません。

    このツールは抽出処理をブラウザ内で完結させます。 必要な部分だけを取り出してから使う、という運用ができます。

    出力の仕様

    文字コードBOM付きUTF-8(メモ帳・Excelでそのまま開けます)
    改行の復元文字の縦位置の変化から行を推定して復元します
    ページ区切り選択に応じて「--- Nページ ---」を挿入
    レイアウト段組み・表の罫線は再現されません(文字のみ)

    よくある質問

    スキャンしたPDFから文字を取り出せますか?

    取り出せません。中身が画像のため文字データが存在しないためです。その場合はエラーメッセージが表示されます。

    表がぐちゃぐちゃになります

    PDFは内部的に「どの位置にどの文字を置くか」しか持っておらず、表という構造を保持していません。そのため罫線やセルの区切りは復元できません。文字の並びだけが取り出されます。

    抽出したテキストが文字化けします

    出力はBOM付きUTF-8なので通常は化けません。化ける場合、PDF側が特殊なフォント埋め込みをしている可能性があります。

    画像として書き出したい

    PDF→JPG・PNG変換ツールをご利用ください。

    ほかのツール