PDFの文字がコピーできない・選択できない原因と対処法
引用したいのに文字が選べない。コピーしたら意味不明な記号になった。 ——原因は3つに分かれます。まず「どれなのか」を30秒で判定しましょう。
30秒でできる原因の切り分け
PDFを開いて、本文の文字をマウスでドラッグして選択してみてください。
| 文字が選択できない (範囲が四角く選ばれる) |
原因1:中身が画像。スキャンした書類。最も多いケース |
|---|---|
| 選択はできるがコピーできない | 原因2:コピー制限がかかっている |
| コピーできるが文字化けする | 原因3:フォントの埋め込み方の問題 |
原因1:中身が画像になっている(最も多い)
複合機でスキャンした書類、スマホのスキャンアプリで作ったPDF、 FAXを電子化したもの——これらは紙を撮影した「写真」がPDFに収まっているだけです。
人間の目には文字に見えますが、コンピューターにとっては 単なる色の点の集まりで、文字データはどこにも存在しません。 選択できないのは当然なのです。
解決するには「OCR(文字認識)」が必要
画像から文字を読み取るには、OCRという処理が要ります。 画像を解析して「この形はおそらく『あ』だろう」と推測する技術です。
推測である以上、100%正確ではありません。 特に日本語は文字種が多く、手書き・かすれ・傾きがあると精度が落ちます。 OCR後は必ず目視で確認してください。
当サイトのPDF→テキスト抽出ツールはOCRには対応していません。 文字データを持つPDFからの抽出専用です。画像PDFを読み込ませた場合は、その旨のメッセージが表示されます。
原因2:コピー制限がかかっている
PDFには「印刷を禁止する」「テキストのコピーを禁止する」といった制限を設定できます。 閲覧はできるがコピーだけできない、という場合はこれです。
この制限は、作成者が意図的にかけたものです。 著作物の無断利用を防ぐ目的で設定されていることが多いため、 解除を試みる前にそもそも利用してよい資料かを確認してください。 業務資料であれば、作成者に制限のないファイルを依頼するのが正攻法です。
原因3:コピーすると文字化けする
選択もコピーもできるのに、貼り付けると ‡ãΉ のような記号になる場合。
これはPDF内部のフォントの埋め込み方に起因します。
PDFは「この位置にこの字形を描く」という情報を持っていますが、 その字形が文字コードのどれに対応するかの対応表(ToUnicode CMap)が 欠けていたり壊れていたりすると、正しい文字に戻せません。
作成したソフトの古さや設定が原因なので、閲覧側では直せないことが多いのが実情です。 対処としては次の2つになります。
- 別のPDF閲覧ソフトで開いてコピーしてみる(ソフトによって解釈が異なる)
- あきらめて、画像化してからOCRにかける(遠回りだが確実性はある)
文字データを持つPDFから、まとめて取り出す
原因1でも2でも3でもない、普通のPDF——たとえばWordやExcelから書き出したPDFなら、 文字をまとめて取り出せます。1ページずつ手でコピーする必要はありません。
→ PDF→テキスト抽出ツール(アップロード不要)
全ページの文字をテキストファイルとして一括で書き出します。
ページ区切りの挿入も選べます。
AIに資料を読ませたい場合の注意
最近は「PDFをAIに読ませて要約したい」という用途が増えています。 その際、前段のテキスト化をオンラインの変換サービスで行うと、そこで一度ファイルが外部へ渡ります。 機密資料の扱いに気をつけていても、ここで漏れては本末転倒です。
当サイトのツールは抽出処理をブラウザ内で完結させるため、ファイルが端末から出ません。 必要な部分だけを取り出してからAIに渡す、という運用ができます。
表がぐちゃぐちゃになるのはなぜか
文字は取り出せたのに、表の形が崩れる——これはツールの不備ではなく、 PDFという形式の性質です。
PDFは内部的に「座標(100,200)に『山』を描く」といった情報しか持っておらず、 「これは表の2行3列目だ」という構造を保存していません。 罫線も単なる線として描かれているだけです。 そのため、表を表として復元するのは原理的に難しく、専用の高度なソフトが必要になります。
まとめ
| 選択できない | 中身が画像 → OCRが必要 |
|---|---|
| コピーできない | 制限あり → 作成者に確認するのが正攻法 |
| 文字化けする | フォントの埋め込み問題 → 別ソフトで試す |
| 普通のPDF | テキスト抽出ツールで一括取り出し |