PDFテキスト抽出 — PDFから文字をコピー
PDFの全ページ(またはページ範囲)から選択可能なテキストを、ページ区切り付きで抽出します。クリップボードにコピーするか.txtでダウンロード。すべてブラウザ内で完結します。スキャンした画像のみのPDFには抽出できるテキストがありません。
🔒 すべてあなたのブラウザ内で動作します。入出力データはサーバに送信・保存されないため安全です。
⚠️ スキャンや画像のみのPDFには選択可能なテキストが含まれないため、抽出できません。
🔒 PDFはすべてブラウザ内で読み込まれ、デバイスから外部に送信されません。
このツールについて
このツールは、PDFから選択可能なテキストを抜き出し、コピーやダウンロードができるプレーンテキストにします。ブラウザ内で動作します。文書を読み込み、必要ならページ範囲を選ぶと、ページ区切り付きで文字が得られます。引用・検索・翻訳や、打ち直さずに内容を再利用したいときに便利です。アップロードは行われず、テキストはpdf.jsでローカルに抽出されるため、文書は非公開のままです。なお、画像だけのスキャンPDFには抽出できるテキスト層がありません。
よくある質問
スキャンしたPDFで文字が出ないのはなぜ?
スキャンしたページは実際には文書の写真であり、テキスト層ではなくピクセルで構成されています。そのため、抽出ツールが読み取れるものがありません。スキャンから文字を得るにはOCR(光学文字認識)という別の処理が必要です。このツールは、WordやWebページから書き出したPDFなど、もともとデジタルのPDFが持つ本物のテキスト層を読み取ります。
レイアウトは保たれますか?
抽出で得られるのはプレーンテキストとしての文字であり、元のレイアウトではありません。そのため、段組み・表・正確な字間などは揃わないことがあります。これはページのデザインを再現するためではなく、引用・検索・翻訳のために内容を取り出すためのものです。ページは区切り記号で分けられ、各ページの始まりが分かります。
文書のプライバシーは守られますか?
はい。テキストはブラウザ内で動作するpdf.jsによって読み取られるため、PDFは端末内で処理され、アップロードや保存はされません。そのため、機密の契約書やレポートからでも安全にテキストを抽出できます。内容がサーバーにさらされることは一切ありません。