OCR PDF(文字認識)
スキャンしたPDFに見えないテキストの層を重ねて、検索や文字のコピーができるようにします。ページの見た目は一切変わりません。
またはここにドラッグ&ドロップ · 50MBまで無料
もっと大きなファイルは?Proなら500MBまで変換できます無料の上限を超えています。ダウンロードは€1.99から解除できます。
処理中…
ファイルの準備ができました
無料 · 登録不要 · 透かしなし · ファイルは端末から出ません
3ステップでOCR PDF(文字認識)
- スキャンしたPDFを選ぶか、枠の中にドロップします。
- 文字の言語を選び(2か国語が混ざった書類なら2つ目も)、「OCRを実行」をクリックします。
- 検索できるPDF、または認識したすべてのテキストをTXTファイルでダウンロードします。
OCRでスキャンが検索できるPDFになる仕組み
スキャンしたページは紙を撮った写真にすぎず、文字を検索したり、文を選択したり、金額をコピーしたりはできません。OCR(光学文字認識)はその画像の文字を読み取り、各単語のちょうど上に重なる見えないテキストの層としてページに加えます。見た目はそのままですが、Ctrl+F(Macは⌘+F)で語句が見つかり、Acrobat、プレビュー、Chrome、Edgeで文字を選択・コピーでき、Windows、macOS、Googleドライブや文書管理システムでも全文検索の対象になります。
文字の認識は、オープンソースのOCRエンジンTesseractがお使いの端末上で行います。各ページは最大300dpiで読み取り、すでにテキストがあるページはそのまま、横向きや逆さまにスキャンされたページは正しい向きに回転します。手紙、請求書、契約書、本、申込書など、はっきり印刷された文字で最もよく働きます。手書き、ごく小さな文字、色あせたページ、斜めから撮った写真は誤りが増え、表はセルではなくテキストとして出力されます。ある言語を初めて使うときは、その読み取りモデル(1〜3MB)をこのサイトからダウンロードし、ブラウザに保存します。日本語は横書きの文書に対応しています。
よくある質問
OCRをかけるとPDFの見た目は変わりますか?
変わりません。元のページ、画像、図形は変更も再圧縮もしません。OCRは各ページの上に見えないテキストの層を加えるだけなので、見た目は同じで、ファイルサイズも1ページあたり数KB増えるだけです。横向きにスキャンされたページは読みやすいよう正しい向きに直します。
どの言語を読み取れますか?
日本語、英語、中国語(簡体字・繁体字)、韓国語、スペイン語、フランス語、ドイツ語、ポルトガル語、ロシア語、アラビア語、ベトナム語など24言語です。日本語と英語が混ざった書類のように、2つの言語を同時に選ぶこともできます。日本語は横書きに対応しています。
文字認識の精度はどのくらいですか?
きれいにスキャンされた印刷文字なら、ほとんどの単語を正しく読み取れます。200dpiの事務書類のスキャンを使ったテストでは、98%以上の文字を正しく認識しました。手書き、ごく小さな文字や装飾的な書体、ぼやけたスキャン、色付きの背景では精度が下がるので、大切な名前や数字は確認してください。
OCRにはどのくらい時間がかかりますか?
最近のパソコンなら1ページあたり数秒、スマホではその倍ほどです。初回は言語モデルの短いダウンロードが加わります。20ページのスキャンなら、たいてい1〜3分で終わります。処理中はタブを開いたままにしてください。すでにテキストがあるページは飛ばします。
テキストをTXTファイルで受け取れますか?
はい。検索できるPDFと一緒に、認識したすべてのテキストをページごとにTXTファイルでダウンロードでき、Word、Googleドキュメント、メールにそのまま貼り付けられます。写真やスクリーンショットには、同じ仕組みの「画像から文字起こし」をお使いください。
PDFはサーバーにアップロードされますか?
いいえ。ページはお使いの端末のブラウザ内で動くOCRエンジンが読み取るため、契約書や診断書、身分証などが私たちに送られたり、どこかに保存されたりすることはありません。このサイトからダウンロードするのはOCRエンジンと言語モデルだけで、1回きりでブラウザに保存されます。