← 記事一覧へ

スキャンしたPDFや写真から文字を読み取るOCRを追加しました

nova-pdf-converterリリース

Nova PDF変換OCR(画像から文字起こし) を追加しました。スキャンしたPDFや、書類を撮った写真から、選択・検索できるテキストを取り出せます。

スキャンした書類からテキストを取り出す様子

できること

  • スキャンPDFと画像の両方に対応: PDFはページを画像として描き直してから認識します。PNGやJPEGの写真をそのまま渡すこともできます
  • 11言語: 日本語・英語・中国語(簡体字/繁体字)・韓国語・スペイン語・フランス語・ドイツ語・ポルトガル語・イタリア語・ロシア語から選べます
  • 結果はそのままコピー・保存: 読み取ったテキストをワンクリックでコピーするか、テキストファイルとしてダウンロードできます
  • 複数ページのPDF: 先頭50ページまでをまとめて処理し、進捗をページ単位で表示します

もともとあった「テキスト抽出」は、PDFの中に入っているテキスト層を取り出すツールです。スキャンしたPDFは中身が画像なので、そちらでは何も取れません。その場合はOCRへ案内するようにしてあります。

使い方

  1. OCRツール を開きます
  2. PDFまたは画像をドロップします
  3. 認識する言語を選び、「文字を読み取る」を押します
  4. 結果をコピーするか、テキストファイルとして保存します

登録もインストールも不要です。初回だけ認識データのダウンロードが発生します(2回目以降はキャッシュされます)。

データの扱いについて

認識はすべてブラウザの中で実行されます。PDFも画像も、読み取ったテキストも、サーバーに送信されることはありません。処理はお使いの端末の性能に依存しますが、そのぶんファイルは外に出ません。

すべての機能を無料で使えます。

こんなときに

  • 紙の書類をスキャンしたPDFから、必要な部分だけテキストとして引用したい
  • 撮影した資料やホワイトボードの内容を、検索できるテキストにしておきたい
  • 画像として保存された古い資料を、あとから検索できる形に直したい

👉 OCRを使ってみる

Novare Orbis では、ブラウザ完結の無料ツールを他にも公開しています。ツール一覧はこちら