抽出はファイルの実際のコンテンツから始まります

PDF には、選択可能なテキスト、ページ画像、またはその両方が含まれる場合があります。 DOCX は XML という構造になっています。スプレッドシートには、値、数式、および書式設定がセルに保存されます。 HTML は、表示されるコンテンツとナビゲーションおよび非表示の要素を組み合わせます。画像にはOCRが必要です。

最初の質問は、機械可読テキストがすでに存在するかどうかです。通常、解析は OCR よりも高速かつ正確です。

ソース別の方法
Source主な方法主な制限事項
選択可能 PDFテキストレイヤーの抽出読む順序と列
スキャンされた PDF/画像レンダリング、前処理、OCR解像度、言語、スキュー
DOCX/PPTXパッケージの内容を解析するテキストボックス、テーブル、メモ
XLSX/CSVセル/レコードの読み取り数式、結合されたセル、引用符
HTMLメイン/表示テキストの抽出ナビゲーションとリピートクローム

Jivaro エクストラクターを 4 つのパスで使用する

OCR とドキュメント テキスト抽出ツール を開きます。

1読み込みと分類

ネイティブ テキストとスキャンを識別します。

2Extract

ページ、言語、処理オプションを選択します。

3クリーニングと検証

アーチファクトを除去し、サンプルを比較します。

4分割してエクスポートする

テキストが正しい場合にのみチャンクします。

最初にネイティブの PDF テキストを使用してください

テキストを選択できる場合は、直接抽出することで文字認識エラーを回避できます。列、行末のハイフネーション、繰り返されるヘッダー、合字、表をチェックしてください。混合 PDF の場合は、ネイティブ ページを直接抽出し、OCR のみ画像のみのページを抽出します。

OCR のスキャンと画像

  1. 十分な解像度を使用してください。
  2. 回転と歪みを修正します。
  3. 細いストロークを削除せずにコントラストを向上させます。
  4. トリミングの境界線と背景が乱雑になります。
  5. 正しい言語を選択してください。
  6. 手書きは別個の、信頼性の低い問題として扱ってください。

積極的なしきい値処理により、句読点やアクセントが消去される可能性があります。難しいページをソースと比較してください。

Office ファイルとプレゼンテーション

DOCX およびプレゼンテーション ファイルには、表、ヘッダー、フッター、コメント、脚注、フローティング テキスト ボックス、ハイパーリンク、メモを含めることができます。抽出によりコンテンツが復元されます。レイアウトは再現されません。複雑なページを比較し、元のページを保持します。

スプレッドシートと CSV

表示される値、数式、またはその両方が必要かどうかを決定します。ヘッダー、シート名、レコード境界を保持します。 CSV では、区切り文字と引用符の認識が必要です。引用符で囲まれたフィールド内のカンマは新しい列ではありません。

コンテキストを保持します。

行ラベル、列ヘッダー、シート、セル参照のない数値は役に立たなかったり、誤解を招く可能性があります。

HTML 抽出

生のテキストでは、メニュー、Cookie 通知、フッター、および関連リンクを繰り返すことができます。メインコンテンツを優先し、意味のあるリンクを保持します。自分が所有するページ、または使用許可を持っているページのみを処理します。

意味を書き換えずにクリーンアップ

  • 繰り返されるヘッダーとフッターを削除します。
  • 行末ハイフンで区切られた単語を結合します。
  • スペースと改行を正規化します。
  • ページ番号のみの行を削除します。
  • チャンク化する前に段落を保存します。

グローバル置換では、正当な日付、数量、識別子、または書式設定が削除される可能性があります。

名前、番号、引用を確認する

  1. 重要な名前、番号、日付、参考文献を検索します。
  2. きれいなページ、難しいページ、表の多いページを比較してください。
  3. 珍しい単語や記号を調べます。
  4. ページ/セクションの範囲を確認します。
  5. 正式な引用のためにページ番号を保持します。

チャンクと最後にエクスポート

最初にクリーンアップしてから、単語または文字ごとに分割します。セマンティック境界を使用し、必要な場合にのみオーバーラップし、チャンクに番号を付け、ドキュメント/ページのコンテキストを保持します。単純なテキストの場合は TXT、編集の場合は DOCX、レコードの場合は CSV、構造の場合は HTML、複数の出力の場合は ZIP をエクスポートします。

きれいに見えるページを信頼するのではなく、OCR の品質を測定してください

結果抽出の場合は、代表的なサンプルを選択し、単純なエラー率を計算します。固定数の単語またはフィールドをソースと比較し、置換、省略、および挿入をカウントし、条件を記録します。小さなテキスト、表、低コントラストの領域、および名前または番号が記載された少なくとも 1 ページを含めます。 99% 文字の結果であっても、すべてのアカウント番号または薬剤名に重大なエラーが含まれる可能性があります。

信頼性が不十分な場合は、抽出されたテキストの横にページ画像を保存し、リスクの高いフィールドを人間が検証する必要があります。 OCR は、ソースを消去するためではなく、レビューを迅速化するために使用するのが最適です。

プライバシーとファイルの取り扱い

ローカル ブラウザー処理により、ドキュメントをアップロードする必要性が減りますが、ファイルはデバイス上、ブラウザーのメモリ内、およびダウンロードされた出力内に引き続き存在します。信頼できるコンピューターを使用し、素材が機密性の高い場合は無関係な拡張機能を閉じ、共有ダウンロード フォルダーを避け、プロジェクトの保持ルールに従って一時エクスポートを削除します。ブラウザのストレージが暗号化されたバックアップであると想定しないでください。

よくある質問

PDF に OCR が必要かどうかを確認するにはどうすればよいですか?

テキストを選択してコピーしてみてください。ページが 1 つの画像のように動作する場合、またはコピーされたテキストが使用できない場合は、OCR が必要になる可能性があります。

なぜ読む順番が間違っているのでしょうか?

PDF およびプレゼンテーションでは、論理的な読み取りシーケンスではなく、位置決めされたテキストが保存される場合があります。

OCR は手書き文字を読むことができますか?

このワークフローは主に印刷されたテキストを対象としています。手書きの精度は大きく異なります。

テキストをいつ分割する必要がありますか?

クリーンアップと検証後、セマンティック境界と保持されたソース コンテキストが含まれます。

関連するJivaroアプリ

ドキュメントツールOCR およびドキュメント テキスト抽出ツール

PDF、スキャン、画像、Office文書、表計算、HTML、CSV、Markdown、プレーンテキストから文字を抽出・確認し、検索可能なPDFまたは構造化テキストとしてローカルに書き出せます。

アプリを開く

出典と参考文献