抽出はファイルの実際のコンテンツから始まります
PDF には、選択可能なテキスト、ページ画像、またはその両方が含まれる場合があります。 DOCX は XML という構造になっています。スプレッドシートには、値、数式、および書式設定がセルに保存されます。 HTML は、表示されるコンテンツとナビゲーションおよび非表示の要素を組み合わせます。画像にはOCRが必要です。
最初の質問は、機械可読テキストがすでに存在するかどうかです。通常、解析は OCR よりも高速かつ正確です。
| Source | 主な方法 | 主な制限事項 |
|---|---|---|
| 選択可能 PDF | テキストレイヤーの抽出 | 読む順序と列 |
| スキャンされた PDF/画像 | レンダリング、前処理、OCR | 解像度、言語、スキュー |
| DOCX/PPTX | パッケージの内容を解析する | テキストボックス、テーブル、メモ |
| XLSX/CSV | セル/レコードの読み取り | 数式、結合されたセル、引用符 |
| HTML | メイン/表示テキストの抽出 | ナビゲーションとリピートクローム |
Jivaro エクストラクターを 4 つのパスで使用する
OCR とドキュメント テキスト抽出ツール を開きます。
ネイティブ テキストとスキャンを識別します。
ページ、言語、処理オプションを選択します。
アーチファクトを除去し、サンプルを比較します。
テキストが正しい場合にのみチャンクします。
最初にネイティブの PDF テキストを使用してください
テキストを選択できる場合は、直接抽出することで文字認識エラーを回避できます。列、行末のハイフネーション、繰り返されるヘッダー、合字、表をチェックしてください。混合 PDF の場合は、ネイティブ ページを直接抽出し、OCR のみ画像のみのページを抽出します。
OCR のスキャンと画像
- 十分な解像度を使用してください。
- 回転と歪みを修正します。
- 細いストロークを削除せずにコントラストを向上させます。
- トリミングの境界線と背景が乱雑になります。
- 正しい言語を選択してください。
- 手書きは別個の、信頼性の低い問題として扱ってください。
積極的なしきい値処理により、句読点やアクセントが消去される可能性があります。難しいページをソースと比較してください。
Office ファイルとプレゼンテーション
DOCX およびプレゼンテーション ファイルには、表、ヘッダー、フッター、コメント、脚注、フローティング テキスト ボックス、ハイパーリンク、メモを含めることができます。抽出によりコンテンツが復元されます。レイアウトは再現されません。複雑なページを比較し、元のページを保持します。
スプレッドシートと CSV
表示される値、数式、またはその両方が必要かどうかを決定します。ヘッダー、シート名、レコード境界を保持します。 CSV では、区切り文字と引用符の認識が必要です。引用符で囲まれたフィールド内のカンマは新しい列ではありません。
行ラベル、列ヘッダー、シート、セル参照のない数値は役に立たなかったり、誤解を招く可能性があります。
HTML 抽出
生のテキストでは、メニュー、Cookie 通知、フッター、および関連リンクを繰り返すことができます。メインコンテンツを優先し、意味のあるリンクを保持します。自分が所有するページ、または使用許可を持っているページのみを処理します。
意味を書き換えずにクリーンアップ
- 繰り返されるヘッダーとフッターを削除します。
- 行末ハイフンで区切られた単語を結合します。
- スペースと改行を正規化します。
- ページ番号のみの行を削除します。
- チャンク化する前に段落を保存します。
グローバル置換では、正当な日付、数量、識別子、または書式設定が削除される可能性があります。
名前、番号、引用を確認する
- 重要な名前、番号、日付、参考文献を検索します。
- きれいなページ、難しいページ、表の多いページを比較してください。
- 珍しい単語や記号を調べます。
- ページ/セクションの範囲を確認します。
- 正式な引用のためにページ番号を保持します。
チャンクと最後にエクスポート
最初にクリーンアップしてから、単語または文字ごとに分割します。セマンティック境界を使用し、必要な場合にのみオーバーラップし、チャンクに番号を付け、ドキュメント/ページのコンテキストを保持します。単純なテキストの場合は TXT、編集の場合は DOCX、レコードの場合は CSV、構造の場合は HTML、複数の出力の場合は ZIP をエクスポートします。
きれいに見えるページを信頼するのではなく、OCR の品質を測定してください
結果抽出の場合は、代表的なサンプルを選択し、単純なエラー率を計算します。固定数の単語またはフィールドをソースと比較し、置換、省略、および挿入をカウントし、条件を記録します。小さなテキスト、表、低コントラストの領域、および名前または番号が記載された少なくとも 1 ページを含めます。 99% 文字の結果であっても、すべてのアカウント番号または薬剤名に重大なエラーが含まれる可能性があります。
信頼性が不十分な場合は、抽出されたテキストの横にページ画像を保存し、リスクの高いフィールドを人間が検証する必要があります。 OCR は、ソースを消去するためではなく、レビューを迅速化するために使用するのが最適です。
プライバシーとファイルの取り扱い
ローカル ブラウザー処理により、ドキュメントをアップロードする必要性が減りますが、ファイルはデバイス上、ブラウザーのメモリ内、およびダウンロードされた出力内に引き続き存在します。信頼できるコンピューターを使用し、素材が機密性の高い場合は無関係な拡張機能を閉じ、共有ダウンロード フォルダーを避け、プロジェクトの保持ルールに従って一時エクスポートを削除します。ブラウザのストレージが暗号化されたバックアップであると想定しないでください。
よくある質問
テキストを選択してコピーしてみてください。ページが 1 つの画像のように動作する場合、またはコピーされたテキストが使用できない場合は、OCR が必要になる可能性があります。
PDF およびプレゼンテーションでは、論理的な読み取りシーケンスではなく、位置決めされたテキストが保存される場合があります。
このワークフローは主に印刷されたテキストを対象としています。手書きの精度は大きく異なります。
クリーンアップと検証後、セマンティック境界と保持されたソース コンテキストが含まれます。
関連するJivaroアプリ
PDF、スキャン、画像、Office文書、表計算、HTML、CSV、Markdown、プレーンテキストから文字を抽出・確認し、検索可能なPDFまたは構造化テキストとしてローカルに書き出せます。
アプリを開く出典と参考文献
- Tesseract ユーザー マニュアルXXQPH0002QXZTesseract OCR · リファレンス
- ファイル APIMDN Web ドキュメント · リファレンス
- OCR およびドキュメント テキスト抽出ツールXXQPH0002QXZJivaro · ファーストパーティ

