4種類の書類比較
| 比較タイプ | こんな方に最適 | 保存または検出 | 欠けているもの |
|---|---|---|---|
| プレーンテキストの差分 | コード、マークダウン、コピーされた句、CSV、単純なテキスト | 挿入、削除、置換、行または単語の変更 | 視覚的な書式設定、スタイル、オブジェクト、ページ レイアウト |
| セマンティックまたはレッドラインの比較 | 契約、ポリシー、草案、編集レビュー | 文脈内での意味のある単語やフレーズの変化 | ピクセルレベルのレイアウトといくつかのドキュメントのメタデータ |
| フォーマットを意識したドキュメントの比較 | DOCX リビジョン、スタイル付きレポート、法的ブラックライン | テキストと選択した書式設定、コメント、移動、ヘッダー、または表 | アプリケーション固有の構造と設定に依存する場合があります |
| 視覚的なPDFの比較 | 印刷可能なファイル、グラフィック、フォーム、ページ デザイン | レンダリングされたテキスト、画像、ページ要素、背景、配置 | 基礎となる意味構造と OCR の信頼度 |
Microsoft Word の 法的黒線比較 は、テキスト、コメント、書式設定、その他のリビジョンを比較し、ソース ファイルを変更せずに結果を 3 番目の文書に配置できます。 Adobe Acrobat の比較ツールは、テキスト、画像、グラフィック、ヘッダー、フッター、注釈、書式設定、背景など、レンダリングされた PDF の違いに焦点を当てています。これらは、さまざまな証拠のためのさまざまな手段です。
結果的なレビューを行うには、コンテンツレベルの比較と形式または視覚的なチェックを組み合わせます。赤い線は、その単語が何をしたかを示します。レンダリングされた比較により、ページが何をしたかがわかります。
書式設定が失われる理由
DOCX ファイルは、後で装飾が適用されたフラットなテキスト ストリームではありません。 Microsoft の WordprocessingML ドキュメントでは、1 つ以上の runs を含む段落について説明しています。各実行は、書式設定などのテキスト共有プロパティの領域です。一般的なドキュメントには、スタイル、コメント、ヘッダー、フッター、脚注、文末脚注、設定、関係、メディア、その他の構造の個別のパッケージ パーツも含まれています。
これは、2 つのファイルが同じ文を表示しながら、内部的には異なる表現ができることを意味します。表示される 1 つの単語は、その一部が太字、リンク、追跡、またはフィールド生成であるため、複数の実行に分割される場合があります。逆に、表示テキストを抽出するツールは、ページを生成したスタイルとパッケージの関係を失いながらも、文言を正しく復元する可能性があります。
PDF は逆の問題を引き起こします。これは、固定された視覚的な結果を説明するように設計されています。テキストが保存される順序は、自然な読み取り順序と一致しない可能性があり、OCR が適用されるまで、スキャンされたページには選択可能なテキストがまったく含まれていない可能性があります。ピクセルレベルの比較では視覚的な変化を検出できますが、異なる方法でラップされた 2 つの段落が同一のコンテンツを表現していることを理解できない場合があります。
したがって、「書式を失わずに」とは、次の 2 つのいずれかを意味します。
- ソース ファイルは変更されず、比較レポートではコンテンツと形式の変更が明確に区別されます。
- 結果は、元の構造とリビジョンを表現できるフォーマット対応アプリケーション内で生成されます。
任意の DOCX または PDF のすべての機能を保持できるプレーンテキストのレッドラインはありません。ただし、オリジナルを保存し、レビュー担当者にテキストの変更を迅速にローカルに表示することができます。
比較する前にファイルを準備する
- 信頼できるオリジナルを識別します。
final-v7-revized-2.docxなどのファイル名に依存しないでください。ソース、タイムスタンプ、作成者、承認状態を確認します。 - 不変のコピーを保持します。 重複または 3 番目の結果を生成する比較から作業します。保管過程が重要な場合は、オリジナルをハッシュまたはアーカイブします。
- 追跡された変更を解決するかメモしてください。 既存の未解決のリビジョンがあると、後の比較が曖昧になる可能性があります。 Microsoft は、バージョンに追跡された変更が既に含まれている場合、Word は比較する前に変更を受け入れるように要求する可能性があることを警告します。
- 両端揃えの場合のみ正規化します。 両方のドキュメントをプレーン テキストに変換すると、書式設定のノイズが削除されますが、証拠も削除されます。正規化された比較コピーを作成する場合でも、オリジナルは保持してください。
- 文字、単語、行、またはブロックの粒度を選択します。 文字レベルの差分は、識別子と数値に役立ちます。単語レベルの差分は散文の方が簡単です。行レベルの差分はコードと構造化テキストに適合します。
- 除外を定義します。 ヘッダー、フッター、コメント、フィールド、テーブル、画像、スタイル、および空白を変更としてカウントするかどうかを決定します。
レビュープロセスは、オリジナル、改訂、比較結果、決定記録など、加算的なものである必要があります。比較出力はドキュメントに関する証拠であり、ドキュメントの置き換えではありません。
信頼性の高い比較ワークフロー
元のファイルと変更されたファイルの不変のコピーを保持します。
フォーマット対応アプリケーションを使用するか、テキストをローカルに抽出してコンテンツをレビューします。
適切な粒度で並列ビューとインライン ビューを生成します。
レンダリングされたファイル内のテーブル、リスト、番号付け、ヘッダー、グラフィックス、および改ページを検査します。
比較の概要を受け入れ、拒否し、注釈を付けてエクスポートします。
パスでレビューします。最初のパスでは、実質的なコンテンツが変更されたかどうかが尋ねられます。 2 つ目は、書式設定の変更によって意味、階層、使いやすさが変わるかどうかを尋ねます。 3 番目のチェックでは、識別子、番号、日付、名前、参照、および義務がチェックされます。最後のパスでは、レンダリングされた出力を検証します。
長い文書の場合は、定義、範囲、支払い、終了、責任、プライバシー、セキュリティ、保証、証拠、相互参照など、リスクの高い領域を優先します。 diff を使用すると、変更された単語を見つけることができます。その言葉が取引を変えるかどうかを判断できるのはドメインレビューだけです。
Jivaro ドキュメント比較およびレッドライン ツールを使用する
Jivaro の ドキュメント比較およびレッドライン ツール は、ローカルのコンテンツ レベルのレビュー用に設計されています。貼り付けられたテキスト、TXT、マークダウン、CSV、HTML、DOCX テキスト抽出、および選択可能なテキスト PDF 抽出を、並列およびインライン朱書きビューでサポートします。
ベースラインドキュメントを元のペインに貼り付けるか、開きます。抽出されたテキストが完全で、予期した順序であることを確認します。
2 番目のファイルまたはテキストをロードします。 PDF の場合は、テキストが選択可能であることを確認します。スキャンされたページには、最初に OCR が必要です。
コンテキストについては並列レビューを使用し、挿入と削除のコンパクトなシーケンスにはインラインのレッドラインを使用します。
カウントと変更された箇所を確認し、重要な用語、数字、名前、義務を検索します。
朱書きの横にある元のファイルを開いて、表、番号付け、スタイル、画像、ヘッダー、レイアウトを確認します。
ソース バージョンとの比較または概要とレビュー担当者の決定を保存します。
これは、ローカルでの高速な朱書きとテキスト比較のワークスペースです。すべての DOCX スタイル、埋め込みオブジェクト、追跡されたリビジョン、または PDF ピクセルを再現するとは主張しません。これを使用して文言の変更を見つけてから、書式設定とレイアウトの証拠としてネイティブ ドキュメントまたは視覚的な比較を使用します。
DOCX、法的ブラックライン、および追跡された変更
変更の追跡と比較は、関連する異なる問題を解決します。変更履歴は、ドキュメント内で行われた編集内容を記録します。 Compare は、2 つのバージョン間の差異を事後的に再構築します。 Microsoft のガイダンスでは、法的ブラックライン オプションにより 3 番目の文書が作成され、コメント、書式設定、およびその他のリビジョン タイプのオプションを使用して、文字レベルまたは単語レベルでの変更を比較できることが示されています。
レビュー担当者が 1 つの管理された文書内で作業しており、帰属が重要な場合は、変更の追跡を使用します。信頼できる改訂履歴のない改訂されたファイルを受け取った場合、2 つの分岐が分岐した場合、またはバージョン間で何が変更されたかを証明する必要がある場合は、比較を使用します。
すべての変更を受け入れる前に、確認ペインとフィルタリング設定を調べてください。書式設定やレビュー担当者マークアップを非表示にしても、それらは削除されません。最終的な配信では、未解決の変更やコメントが残っていないこと、および「クリーンな」ビューが実際にクリーンであることを確認します。
PDF とスキャンされたドキュメント
PDF の比較には 2 つのチェックが必要です。
- Textual: 単語、数値、フィールド、または注釈が変更されましたか?
- Visual: 画像、位置、フォント、ページネーション、ヘッダー、背景、またはグラフィックスは変更されましたか?
選択可能な PDF は、多くの場合、テキストの朱書き用に抽出できます。スキャンされた PDF には OCR が必要ですが、OCR では不確実性が生じます。一般的なエラーには、文字の混同、列の欠落、行の結合、ハイフネーション、読み取り順序の誤りなどがあります。 OCR は、ページの完全な表現としてではなく、検証が必要な転写として扱います。
印刷用文書、財務文書、エンジニアリング文書、または規制文書の場合は、テキスト レビューに加えて、視覚的な PDF 比較を使用します。 Adobe のファイル比較機能は、変更の種類を明示的に分離し、概要を生成します。他のツールでも同様の作業を実行できますが、原則は同じです。視覚的な証拠は視覚的な証拠としてレビューされる必要があります。
一か八かのレビューには差分以上のものが必要です
契約、ポリシー、技術仕様、規制された申請、および安全手順には、管理されたレビュー記録が必要です。追加:
- 文書の識別子、バージョン、日付、ソースの場所。
- 指名されたレビュー担当者とレビュー範囲。
- カテゴリとリスク評価を変更する。
- レッドラインの調査結果と承認決定の間のリンク。
- 相互参照、定義された用語、展示物、および署名の検証。
- レンダリングされたファイルの最終チェック。
- 問題に適した保存ルール。
自動比較により、対象範囲と速度が向上します。それは判断に代わるものではありません。 「may」から「shall」への 1 つの単語の変更が、何百もの書式の違いよりも重要になる可能性があります。逆に、小数点や非表示の列を移動すると、見た目が小さくなり、操作が厳しくなる可能性があります。
よくある比較の間違い
レッドラインは内部的には正しいですが、間違ったバージョンの質問に答えています。
プレーン テキストに変換すると、レビュー担当者が重要かどうかを判断する前に証拠が削除されます。
認識エラーは作成者の変更と誤認されます。
マークアップ フィルターは、未解決の変更を削除せずに非表示にします。
「12 の変更」の概要では、深刻さや意味については何も語られていません。
ソース バージョンが上書きされているため、結果を監査できません。
よくある質問
はい。テキスト抽出および朱書きツールは表示される文言を比較でき、一部のサードパーティ ツールは DOCX 構造を理解します。 Word 固有の完全な書式設定、コメント、フィールド、および追跡されたリビジョンについては、Word 独自の比較機能が最も強力なリファレンスとなります。
いいえ。ソース ファイルを保存し、コンテンツの変更を表示できますが、すべてのスタイル、テーブル、フィールド、オブジェクト、ヘッダー、ページ レイアウトの変更を再現するわけではありません。
元の文書と改訂された文書の違いを示す比較結果です。 Microsoft Word では、両方のソースを変更せずに、追跡された相違点を含む 3 番目の文書を作成できます。
OCR を実行して、検索可能なテキストを作成し、認識精度を確認し、抽出されたテキストを比較し、視覚的なページの比較を個別に検査します。 OCR エラーはドキュメントの編集として扱わないでください。
識別子、数値、小さな技術的変更には文字レベルの比較を使用します。散文の場合は読みやすいため、単語レベルの比較を使用します。行レベルの比較はコードと構造化テキストに適合します。
データ パスを理解している場合のみ。機密性の高いドラフトについてはローカル処理を優先し、ファイルがアップロードまたは保持されているかどうかを確認し、法律情報、顧客情報、従業員情報、または規制情報に関する組織のルールに従います。
関連するJivaroアプリ
出典と参考文献
- Microsoft サポート: 法的黒線を使用して文書の相違点を比較するXXQPH0002QXZMicrosoft サポート · リファレンス
- Microsoft サポート: Word の変更を追跡ZZQPH0002QXZMicrosoft サポート · リファレンス
- Microsoft Learn: WordprocessingML ドキュメントの構造XXQPH0002QXZMicrosoft Learn · リファレンス
- Adobe Acrobat: PDF ファイルの比較Adobe · リファレンス

