2 つのエントリを同一にするものを定義する

「Apple」、「apple」、「APPLE」は重複していますか? 「ホセ」は「ホセ」と同じですか? 「品目02」は「品目2」に相当しますか?答えはデータによって異なります。何かを削除する前に比較ルールを選択し、元のリストを保持します。

実際の区切り記号を特定する

リストでは、改行、カンマ、タブ、セミコロン、またはカスタム区切り文字を使用できます。引用符で囲まれた値にはカンマや改行が含まれる可能性があるため、カンマ区切りのテキストは自動的には単純なリストにはなりません。やみくもに分割するのではなく、本物の CSV を解析します。

構造化データを誤ってフラット化しないでください。

視覚的に単純な貼り付けには、複数列のレコードや埋め込まれた区切り文字が含まれる場合があります。

無関係なものだけを正規化する

  • 先頭と末尾の空白をトリミングします。
  • 間隔に意味がない場合、繰り返されるスペースを折りたたむ。
  • 行末を正規化します。
  • 大文字と小文字を区別する比較または大文字と小文字を区別しない比較を選択します。
  • Unicode 正規化は、適切な場合にのみ使用してください。
  • 空のレコードを意図的に削除します。

コード、ユーザー名、ファイル パス、および暗号化値は、正確な比較が必要な場合があります。

自然でロケールを意識した並べ替え

文字ソートでは、「項目 10」を「項目 2」の前に配置できます。自然な並べ替えでは、数値セグメントを値で比較します。ロケールを認識した照合により、アクセントと大文字小文字の比較方法が変わります。 JavaScript の Intl.Collat​​or は、ロケールに依存した比較をサポートしており、最新の配列の並べ替えは安定しており、等しい値の元の順序が維持されます。

ソートモード
Modeこんな方に最適Risk
正確な性格技術識別子不自然な数値順序
Case-insensitive一般的な名称大文字と小文字を区別する値が衝突する可能性がある
自然数値ファイル名と番号付き項目先頭のゼロの区別
Locale-aware人間の言語の名前結果はロケール/オプションによって異なります

Jivaro のテキスト ソーターおよびクリーナーを使用する

  1. テキスト ソーター & クリーナー を開きます。
  2. テキストを貼り付けるか、TXT、CSV、またはマークダウンをインポートします。
  3. 正しい区切り文字を選択します。
  4. ホワイトスペースと空行のクリーンアップを適用します。
  5. 重複とケースの動作を選択します。
  6. アルファベット順または自然な並べ替えを選択します。
  7. 衝突の数とサンプルを確認します。
  8. 結果をコピーまたはダウンロードします。

復元可能な重複レポートを保持する

レコード入力数、削除された空のレコード、重複数、正規化ルール、ソート モード、ロケール、および出力数。顧客または製品データの場合は、正規値とそれにマッピングされたすべてのバリアントを保存します。

消費者向けの再フォーマット

行を CSV に変更するには、コンマ、引用符、または改行を含む値を引用符で囲む必要があります。マークダウン テーブルにはエスケープ パイプが必要です。大文字と小文字を変換すると、識別子と URL が破損する可能性があります。実際のインポーターを使用して最終形式をテストします。

大きなリストの制限

並べ替えと重複排除により、追加のメモリ内構造が作成されます。非常に大きな入力を行うと、ブラウザーのタブがフリーズしたり、クリップボードの制限を超えたりする可能性があります。重複がパーティションをまたぐことができない場合にのみパーティションを作成します。それ以外の場合は、ストリーミング ワークフローまたはデータベース ワークフローを使用します。

品質管理チェックリスト

Count合計を調整する

入力マイナスは空であり、複製は出力と等しくなります。

Collisionsマージの検査

大文字と小文字、アクセント、スペース、数値の変化を確認してください。

Order境界をチェックする

1、2、9、10、および先行ゼロを検査します。

Encoding多言語テキストをチェックする

アクセント、記号、絵文字、スクリプトを確認します。

Format出力をインポートする

引用符、区切り文字、行末をテストします。

Rollbackソースは保管しておいてください

クリーンな出力を唯一のコピーにしないでください。

ドメイン固有の重複ルール

電子メール アドレスは、ドメイン内では大文字と小文字を区別せずに比較できますが、ローカル部分ではむやみに書き換えないでください。電話番号には国のコンテキストが必要です。会社名には、別名マップの維持が必要な場合があります。ファイル パスは、あるシステムでは大文字と小文字が区別され、別のシステムでは区別されないことがあります。人間の名前は、スペルだけでは確実に重複を排除できません。

レコードが個人、アカウント、支払い、または法人を表す場合、リストのクリーンアップは ID 解決ではありません。候補の一致を保持し、自動的に削除するのではなくレビューを必要とします。

安定したソートでマルチキーワークフローをサポート

安定した並べ替えにより、2 番目の並べ替えで同じ値の間で最初の順序を維持できます。たとえば、レコードを名前で並べ替えてから、各グループ内で名前の順序を維持しながら、グループ ステータスまでステータスごとに安定して並べ替えます。並べ替え順序を逆にすると結果が変わるため、順序を文書化してください。

よくある質問

重複では大文字と小文字を区別する必要がありますか?

大文字と小文字が関係ない場合のみ。ユーザー名、パス、コード、および識別子では、大文字と小文字が区別される場合があります。

なぜ項目 10 が項目 2 よりも前にあるのですか?

文字の並べ替えはテキストの位置を比較します。自然な並べ替えでは、数値セグメントを値で比較します。

テキストをカンマで区切ることはできますか?

いいえ。CSV フィールドには引用符で囲まれたカンマと改行を含めることができます。

重複排除を確認するにはどうすればよいですか?

カウントを記録し、削除されたバリアントを検査し、Unicode/大文字と小文字の衝突をテストし、オリジナルを保持します。

関連するJivaroアプリ

ライティングとテキストテキストソーター&クリーナー

地域に応じた並べ替えと任意のヘッダー保持に対応し、テキスト一覧の整列、クリーニング、重複除去、変換、整形、コピー、ダウンロードをブラウザー内で安全に行えます。

アプリを開く

出典と参考文献