Definir qué hace que dos entradas sean iguales

¿Son duplicados “Apple”, “apple” y “APPLE”? ¿Es “José” lo mismo que “José”? ¿El “Artículo 02” es equivalente al “Artículo 2”? La respuesta depende de los datos. Elija reglas de comparación antes de eliminar nada y conserve la lista original.

Identificar el separador real

Las listas pueden utilizar nuevas líneas, comas, tabulaciones, punto y coma o delimitadores personalizados. El texto separado por comas no es automáticamente una lista simple porque los valores entre comillas pueden contener comas y saltos de línea. Analice el CSV genuino en lugar de dividirlo a ciegas.

No aplane datos estructurados por accidente.

Un pegado visualmente simple puede contener registros de varias columnas o delimitadores incrustados.

Normalizar sólo lo irrelevante

  • Recorte los espacios en blanco iniciales y finales.
  • Contrae espacios repetidos cuando el espaciado no tiene significado.
  • Normaliza los finales de línea.
  • Elija una comparación que distinga entre mayúsculas y minúsculas o que no distinga entre mayúsculas y minúsculas.
  • Utilice la normalización Unicode sólo cuando sea apropiado.
  • Elimine los registros vacíos deliberadamente.

Los códigos, nombres de usuario, rutas de archivos y valores criptográficos pueden requerir una comparación exacta.

Clasificación natural y local

La clasificación de caracteres puede colocar el "elemento 10" antes del "elemento 2". La clasificación natural compara segmentos numéricos por valor. La intercalación basada en la configuración regional cambia la comparación de acentos y mayúsculas y minúsculas. El Intl.Collator de JavaScript admite la comparación sensible a la configuración regional y la clasificación de matrices moderna es estable, preservando el orden original de valores iguales.

Modos de clasificación
ModeLo mejor paraRisk
Carácter exactoIdentificadores técnicosOrden numérico antinatural
Case-insensitiveNombres generalesLos valores que distinguen entre mayúsculas y minúsculas pueden colisionar
numérico naturalNombres de archivos y elementos numeradosDistinciones de cero a la izquierda
Locale-awareNombres en lenguaje humanoLos resultados varían según la configuración regional y las opciones.

Utilice el clasificador y limpiador de texto de Jivaro

  1. Abra Clasificador y limpiador de texto.
  2. Pegue texto o importe TXT, CSV o Markdown.
  3. Seleccione el verdadero separador.
  4. Aplicar espacios en blanco y limpieza de líneas vacías.
  5. Elija comportamiento de duplicado y caso.
  6. Seleccione ordenación alfabética o natural.
  7. Recuentos de reseñas y una muestra de colisiones.
  8. Copie o descargue el resultado.

Mantenga un informe duplicado reversible

Recuento de entradas de registros, registros vacíos eliminados, recuento de duplicados, reglas de normalización, modo de clasificación, configuración regional y recuento de salida. Para datos de clientes o productos, conserve el valor canónico y todas las variantes asignadas a él.

Reformatear para el consumidor

Cambiar líneas a CSV requiere citar valores que contengan comas, comillas o saltos de línea. Las tablas de rebajas requieren tuberías de escape. La conversión de casos puede dañar identificadores y URL. Pruebe el formato final con su importador real.

Límites de lista grande

La clasificación y la deduplicación crean estructuras adicionales en memoria. Las entradas muy grandes pueden congelar una pestaña del navegador o exceder los límites del portapapeles. Partición sólo cuando los duplicados no puedan cruzar particiones; de lo contrario, utilice un flujo de trabajo de transmisión o de base de datos.

Lista de verificación de control de calidad

CountConciliar totales

La entrada menos los vacíos y duplicados es igual a la salida.

CollisionsInspeccionar fusiones

Revise las variantes de mayúsculas y minúsculas, acentos, espacios y números.

Ordercomprobar los límites

Inspeccione 1, 2, 9, 10 y ceros a la izquierda.

EncodingConsultar texto multilingüe

Confirme acentos, símbolos, emoji y guiones.

FormatImportar la salida

Pruebe las comillas, el delimitador y los finales de línea.

RollbackMantenga la fuente

Nunca haga que la salida limpia sea la única copia.

Reglas duplicadas específicas del dominio

Las direcciones de correo electrónico se pueden comparar sin distinguir entre mayúsculas y minúsculas en el dominio, pero no se deben reescribir casualmente en la parte local. Los números de teléfono necesitan el contexto del país. Los nombres de empresas pueden requerir un mapa de alias mantenido. Las rutas de los archivos pueden distinguir entre mayúsculas y minúsculas en un sistema y no en otro. Los nombres humanos no se pueden deduplicar de manera confiable únicamente con la ortografía.

Cuando el registro representa una persona, cuenta, pago o entidad legal, la limpieza de la lista no es una resolución de identidad. Conserve las coincidencias de candidatos y solicite revisión en lugar de eliminarlas automáticamente.

La clasificación estable admite flujos de trabajo de múltiples claves

Una clasificación estable permite que una segunda clasificación preserve el primer orden entre valores iguales. Por ejemplo, ordene los registros por nombre y luego ordene de manera estable por estado al estado del grupo mientras mantiene los nombres ordenados dentro de cada grupo. Documente la secuencia porque invertir el orden de clasificación cambia el resultado.

Preguntas frecuentes

¿Deberían los duplicados ignorar las mayúsculas y minúsculas?

Sólo cuando el caso es irrelevante. Los nombres de usuario, rutas, códigos e identificadores pueden distinguir entre mayúsculas y minúsculas.

¿Por qué el punto 10 precede al punto 2?

La clasificación de caracteres compara las posiciones del texto; La clasificación natural compara segmentos numéricos por valor.

¿Puedo dividir cualquier texto entre comas?

No. Los campos CSV pueden contener comas entre comillas y saltos de línea.

¿Cómo verifico la deduplicación?

Registre recuentos, inspeccione variantes eliminadas, pruebe colisiones Unicode/case y conserve el original.

Aplicaciones relacionadas Jivaro

Escritura y textoClasificador y limpiador de texto

Ordena, limpia, elimina duplicados, transforma, formatea, copia y descarga listas de texto con ordenación regional y encabezados opcionales conservados, de forma privada en tu navegador.

Abrir aplicación

Fuentes y referencias