Definir qué hace que dos entradas sean iguales
¿Son duplicados “Apple”, “apple” y “APPLE”? ¿Es “José” lo mismo que “José”? ¿El “Artículo 02” es equivalente al “Artículo 2”? La respuesta depende de los datos. Elija reglas de comparación antes de eliminar nada y conserve la lista original.
Identificar el separador real
Las listas pueden utilizar nuevas líneas, comas, tabulaciones, punto y coma o delimitadores personalizados. El texto separado por comas no es automáticamente una lista simple porque los valores entre comillas pueden contener comas y saltos de línea. Analice el CSV genuino en lugar de dividirlo a ciegas.
Un pegado visualmente simple puede contener registros de varias columnas o delimitadores incrustados.
Normalizar sólo lo irrelevante
- Recorte los espacios en blanco iniciales y finales.
- Contrae espacios repetidos cuando el espaciado no tiene significado.
- Normaliza los finales de línea.
- Elija una comparación que distinga entre mayúsculas y minúsculas o que no distinga entre mayúsculas y minúsculas.
- Utilice la normalización Unicode sólo cuando sea apropiado.
- Elimine los registros vacíos deliberadamente.
Los códigos, nombres de usuario, rutas de archivos y valores criptográficos pueden requerir una comparación exacta.
Clasificación natural y local
La clasificación de caracteres puede colocar el "elemento 10" antes del "elemento 2". La clasificación natural compara segmentos numéricos por valor. La intercalación basada en la configuración regional cambia la comparación de acentos y mayúsculas y minúsculas. El Intl.Collator de JavaScript admite la comparación sensible a la configuración regional y la clasificación de matrices moderna es estable, preservando el orden original de valores iguales.
| Mode | Lo mejor para | Risk |
|---|---|---|
| Carácter exacto | Identificadores técnicos | Orden numérico antinatural |
| Case-insensitive | Nombres generales | Los valores que distinguen entre mayúsculas y minúsculas pueden colisionar |
| numérico natural | Nombres de archivos y elementos numerados | Distinciones de cero a la izquierda |
| Locale-aware | Nombres en lenguaje humano | Los resultados varían según la configuración regional y las opciones. |
Utilice el clasificador y limpiador de texto de Jivaro
- Abra Clasificador y limpiador de texto.
- Pegue texto o importe TXT, CSV o Markdown.
- Seleccione el verdadero separador.
- Aplicar espacios en blanco y limpieza de líneas vacías.
- Elija comportamiento de duplicado y caso.
- Seleccione ordenación alfabética o natural.
- Recuentos de reseñas y una muestra de colisiones.
- Copie o descargue el resultado.
Mantenga un informe duplicado reversible
Recuento de entradas de registros, registros vacíos eliminados, recuento de duplicados, reglas de normalización, modo de clasificación, configuración regional y recuento de salida. Para datos de clientes o productos, conserve el valor canónico y todas las variantes asignadas a él.
Reformatear para el consumidor
Cambiar líneas a CSV requiere citar valores que contengan comas, comillas o saltos de línea. Las tablas de rebajas requieren tuberías de escape. La conversión de casos puede dañar identificadores y URL. Pruebe el formato final con su importador real.
Límites de lista grande
La clasificación y la deduplicación crean estructuras adicionales en memoria. Las entradas muy grandes pueden congelar una pestaña del navegador o exceder los límites del portapapeles. Partición sólo cuando los duplicados no puedan cruzar particiones; de lo contrario, utilice un flujo de trabajo de transmisión o de base de datos.
Lista de verificación de control de calidad
La entrada menos los vacíos y duplicados es igual a la salida.
Revise las variantes de mayúsculas y minúsculas, acentos, espacios y números.
Inspeccione 1, 2, 9, 10 y ceros a la izquierda.
Confirme acentos, símbolos, emoji y guiones.
Pruebe las comillas, el delimitador y los finales de línea.
Nunca haga que la salida limpia sea la única copia.
Reglas duplicadas específicas del dominio
Las direcciones de correo electrónico se pueden comparar sin distinguir entre mayúsculas y minúsculas en el dominio, pero no se deben reescribir casualmente en la parte local. Los números de teléfono necesitan el contexto del país. Los nombres de empresas pueden requerir un mapa de alias mantenido. Las rutas de los archivos pueden distinguir entre mayúsculas y minúsculas en un sistema y no en otro. Los nombres humanos no se pueden deduplicar de manera confiable únicamente con la ortografía.
Cuando el registro representa una persona, cuenta, pago o entidad legal, la limpieza de la lista no es una resolución de identidad. Conserve las coincidencias de candidatos y solicite revisión en lugar de eliminarlas automáticamente.
La clasificación estable admite flujos de trabajo de múltiples claves
Una clasificación estable permite que una segunda clasificación preserve el primer orden entre valores iguales. Por ejemplo, ordene los registros por nombre y luego ordene de manera estable por estado al estado del grupo mientras mantiene los nombres ordenados dentro de cada grupo. Documente la secuencia porque invertir el orden de clasificación cambia el resultado.
Preguntas frecuentes
Sólo cuando el caso es irrelevante. Los nombres de usuario, rutas, códigos e identificadores pueden distinguir entre mayúsculas y minúsculas.
La clasificación de caracteres compara las posiciones del texto; La clasificación natural compara segmentos numéricos por valor.
No. Los campos CSV pueden contener comas entre comillas y saltos de línea.
Registre recuentos, inspeccione variantes eliminadas, pruebe colisiones Unicode/case y conserve el original.
Aplicaciones relacionadas Jivaro
Ordena, limpia, elimina duplicados, transforma, formatea, copia y descarga listas de texto con ordenación regional y encabezados opcionales conservados, de forma privada en tu navegador.
Abrir aplicaciónFuentes y referencias
- Unicode Algoritmo de intercalaciónUnicode Consortium · referencia
- USegmentación de texto NicodeUnicode Consortium · referencia
- Intl.CollatorMDN Web Docs · referencia
- Array.prototype.sort()MDN Documentos web · referencia
- Clasificador y limpiador de textoJivaro · propio

