#089 · Herramienta para desarrolladores

CSV Deduplicator

Elimina duplicados de un CSV sin perder la primera aparición de cada registro. Puedes comparar la fila completa o indicar una o varias columnas clave separadas por comas, por ejemplo email,tenant_id. También es posible ignorar mayúsculas y espacios exteriores al construir la clave, mientras la salida conserva los valores originales de la primera fila encontrada.

Datos de entrada

Procesamiento local
Espacio publicitario

Cómo usar esta herramienta para desarrolladores

  1. Pega el CSV.
  2. Deja el campo de columnas vacío para comparar la fila completa o indica nombres separados por comas.
  3. Decide si la clave debe ignorar mayúsculas y espacios exteriores.
  4. Ejecuta y revisa cuántos registros fueron eliminados.

Qué hace esta herramienta para desarrolladores

Construye una clave de comparación por fila o por columnas seleccionadas y conserva solo la primera fila que produce cada clave. La normalización afecta a la comparación, no a los valores que se escriben en la salida.

Las columnas clave se convierten a índices de cabecera. Cada registro genera una clave compuesta con un separador interno; un Set detecta las claves ya vistas en tiempo lineal aproximado.

Dos filas con la misma clave pero datos distintos en columnas no clave se consideran duplicadas. La primera aparición es la que se conserva.

Ejemplo

Clave: email · Ignorar mayúsculas: sí ana@example.com y ANA@example.com → se conserva la primera fila

Casos de uso

  • Eliminar contactos repetidos por email.
  • Deduplicar eventos por identificador compuesto.
  • Limpiar exports concatenados.
  • Detectar claves repetidas conservando el primer registro.

Consejos para obtener resultados fiables

  • Usa claves realmente identificadoras, no columnas descriptivas inestables.
  • Incluye tenant, fecha o contexto si un identificador puede repetirse legítimamente.
  • Revisa los eliminados antes de sobrescribir un dataset original.
  • Desactiva la normalización de mayúsculas cuando el sistema destino sea case-sensitive.

Detalles del procesamiento

La comparación utiliza un Set de claves normalizadas, lo que evita búsquedas cuadráticas para la mayoría de datasets. Los registros originales no se modifican.

No fusiona campos de registros duplicados ni selecciona “el más reciente”. Conserva siempre la primera aparición según el orden del CSV.

Preguntas frecuentes

¿Cómo eliminar duplicados CSV por una columna como email?

Escribe email en “Columnas clave”. Cada valor repetido de esa columna se considera la misma clave y se conserva la primera fila.

¿Puedo deduplicar usando dos columnas a la vez?

Sí. Escribe los nombres separados por comas, por ejemplo tenant_id,email. La combinación de ambas columnas forma la clave.

¿Ignorar mayúsculas modifica el texto del CSV de salida?

No. Solo normaliza la clave usada para comparar. La fila conservada mantiene exactamente sus valores originales.

¿Qué fila se conserva cuando hay varios duplicados?

Se conserva la primera aparición en el orden actual del CSV y se descartan las posteriores con la misma clave.

¿El deduplicador combina datos no vacíos de filas repetidas?

No. No hace merge de campos; si necesitas consolidar información de varias filas, debes aplicar una regla de fusión específica fuera de esta herramienta.

Resumen técnico

ElementoDetalle
ClaveFila completa o columnas
RetenciónPrimera aparición
NormalizaciónCase/trim opcionales
ComplejidadSet de claves