Todos los artículos

Ordenar y eliminar líneas duplicadas: para qué sirve

Durante siglos, la «ñ» se consideró en español una letra propia e independiente de la «n», y los diccionarios la ordenaban después de toda la «n» — así que "ñu" aparecía después de "nutria", no intercalado alfabéticamente por código de carácter. La RAE simplificó esta regla en 1994, pero muchas herramientas de ordenación que comparan por código Unicode puro siguen sin coincidir con ese criterio "de diccionario" que muchos hispanohablantes esperan de forma intuitiva.

Orden alfabético frente a orden numérico

La ordenación alfabética (lexicográfica) compara cadenas carácter por carácter, como texto. Por eso la cadena "10" acaba antes que "9", porque el carácter "1" es lexicográficamente menor que "9": la ordenación no «entiende» que son números. La ordenación numérica, en cambio, interpreta las cadenas como números antes de compararlas, dando el orden esperado 9, 10, 11.

Mayúsculas y minúsculas al ordenar

En la mayoría de los sistemas, las mayúsculas preceden lexicográficamente a las minúsculas (por la codificación de caracteres), así que "Zebra" puede acabar antes que "manzana" en una ordenación sensible a mayúsculas. La ordenación insensible a mayúsculas normaliza primero las cadenas a un mismo caso para compararlas, conservando las mayúsculas originales en el resultado.

Eliminación de duplicados

La deduplicación elimina líneas repetidas comparándolas carácter por carácter, no por significado. Un matiz importante es la sensibilidad a mayúsculas y espacios: las cadenas "Texto" y "texto " (con un espacio de más) son técnicamente distintas y no se fusionarán sin una normalización adicional antes de comparar.

Para qué sirve

  • Quitar entradas repetidas de una lista de direcciones de correo o URL antes de una importación.
  • Ordenar una lista de versiones o ID numéricamente en lugar de como texto.
  • Comparar rápidamente dos conjuntos de datos llevando ambas listas a la misma forma ordenada.

Ordenación natural (natural sort)

La ordenación natural es un compromiso entre el enfoque alfabético y el numérico: reconoce las secuencias de dígitos dentro de una cadena como números y compara el resto como texto. Así, file2.txt queda antes que file10.txt, aunque formalmente son cadenas y no números independientes — útil para nombres de archivos o versiones con un prefijo de texto.

Probar la herramienta