#032 · Idioma y Unicode

Contador de caracteres cirílicos

Analiza cualquier fragmento y cuenta los caracteres pertenecientes a la escritura cirílica, incluso cuando aparecen mezclados con alfabeto latino, números o signos. Es práctico para comprobar archivos de localización, limpiar conjuntos de datos, revisar textos en ruso, ucraniano, búlgaro y otros idiomas que utilizan cirílico, o detectar rápidamente líneas que contienen esa escritura.

Entrada de texto

Análisis local
Espacio publicitario

Cómo usar esta herramienta de texto

  1. Introduce el texto completo, aunque contenga varias escrituras.
  2. Ejecuta el contador.
  3. Revisa el total de caracteres cirílicos, su proporción y las líneas afectadas.
  4. Exporta el informe si necesitas documentar la revisión.

Qué hace esta herramienta

Cuenta los puntos de código que Unicode clasifica dentro de la escritura cirílica y separa ese dato del tamaño total de la entrada.

Cada punto de código se contrasta con la propiedad Unicode Script=Cyrillic. Después se calcula el porcentaje respecto del total y las líneas donde aparece al menos un carácter cirílico.

La presencia de cirílico no permite deducir por sí sola qué idioma está escrito ni si el contenido es correcto.

Ejemplo

En «Привет hola», las seis letras cirílicas de «Привет» se cuentan aparte de las letras latinas y del espacio.

Casos de uso

  • Comprobar traducciones y archivos de localización.
  • Detectar cirílico dentro de bases de datos multilingües.
  • Medir la proporción de escritura cirílica en corpus.
  • Localizar líneas que podrían requerir revisión manual.

Consejos para obtener mejores resultados

  • Trabaja con UTF-8 para conservar todos los caracteres.
  • Interpreta el porcentaje junto con la longitud total.
  • Comprueba visualmente caracteres parecidos entre latino y cirílico.
  • No confundas detección de escritura con detección de idioma.

Detalles del procesamiento

El análisis se realiza carácter por carácter usando propiedades Unicode y no envía el texto a un servidor.

Los signos de puntuación y caracteres Unicode de uso común pueden quedar fuera del recuento cirílico aunque aparezcan entre palabras cirílicas.

Preguntas frecuentes

¿Cómo detectar letras cirílicas ocultas dentro de un texto en alfabeto latino?

Pega todo el texto. El contador mostrará cuántos caracteres pertenecen a la escritura cirílica y en cuántas líneas aparecen.

¿El contador distingue caracteres cirílicos de letras latinas visualmente parecidas?

Sí cuando Unicode las codifica como caracteres distintos. Por ejemplo, dos letras visualmente similares pueden pertenecer a scripts diferentes y se cuentan según esa propiedad.

¿Sirve para contar texto ruso y ucraniano en el mismo documento?

Sí. Ambos utilizan caracteres cirílicos, por lo que el contador mide la escritura utilizada sin intentar separar idiomas.

¿Los espacios y signos de puntuación aumentan el recuento cirílico?

No. Forman parte del total general, pero solo los caracteres con propiedad Unicode cirílica aumentan el recuento específico.

¿La herramienta envía el texto para identificar el alfabeto?

No. El análisis se ejecuta localmente en el navegador mediante propiedades Unicode.

Resumen del módulo

ElementoValor
MóduloDetalle
HerramientaContador de caracteres cirílicos
Número#032
CategoríaIdioma y Unicode
ProcesamientoLocal en el navegador