FreeToGenerate.com

Veintidós de estas letras pueden pasar por latinas, y una palabra hecha con ellas no mezcla alfabetos en absoluto.

Las 33 letras del alfabeto ruso

La Ё es la séptima letra pero está en U+0401, fuera del tramo que contiene a las otras 32. Generar este alfabeto como un solo rango da 32 letras y pierde la Ё sin decir nada.

LetraNombrePuntos de códigoParecido latino
А аAU+0410 · U+0430A a
Б бBeU+0411 · U+0431
В вVeU+0412 · U+0432B
Г гGheU+0413 · U+0433 r
Д дDeU+0414 · U+0434
Е еIeU+0415 · U+0435E e
Ё ёIoU+0401 · U+0451
Ж жZheU+0416 · U+0436
З зZeU+0417 · U+0437
И иIU+0418 · U+0438
Й йShort IU+0419 · U+0439
К кKaU+041A · U+043AK
Л лElU+041B · U+043B
М мEmU+041C · U+043CM
Н нEnU+041D · U+043DH
О оOU+041E · U+043EO o
П пPeU+041F · U+043F
Р рErU+0420 · U+0440P p
С сEsU+0421 · U+0441C c
Т тTeU+0422 · U+0442T
У уUU+0423 · U+0443Y y
Ф фEfU+0424 · U+0444
Х хHaU+0425 · U+0445X x
Ц цTseU+0426 · U+0446
Ч чCheU+0427 · U+0447
Ш шShaU+0428 · U+0448 w
Щ щShchaU+0429 · U+0449
Ъ ъHard SignU+042A · U+044A
Ы ыYeruU+042B · U+044B
Ь ьSoft SignU+042C · U+044Cb
Э эEU+042D · U+044D
Ю юYuU+042E · U+044E
Я яYaU+042F · U+044F

Letras que el ruso no usa

No existe un único alfabeto cirílico. Estas están justo antes del bloque ruso y pertenecen a otras lenguas escritas con el mismo alfabeto.

LetraNombreLa usan
Ђ ђDjeSerbian
Ѓ ѓGjeMacedonian
Є єUkrainian IeUkrainian
Ѕ ѕDzeMacedonian
І іByelorussian-Ukrainian IUkrainian, Belarusian
Ї їYiUkrainian
Ј јJeSerbian, Macedonian
Љ љLjeSerbian, Macedonian
Њ њNjeSerbian, Macedonian
Ћ ћTsheSerbian
Ќ ќKjeMacedonian
Ў ўShort UBelarusian
Џ џDzheSerbian, Macedonian

Comprueba si un texto lleva parecidos

Pega lo que quieras y mira qué caracteres son letras cirílicas haciéndose pasar por latinas.

Parecidos encontrados

Se lee como
care
  • Posición 1 · с · U+0441 · Imita a c
  • Posición 2 · а · U+0430 · Imita a a
  • Posición 3 · г · U+0433 · Imita a r
  • Posición 4 · е · U+0435 · Imita a e

Este texto es cirílico por completo, así que una comprobación de mezcla de alfabetos no le ve nada raro. Ahí está todo el problema.

También disponible en: English · Português · Français · العربية

El alfabeto cirílico

Las 33 letras rusas con sus puntos de código, las que añaden otras lenguas eslavas y cuáles imitan al latino.

¿Qué es el alfabeto cirílico?

El cirílico es la escritura del ruso, el ucraniano, el búlgaro, el serbio, el macedonio, el bielorruso y decenas de lenguas de Eurasia. Desciende de la uncial griega por vía de la Bulgaria del siglo IX, y de ahí que varias de sus letras sean griegas y no latinas de origen, y que unas cuantas no se parezcan a ninguna de las dos.

No existe un único alfabeto cirílico, y conviene tenerlo claro desde el principio. El ruso usa 33 letras y ese es el conjunto que casi todo el mundo tiene en mente, pero el ucraniano tiene і, ї, є y ґ, el serbio tiene ј, љ, њ, ћ y џ, y el búlgaro prescinde de dos letras que el ruso conserva. La tabla de arriba pone primero las 33 rusas y después las letras de los demás alfabetos, porque presentar el conjunto de una lengua como el alfabeto es el error que comete casi cualquier lista.

Lo segundo es que el alfabeto ruso no es un rango limpio en Unicode. Treinta y dos de sus mayúsculas van seguidas de U+0410 a U+042F, y la trigésima tercera, la Ё, está lejos, en U+0401, entre letras que el ruso ni siquiera usa. Quien genere este alfabeto a partir de un rango obtiene 32 letras y pierde la Ё sin ningún error, y por eso la lista de aquí se construye desde la base de datos de caracteres y no contando a mano.

Cómo usar esta página

  1. Busca en la tabla la letra que necesites. Cada fila da la mayúscula y la minúscula, el nombre de la letra, los dos puntos de código y la letra latina con la que se puede confundir, si la hay. Los puntos de código son lo que hace falta cuando una letra tiene que sobrevivir a un copiar y pegar hacia un sistema que guarda bytes y no formas.
  2. Mira la segunda tabla antes de dar una letra por rusa. Las trece letras que aparecen ahí las usan el ucraniano, el serbio, el macedonio o el bielorruso, y no el ruso. Si estás transcribiendo un nombre o un topónimo, esa distinción suele ser justo lo que importa.
  3. Pega en el comprobador cualquier texto sospechoso. Marca cada carácter que sea una letra cirílica haciéndose pasar por latina, enseña su posición y su punto de código, y escribe cómo se lee el texto una vez resueltas las imitaciones. También te dice si la cadena mezcla alfabetos, que es la parte que conviene entender.

Los parecidos, contados y no supuestos

El cirílico es el alfabeto que da nombre a los ataques por homógrafos, así que lo que uno espera es que tenga más parecidos latinos que ningún otro. Medido contra confusables.txt, la tabla que Unicode publica detrás de sus recomendaciones de seguridad y la que consultan de verdad los registradores, resulta que no. Trece mayúsculas rusas y nueve minúsculas están marcadas como confundibles con una letra latina básica: veintidós en total. El griego, que este sitio midió igual, tiene catorce mayúsculas y ocho minúsculas, también veintidós, y va por delante en mayúsculas.

Así que el recuento empata, y el motivo de que el cirílico domine en la práctica está en otro sitio: en qué letras cubren los parecidos. Las minúsculas cirílicas pueden hacer de a, c, e, o, p, r, w, x e y. Las griegas cubren a, i, o, p, u, v e y. Esas nueve sustitutas cirílicas incluyen c, e, r y w, y eso da para construir palabras enteras en vez de cambiar una letra dentro de ellas.

Contrastado con un diccionario real la diferencia es enorme. De las 167.968 palabras de la lista ENABLE que este sitio usa para sus juegos de palabras, 394 se pueden escribir por completo con parecidos cirílicos y solo 43 se pueden escribir por completo con griegos: un factor de nueve. Care, acre, carp, opera, reappear y preparer están en el conjunto cirílico. Score no, porque la s no tiene imitadora cirílica, y apple tampoco, porque la l no la tiene.

Eso es lo que hace peligrosa la diferencia y no solo curiosa. La defensa barata y habitual contra este tipo de suplantación es comprobar si se mezclan alfabetos: si una cadena lleva caracteres latinos y cirílicos a la vez, algo va mal. Una palabra escrita enteramente en cirílico no lleva ni un carácter latino, así que es texto perfectamente coherente de un solo alfabeto y esa comprobación no tiene nada que decir. El comprobador de arriba lo enseña: la palabra con la que abre no mezcla alfabetos, y no es la palabra que aparenta ser.

Límites honestos

Las parejas confundibles salen de la tabla de Unicode y no del criterio de nadie sobre qué se parece a qué, y esa tabla habla de formas aisladas. Que dos caracteres sean de verdad indistinguibles depende de la tipografía con la que estés leyendo, y unas cuantas parejas que Unicode marca como confundibles se distinguen bien en una letra con buena altura de x o remates característicos. Toma la columna como la respuesta de la norma, no como una promesa sobre tu pantalla.

La normalización no ayuda, y conviene decirlo claro porque es lo primero a lo que la gente recurre. Las formas normales de Unicode existen para unificar caracteres que son canónica o compatiblemente el mismo, y una letra cirílica no es el mismo carácter que una latina que casualmente se le parece. Ni NFC ni NFKD las funden, así que la comprobación refleja de normalizar y comparar no caza nada de esto.

La página cubre además solo los parecidos con el latino básico. Los caracteres cirílicos pueden imitar cifras, signos de puntuación y letras de otros alfabetos, y confusables.txt registra muchísimas más parejas que las que se muestran aquí. Limitarse a la A y la Z mantiene la tabla legible y coincide con lo que la gente suele preguntar, pero es una limitación.

Por último, esto es una referencia y un comprobador, no un control de seguridad. Saber que una cadena lleva homóglifos te dice que la cadena es sospechosa; no te dice que un dominio sea hostil, y hay muchísimo texto legítimo que mezcla alfabetos. Las defensas de verdad viven en los navegadores y en los registros, que aplican reglas de mezcla de alfabetos, conjuntos de caracteres permitidos por registro y políticas de visualización que ninguna página puede reproducir.

¿Por qué es gratis?

Porque es una tabla y unas pocas cuentas. Nada de lo que pegues en el comprobador se sube, se registra ni se guarda: los datos de caracteres viajan con la página y la comparación ocurre en tu navegador, cosa que aquí importa más de lo normal, porque lo natural es pegar justo un dominio o un usuario del que ya sospechas.

Así que no hay cuenta, ni registro, ni nada reservado. Las letras y sus nombres salen de la base de datos de caracteres de Unicode y los parecidos de confusables.txt, regenerados por un script que está junto a la página, con 70 comprobaciones que verifican el resultado.