FreeToGenerate.com

1277 impostores de 43 alfabetos, y la mayoría no son un alfabeto.

Texto que quieres comprobar

Se comprueba en tu navegador contra la propia tabla de confundibles de Unicode. No se sube nada.

Hay caracteres parecidos, y una comprobación de mezcla de alfabetos no pondría ninguna pega a este texto.

O bien todos los caracteres vienen de un mismo alfabeto, o los impostores son del bloque Common, que Unicode considera compatible con todo. Este es el caso que se cuela.

Se lee como: paypal.com

Los caracteres que no son lo que parecen

EnCarácterNombre UnicodeAlfabetoImita a
0𝐩 U+1D429MATHEMATICAL BOLD SMALL PCommonp
1𝐚 U+1D41AMATHEMATICAL BOLD SMALL ACommona
2𝐲 U+1D432MATHEMATICAL BOLD SMALL YCommony
3𝐩 U+1D429MATHEMATICAL BOLD SMALL PCommonp
4𝐚 U+1D41AMATHEMATICAL BOLD SMALL ACommona
5𝐥 U+1D425MATHEMATICAL BOLD SMALL LCommonl
7𝐜 U+1D41CMATHEMATICAL BOLD SMALL CCommonc
8𝐨 U+1D428MATHEMATICAL BOLD SMALL OCommono

La tabla que hay detrás

impostores
1277
alfabetos
43
de Common
823
del cirílico
43
del griego
38

El ataque lleva el nombre del cirílico, y la mayor parte del material no es cirílico. Common —alfanuméricos matemáticos, formas de ancho completo, letras encerradas— aporta más impostores que todos los alfabetos juntos, y como Unicode lo trata como neutro, ninguna comprobación de mezcla de alfabetos pone pegas a ninguno de ellos.

Todas las letras latinas tienen al menos un impostor de un solo carácter salvo dos. La I mayúscula no es un destino, porque Unicode agrupa I, l y 1 en un mismo representante. La m minúscula la imita la secuencia de dos caracteres rn. Los dos huecos son justo los dos engaños famosos que funcionan de otra manera.

Nuestras páginas del alfabeto cirílico y del griego llevan cada una un detector construido con una tabla escrita a mano para ese alfabeto: 22 caracteres cada una. Siguen sirviendo como referencia por alfabeto; esta página es la tabla entera.

Datos del confusables.txt de Unicode, la tabla que hay tras UTS 39, con los nombres de alfabeto de Scripts.txt. Las posiciones se cuentan en puntos de código, porque varios impostores viven por encima del plano básico.

También disponible en: English · Português · Français · العربية

Caracteres parecidos: detecta homoglifos en un texto

Qué caracteres de tu texto se hacen pasar por letras latinas, de qué alfabeto vienen y si la defensa habitual los cazaría.

¿Qué es un carácter parecido?

Un carácter parecido —un homoglifo— es un carácter de un alfabeto dibujado casi igual que otro de un alfabeto distinto. La а cirílica y la a latina son puntos de código diferentes que la mayoría de las tipografías representan igual. Mete uno en un nombre de dominio y tendrás una dirección que se lee bien y lleva a otro sitio.

Unicode publica la lista autorizada de estos casos en confusables.txt, los datos que hay detrás de su informe de seguridad UTS 39. Ese archivo es el que consultan registradores y navegadores para decidir si dos nombres se parecen demasiado como para coexistir. Reducido a caracteres sueltos que sustituyen a una sola letra latina, contiene 1277 impostores repartidos por 43 alfabetos.

Esta página compara tu texto con esa tabla, nombra cada impostor que encuentra y te dice lo que casi ninguna herramienta dice: si la defensa estándar lo habría cazado.

Cómo usarla

  1. Pega el texto. Un dominio, un nombre de usuario, el nombre de un paquete, una dirección de correo: lo que estés a punto de dar por bueno. Se comprueba en tu navegador y no se sube nunca.
  2. Lee el veredicto. Obtienes la grafía latina a la que se reduce el texto de verdad y una frase clara sobre si una comprobación de mezcla de alfabetos pondría alguna pega.
  3. Y luego mira la tabla. Cada impostor aparece con su posición, su punto de código, su nombre oficial de Unicode, el alfabeto del que viene y la letra que imita.

El ataque lleva el nombre del cirílico y casi no es cirílico

El cirílico aporta 43 de los 1277 impostores y el griego otros 38. La mayor fuente, con diferencia, es el alfabeto que Unicode llama Common: 823 de ellos. En Common viven los alfanuméricos matemáticos, junto con las formas de ancho completo, las letras encerradas y bastante más que no pertenece a ningún alfabeto.

Y no es una curiosidad, por cómo funciona la defensa habitual. La comprobación barata y casi universal consiste en preguntar si una cadena mezcla alfabetos, con el razonamiento de que una palabra latina auténtica no tiene por qué contener una letra cirílica. Unicode considera Common compatible con todos los alfabetos —los símbolos matemáticos deben poder aparecer junto a cualquier idioma—, así que una a matemática en negrita en mitad de un texto latino no provoca ninguna objeción de mezcla.

Hay una segunda forma de sortear la misma comprobación, y es de donde viene la fama del cirílico: escribir la palabra entera en un solo alfabeto. Una palabra escrita íntegramente con caracteres cirílicos es perfectamente coherente, así que no hay mezcla y la comprobación no tiene nada que decir. La herramienta informa de los dos casos explícitamente en vez de dejarte adivinar cuál tienes delante.

Dos letras que nadie puede falsificar con un solo carácter

Todas las letras latinas tienen al menos un impostor de un solo carácter salvo dos, y los motivos son distintos: los dos están en el propio archivo.

La I mayúscula no tiene ninguno porque no es un destino. Unicode agrupa la I mayúscula, la l minúscula y el dígito 1 en un mismo representante, así que la tabla lleva la I hacia la l y no al revés: 79 caracteres apuntan a la l minúscula y ninguno a la I mayúscula. La m minúscula no tiene ninguno porque su impostor no es un carácter: la tabla lleva la m a rn, la secuencia de dos letras que engaña a los lectores desde mucho antes de que existiera Unicode.

Así que los dos huecos de la lista son justo los dos engaños famosos que funcionan con otro mecanismo. Es un resultado bonito, y el generador que construye estos datos se niega a emitirlos si algún día deja de cumplirse.

Lo que esta página no puede decirte

No puede decirte que un texto sea malicioso. Muchísimos de estos caracteres tienen usos totalmente legítimos: los alfanuméricos matemáticos pertenecen a las matemáticas, las formas de ancho completo a la composición japonesa, y una а cirílica en una palabra rusa es sencillamente la letra a. Lo que informa la página es que un carácter no es la letra latina a la que se parece, y eso es un hecho, no una acusación.

Tampoco comprueba la dirección contraria. Unicode registra 2103 caracteres cuyo parecido es una secuencia y no un solo carácter —la m por rn es el famoso—, y esos son otra forma del problema que un análisis carácter a carácter no puede ver.

Y solo trata de la apariencia. Un texto puede engañar de maneras que nada tienen que ver con cómo se dibujan los caracteres, sobre todo escondiendo caracteres que no se dibujan en absoluto. Esa es otra comprobación, y en este sitio hay otra página para ella.

¿Por qué es gratis?

La tabla son unos pocos kilobytes que viajan con la página, y la comprobación corre en tu navegador. Nada de lo que pegas se sube, no se registra nada y no hay cuenta que crear.

Sin registro, sin límites y sin marca de agua en nada de lo que copies.