FreeToGenerate.com

Vinte e duas destas letras passam por latinas, e uma palavra feita com elas não mistura alfabetos nenhuns.

As 33 letras do alfabeto russo

O Ё é a sétima letra mas fica em U+0401, fora do troço que contém as outras 32. Gerar este alfabeto como um único intervalo dá 32 letras e perde o Ё sem dizer nada.

LetraNomePontos de códigoParecido latino
А аAU+0410 · U+0430A a
Б бBeU+0411 · U+0431
В вVeU+0412 · U+0432B
Г гGheU+0413 · U+0433 r
Д дDeU+0414 · U+0434
Е еIeU+0415 · U+0435E e
Ё ёIoU+0401 · U+0451
Ж жZheU+0416 · U+0436
З зZeU+0417 · U+0437
И иIU+0418 · U+0438
Й йShort IU+0419 · U+0439
К кKaU+041A · U+043AK
Л лElU+041B · U+043B
М мEmU+041C · U+043CM
Н нEnU+041D · U+043DH
О оOU+041E · U+043EO o
П пPeU+041F · U+043F
Р рErU+0420 · U+0440P p
С сEsU+0421 · U+0441C c
Т тTeU+0422 · U+0442T
У уUU+0423 · U+0443Y y
Ф фEfU+0424 · U+0444
Х хHaU+0425 · U+0445X x
Ц цTseU+0426 · U+0446
Ч чCheU+0427 · U+0447
Ш шShaU+0428 · U+0448 w
Щ щShchaU+0429 · U+0449
Ъ ъHard SignU+042A · U+044A
Ы ыYeruU+042B · U+044B
Ь ьSoft SignU+042C · U+044Cb
Э эEU+042D · U+044D
Ю юYuU+042E · U+044E
Я яYaU+042F · U+044F

Letras que o russo não usa

Não existe um único alfabeto cirílico. Estas ficam mesmo antes do bloco russo e pertencem a outras línguas escritas no mesmo alfabeto.

LetraNomeUsada por
Ђ ђDjeSerbian
Ѓ ѓGjeMacedonian
Є єUkrainian IeUkrainian
Ѕ ѕDzeMacedonian
І іByelorussian-Ukrainian IUkrainian, Belarusian
Ї їYiUkrainian
Ј јJeSerbian, Macedonian
Љ љLjeSerbian, Macedonian
Њ њNjeSerbian, Macedonian
Ћ ћTsheSerbian
Ќ ќKjeMacedonian
Ў ўShort UBelarusian
Џ џDzheSerbian, Macedonian

Verifique se um texto traz parecidos

Cole o que quiser e veja que caracteres são letras cirílicas a passar-se por latinas.

Parecidos encontrados

Lê-se como
care
  • Posição 1 · с · U+0441 · Imita c
  • Posição 2 · а · U+0430 · Imita a
  • Posição 3 · г · U+0433 · Imita r
  • Posição 4 · е · U+0435 · Imita e

Este texto é inteiramente cirílico, portanto uma verificação de mistura de alfabetos não lhe vê nada de estranho. É aí que está o problema todo.

Também disponível em: English · Español · Français · العربية

O alfabeto cirílico

As 33 letras russas com os seus pontos de código, as que outras línguas eslavas acrescentam e quais imitam o latino.

O que é o alfabeto cirílico

O cirílico é a escrita do russo, do ucraniano, do búlgaro, do sérvio, do macedónio, do bielorrusso e de dezenas de línguas da Eurásia. Descende da uncial grega por via da Bulgária do século IX, e daí que várias das suas letras sejam gregas e não latinas de origem, e que algumas não se pareçam com nenhuma das duas.

Não existe um único alfabeto cirílico, e convém deixar isso claro logo de início. O russo usa 33 letras e é esse o conjunto que quase toda a gente tem em mente, mas o ucraniano tem і, ї, є e ґ, o sérvio tem ј, љ, њ, ћ e џ, e o búlgaro dispensa duas letras que o russo mantém. A tabela acima põe primeiro as 33 russas e depois as letras dos outros alfabetos, porque apresentar o conjunto de uma língua como o alfabeto é o erro que quase todas as listas cometem.

A segunda coisa é que o alfabeto russo não é um intervalo limpo no Unicode. Trinta e duas das suas maiúsculas seguem-se de U+0410 a U+042F, e a trigésima terceira, o Ё, fica longe, em U+0401, entre letras que o russo nem sequer usa. Quem gere este alfabeto a partir de um intervalo obtém 32 letras e perde o Ё sem erro nenhum, e é por isso que a lista aqui é construída a partir da base de dados de caracteres e não contada à mão.

Como usar esta página

  1. Procure na tabela a letra de que precisa. Cada linha dá a maiúscula e a minúscula, o nome da letra, os dois pontos de código e a letra latina com que pode ser confundida, se houver. Os pontos de código são o que faz falta quando uma letra tem de sobreviver a um copiar e colar para um sistema que guarda bytes e não formas.
  2. Veja a segunda tabela antes de dar uma letra como russa. As treze letras que ali aparecem são usadas pelo ucraniano, pelo sérvio, pelo macedónio ou pelo bielorrusso, e não pelo russo. Se está a transcrever um nome ou um topónimo, essa distinção costuma ser exactamente o que importa.
  3. Cole no verificador qualquer texto suspeito. Assinala cada carácter que seja uma letra cirílica a passar-se por latina, mostra a posição e o ponto de código de cada uma, e escreve como o texto se lê depois de resolvidas as imitações. Diz-lhe também se a cadeia mistura alfabetos, que é a parte que convém perceber.

Os parecidos, contados e não supostos

O cirílico é o alfabeto que dá nome aos ataques por homógrafos, portanto o que se espera é que tenha mais parecidos latinos do que qualquer outro. Medido contra o confusables.txt, a tabela que o Unicode publica por trás das suas recomendações de segurança e a que os registadores realmente consultam, afinal não tem. Treze maiúsculas russas e nove minúsculas estão marcadas como confundíveis com uma letra latina básica: vinte e duas ao todo. O grego, que este sítio mediu da mesma maneira, tem catorze maiúsculas e oito minúsculas, também vinte e duas, e vai à frente nas maiúsculas.

Portanto a contagem empata, e a razão de o cirílico dominar na prática está noutro sítio: em que letras os parecidos cobrem. As minúsculas cirílicas podem fazer de a, c, e, o, p, r, w, x e y. As gregas cobrem a, i, o, p, u, v e y. Essas nove substitutas cirílicas incluem c, e, r e w, e isso dá para construir palavras inteiras em vez de trocar uma letra dentro delas.

Confrontado com um dicionário a sério, a diferença é enorme. Das 167 968 palavras da lista ENABLE que este sítio usa nos seus jogos de palavras, 394 podem ser escritas inteiramente com parecidos cirílicos e apenas 43 podem sê-lo com gregos: um factor de nove. Care, acre, carp, opera, reappear e preparer estão no conjunto cirílico. Score não, porque o s não tem imitador cirílico, e apple também não, porque o l não tem.

É isso que torna a diferença perigosa e não apenas curiosa. A defesa barata e habitual contra este tipo de falsificação é verificar se há mistura de alfabetos: se uma cadeia traz caracteres latinos e cirílicos ao mesmo tempo, alguma coisa está mal. Uma palavra escrita inteiramente em cirílico não traz um único carácter latino, portanto é texto perfeitamente coerente de um só alfabeto e essa verificação não tem nada a dizer. O verificador acima mostra-o: a palavra com que abre não mistura alfabetos, e não é a palavra que aparenta ser.

Limites honestos

Os pares confundíveis vêm da tabela do Unicode e não do critério de ninguém sobre o que se parece com o quê, e essa tabela fala de formas isoladas. Que dois caracteres sejam mesmo indistinguíveis depende do tipo de letra em que está a ler, e alguns pares que o Unicode marca como confundíveis distinguem-se bem numa letra com boa altura de x ou remates característicos. Tome a coluna como a resposta da norma e não como uma promessa sobre o seu ecrã.

A normalização não ajuda, e convém dizê-lo com clareza porque é a primeira coisa a que as pessoas recorrem. As formas normais do Unicode existem para unificar caracteres que são canónica ou compativelmente o mesmo, e uma letra cirílica não é o mesmo carácter que uma latina que por acaso se lhe parece. Nem a NFC nem a NFKD as fundem, portanto a verificação reflexa de normalizar e comparar não apanha nada disto.

A página cobre além disso apenas os parecidos com o latino básico. Os caracteres cirílicos podem imitar algarismos, sinais de pontuação e letras de outros alfabetos, e o confusables.txt regista muitíssimos mais pares do que os aqui mostrados. Limitar ao A e ao Z mantém a tabela legível e corresponde ao que as pessoas costumam perguntar, mas é uma limitação.

Por fim, isto é uma referência e um verificador, não um controlo de segurança. Saber que uma cadeia traz homóglifos diz-lhe que a cadeia é suspeita; não lhe diz que um domínio é hostil, e há imenso texto legítimo que mistura alfabetos. As defesas a sério vivem nos navegadores e nos registos, que aplicam regras de mistura de alfabetos, conjuntos de caracteres permitidos por registo e políticas de visualização que nenhuma página consegue reproduzir.

Porque é grátis

Porque é uma tabela e umas poucas contas. Nada do que colar no verificador é enviado, registado ou guardado: os dados de caracteres viajam com a página e a comparação acontece no seu navegador, o que aqui importa mais do que o costume, porque o natural é colar precisamente um domínio ou um utilizador de que já se desconfia.

Portanto não há conta, nem registo, nem nada guardado atrás de um. As letras e os seus nomes vêm da base de dados de caracteres do Unicode e os parecidos do confusables.txt, regenerados por um script que está ao lado da página, com 70 verificações que comprovam o resultado.