También disponible en: English · Português · Français · العربية
El alfabeto árabe
Las 28 letras en todas las formas que adoptan, generadas desde un punto de código cada una y no desde las formas de presentación obsoletas.
¿Qué es el alfabeto árabe?
El alfabeto árabe tiene 28 letras y se escribe de derecha a izquierda. Se usa para el árabe y, con letras añadidas, para el persa, el urdu, el pastún, el kurdo y muchos más, lo que lo convierte en la segunda escritura más usada del mundo después de la latina. Igual que el hebreo es un abyad: las letras son consonantes y las vocales breves son signos que normalmente se omiten.
Lo que lo distingue de casi cualquier otro alfabeto es que las letras se enlazan. El árabe escrito es cursivo por defecto, no como estilo sino como la manera normal de componerlo incluso impreso, y una letra adopta una forma distinta según vaya sola, empiece palabra, esté en medio o la termine. La mayoría tiene cuatro formas. Seis tienen solo dos, porque se niegan a enlazarse con lo que las sigue, y esa lista se la aprende de memoria todo el que estudia árabe.
Si haces la cuenta, las 28 letras adoptan 100 formas distintas: 22 letras con cuatro cada una y seis con dos. Ese número es el motivo de que exista esta página, por lo que Unicode hace y no hace al respecto.
Cómo usar esta página
- Busca en la tabla la letra que necesites. Cada fila da la letra, su nombre, una transliteración, su único punto de código y todas las formas que adopta con la posición etiquetada. Las seis letras que enseñan solo dos formas son las que no enlazan.
- Mira la segunda tabla antes de dar algo por letra. La hamza, sus portadoras, la ta marbuta y la alif maqsura aparecen sin parar en árabe escrito y ninguna es una de las 28. Se listan aparte con el motivo, en vez de meterlas dentro para que la cuenta parezca más llena.
- Pega texto heredado en el limpiador. El texto exportado de sistemas antiguos a veces usa formas de presentación en lugar de letras ordinarias. Se ve bien y se comporta mal. El limpiador las sustituye y te dice cuántas ha encontrado.
Un punto de código por letra, y 731 que no deberías teclear nunca
Aquí está lo que separa al árabe de los demás alfabetos de este sitio. Unicode no codifica ninguna de esas 100 formas en el bloque árabe. Hay exactamente un punto de código por letra, y la elección de forma la hace lo que dibuje el texto, a partir de las letras que tenga a los lados. El alfabeto son 28 caracteres y las cien formas son un comportamiento de dibujado.
Ahora bien, Unicode sí contiene las formas, en dos bloques llamados Formas de Presentación Árabes A y B. Hay 731. Existen para que los documentos en codificaciones antiguas, que sí guardaban cada forma como carácter propio, se puedan convertir a Unicode sin pérdida. La norma dice expresamente que son caracteres de compatibilidad y no sirven para componer texto nuevo.
Esa distinción importa más de lo que parece. El texto escrito con formas de presentación se ve correcto y se comporta mal: buscar una palabra no la encuentra, porque las formas son caracteres distintos de las letras; la ordenación la coloca mal; el salto de línea y el movimiento del cursor se lían. Es el equivalente tipográfico de escribir una palabra mezclando fuentes para forzar que las letras se vean bien.
Así que la tabla de arriba está hecha de la manera honesta. Cada forma que ves sale del propio punto de código de la letra con un enlazador de ancho cero al lado, que le pide al motor que la dibuje como si tuviera un vecino. En esta página no aparece ninguna forma de presentación, y las pruebas lo verifican para las 100 formas en vez de pedirte que nos creas.
Dónde viven las formas variantes, en cuatro alfabetos
Este es el cuarto alfabeto publicado como lista en este sitio, y cada uno ha resultado esconder sus formas variantes en un sitio distinto. Juntos son una pequeña lección sobre no generar nunca un alfabeto a partir de un rango de puntos de código.
El griego esconde un hueco. Las mayúsculas van de U+0391 a U+03A9, que son 25 puntos de código para 24 letras, porque U+03A2 está sin asignar: no hay sigma final mayúscula, así que la casilla donde iría se queda vacía.
El cirílico esconde un forastero. El alfabeto ruso son 33 letras, pero solo 32 son contiguas; la Ё está en U+0401, bien fuera de ese tramo, entre letras que el ruso ni siquiera usa.
El hebreo esconde intrusos intercalados. Su bloque son 27 puntos de código para 22 letras, porque cinco letras tienen una forma final aparte y cada una está codificada justo antes de la letra a la que pertenece.
El árabe no esconde nada en el bloque, porque las formas no están ahí. Es el fallo contrario: el bloque no es demasiado grande, es que le falta todo lo que una lista ingenua tiene la tentación de enseñar, y la tentación es ir a buscarlo a un bloque de compatibilidad donde no pinta nada.
Límites honestos
Las formas de la tabla las dibuja tu propio navegador con las fuentes de tu máquina. Eso es lo suyo y no un atajo, porque es exactamente lo que le pasa al texto árabe en todas partes, pero significa que una fuente con mal soporte de árabe dibujará algunas peor que una buena. Si una forma se ve mal aquí, también se verá mal en un documento real, cosa útil de saber.
Hay dos formas que son cosa del motor y no del alfabeto. La lam seguida de alif se dibuja como una ligadura única en cualquier fuente razonable, y no es una letra; Unicode sí le da un punto de código entre las formas de presentación, que es otra cosa que no hay que teclear. El comportamiento contextual también varía algo entre tipografías, sobre todo en los estilos nastaliq, donde el enlazado es mucho más elaborado que lo que sugieren cuatro posiciones.
El 28 es un convenio. Es la cuenta que se enseña en todas partes y es la correcta para publicar, pero es una decisión sobre qué incluir y no un hecho sobre el bloque, y la segunda tabla es donde esa decisión se hace visible. Hay lenguas más allá del árabe que añaden letras a esta escritura y ninguna está aquí.
Por último, las transliteraciones son una guía aproximada para quien no conoce la escritura, no un sistema erudito. La transliteración académica distingue sonidos que estas grafías funden y usa diacríticos que esta página no.
¿Por qué es gratis?
Porque es una tabla y una llamada de normalización. Los datos de las letras viajan con la página y el limpiador se ejecuta en tu navegador, así que nada de lo que pegues se sube, se registra ni se guarda en ninguna parte.
Así que no hay cuenta, ni registro, ni nada reservado. Las letras salen de la base de datos de caracteres de Unicode, el comportamiento de enlazado de ArabicShaping.txt y no de una lista memorizada, y los parecidos de la tabla que hay detrás del UTS 39, todo regenerado por un script que está junto a la página con 65 comprobaciones que verifican el resultado.