También disponible en: English · Português · Français · العربية
Generador de robots.txt
Crea un robots.txt y prueba una URL contra él, con la regla que decide mostrada junto a la respuesta.
¿Qué es un archivo robots.txt?
El archivo robots.txt vive en la raíz de un dominio y le dice a los rastreadores qué partes del sitio pueden pedir. Es un archivo de texto plano hecho de grupos: una o varias líneas User-agent que nombran a un rastreador, seguidas de líneas Allow y Disallow que nombran rutas. Ese es todo el formato.
Durante veinticinco años fue una convención y no una norma, y de ahí viene el folclore que lo rodea. Eso cambió en septiembre de 2022, cuando se publicó como RFC 9309, el Protocolo de Exclusión de Robots. Tener una especificación de verdad significa que preguntas que antes se respondían por opinión ahora tienen una cita, y este generador la sigue.
Lo más útil que puedes entender es que robots.txt controla el rastreo, no la indexación, y que es una petición y no una valla. Los rastreadores que se portan bien lo respetan. Nada detiene a uno que se porte mal, y el archivo es público, así que no es el sitio donde listar las rutas que más te interesa mantener discretas.
Cómo se usa
- Rellena el rastreador y las rutas. Deja el asterisco para dirigirte a todos los rastreadores, o nombra uno para escribir reglas que solo se le apliquen a él. Disallow admite una ruta por línea, y Allow sirve para las excepciones dentro de una ruta bloqueada. Los atajos te dan un punto de partida para permitirlo todo, bloquearlo todo o bloquear un puñado de rutas.
- Edita o pega directamente en la caja de salida. El archivo generado es editable, y puedes sustituirlo entero por un robots.txt que ya tengas. Todo lo que hay debajo de la caja lee lo que haya en ella, así que el probador funciona igual de bien con un archivo que esta herramienta no ha escrito.
- Prueba una URL real contra él. Escribe una ruta y el nombre de un rastreador y la herramienta dice permitida o bloqueada, y después nombra la regla que lo decide, su longitud en octetos y qué grupo se ha aplicado. Esa es la parte que conviene mirar, porque la regla que decide no suele ser la que uno espera.
Qué dice la norma en realidad, y qué no dice
El RFC 9309 define exactamente tres directivas: User-agent, Allow y Disallow. Esa es la lista completa. Crawl-delay no está en la norma, y Host tampoco. Sitemap tampoco forma parte del protocolo, aunque la especificación sí la menciona como ejemplo de registro que los rastreadores pueden decidir interpretar, y por eso esta herramienta la emite y la etiqueta como extensión y no como directiva.
Por eso aquí no hay campo de Crawl-delay, y es a propósito. Google ha dicho con todas las letras que ignora esa línea, y no está en la norma, así que un generador que te la ofrece te entrega algo que parece un límite de velocidad y no lo es. Si tu archivo ya la lleva, pégalo y la herramienta la listará en el apartado de qué hay en el archivo, marcada como ausente de la norma. No se oculta nada, pero tampoco se inventa nada.
Lo contrario también conviene saberlo, y sorprende más. Se cree generalmente que el asterisco y el dólar son una extensión de Google. Están en la norma: el asterisco casa con cero o más caracteres cualesquiera, y el dólar marca el final del patrón. Así que las directivas que todo el mundo trata como estándar en su mayoría no lo son, y la sintaxis que todo el mundo trata como no estándar sí lo es.
Decide la regla más larga, no la primera
Cuando varias reglas casan con una URL, la especificación es tajante: debe usarse la coincidencia más específica, y la más específica es la que tiene más octetos. El orden dentro del archivo da igual. Así que Disallow barra a seguido de Allow barra a barra b permite /a/b/c, porque el Allow son cuatro octetos frente a los dos del Disallow. Este es el malentendido más común sobre robots.txt, y por eso el probador enseña la regla que decide y su longitud en vez de un simple veredicto.
Si un Allow y un Disallow exactamente de la misma longitud casan los dos, la norma dice que debe ganar el Allow. La herramienta avisa expresamente cuando ocurre, porque dos reglas de igual longitud apuntando en sentidos opuestos suele ser señal de que el archivo dice algo que su autor no quería decir.
Hay otras dos reglas que pillan a la gente, y apuntan en direcciones contrarias. Los nombres de rastreador se comparan sin distinguir mayúsculas, así que Googlebot y googlebot son el mismo grupo. Las rutas se comparan distinguiendo mayúsculas, así que Disallow barra Admin no hace nada contra /admin. Un mismo archivo, dos reglas distintas sobre las mayúsculas. Y relacionado: cuando más de un grupo nombra al mismo rastreador, la norma obliga a combinar sus reglas en un único grupo, en vez de que gane el primero.
Por último, una regla que no casa no es una regla que bloquea. Si no casa ninguna, la URL queda permitida, y una línea Disallow vacía significa exactamente eso: permitirlo todo. Un grupo sin reglas dentro no dice absolutamente nada, y por eso este generador escribe un Disallow vacío explícito cuando le pides permitirlo todo.
Límites honestos
La limitación más importante no es de esta herramienta sino del propio archivo. Disallow impide que un rastreador pida una página; no saca esa página de los resultados de búsqueda. Una URL enlazada desde otro sitio puede seguir apareciendo, sin descripción, precisamente porque al rastreador se le dijo que no la mirara. Si quieres una página fuera de un índice, esa página tiene que ser rastreable y llevar una instrucción noindex, o desaparecer. Bloquearla en robots.txt es justo lo que garantiza que la instrucción no se lea nunca.
Tampoco es control de acceso. El archivo es legible por cualquiera en una dirección predecible, así que listar una ruta sensible es anunciarla. Lo que de verdad no debe alcanzarse necesita autenticación, no una petición cortés.
Hay un comportamiento que conviene conocer antes de tocar un archivo en producción, y casi nadie lo conoce. Si robots.txt devuelve un 404 el rastreador puede acceder a lo que quiera, que es el caso indulgente. Si devuelve un error 5xx del servidor, la norma dice que el rastreador debe asumir bloqueo total. O sea que un robots.txt perfectamente correcto, alojado en un servidor que está teniendo una mala tarde, se lee para un rastreador conforme como si el sitio entero estuviera bloqueado. Eso es un fallo de despliegue, no de sintaxis, y ningún validador puede avisarte.
Esta herramienta además examina un archivo aislado. No puede decirte si las rutas que escribiste existen, si tu servidor sirve realmente el archivo en la raíz, ni cómo se comporta en la práctica un rastreador concreto, porque la norma deja bastante margen y los rastreadores lo usan. Implementa lo que especifica el RFC, y donde un rastreador va más allá, lo dice en vez de adivinar.
¿Por qué es gratis?
Porque entra texto y sale texto. No hay servidor de por medio ni nada que descargar: el analizador, el comparador y el generador se ejecutan en tu navegador, así que nada de lo que escribes o pegas se sube, se registra ni se guarda en ninguna parte. Tu robots.txt es un archivo público, pero el resto de la estructura de tu sitio que aparezca en la caja de al lado no lo es, y no sale de la página.
Así que no hay cuenta, ni registro, ni nada reservado. El motor y las comprobaciones que lo verifican están en el repositorio junto a la página, incluido un barrido exhaustivo de 248.248 combinaciones de patrón y ruta contra un comparador independiente, sin una sola discrepancia.