#074 · Herramienta para desarrolladores

Robots.txt Generator

Crea un robots.txt a partir de reglas simples y explícitas. Define agentes, rutas permitidas o bloqueadas y una o varias ubicaciones de sitemap. La herramienta agrupa las directivas en un bloque válido, normaliza rutas básicas y avisa sobre líneas que no corresponden al formato esperado. No comprueba cómo un bot concreto interpretará extensiones no estándar.

Datos de entrada

Reglas de rastreo
Espacio publicitario

Cómo usar esta herramienta para desarrolladores

  1. Escribe directivas como user-agent=, disallow=, allow= y sitemap=.
  2. Incluye al menos un user-agent.
  3. Pulsa Generar robots.txt.
  4. Guarda el resultado como robots.txt en la raíz pública del sitio.

Qué hace esta herramienta para desarrolladores

Transforma líneas clave=valor en directivas con la capitalización habitual de robots.txt y mantiene el orden para que puedas revisar el grupo resultante.

Las rutas Allow y Disallow deben empezar por /. Sitemap debe ser una URL absoluta HTTP o HTTPS. Se rechazan claves desconocidas para evitar reglas silenciosamente ignoradas.

robots.txt controla rastreo, no autorización. Una URL bloqueada puede seguir siendo accesible directamente y, en algunos casos, indexada por otras señales.

Ejemplo

User-agent: * Disallow: /admin/ Allow: /tmp/public/ Sitemap: https://example.com/sitemap.xml

Casos de uso

  • Crear un robots.txt inicial para un sitio nuevo.
  • Bloquear rutas de administración del rastreo ordinario.
  • Declarar la ubicación del sitemap XML.

Consejos para obtener resultados fiables

  • No uses robots.txt para proteger contenido sensible.
  • Prueba cambios importantes en las herramientas para webmasters del buscador.
  • Evita bloquear recursos CSS o JS necesarios para renderizar páginas.
  • Usa rutas específicas y documenta por qué están bloqueadas.

Detalles del procesamiento

El generador procesa únicamente las directivas admitidas por la interfaz. No realiza peticiones al dominio indicado ni consulta un robots.txt existente.

No interpreta patrones avanzados particulares de cada crawler y no puede garantizar que todos los bots respeten el archivo.

Preguntas frecuentes

¿Dónde debe publicarse el archivo robots.txt?

Debe servirse normalmente desde /robots.txt en la raíz del host al que se aplican las reglas.

¿Disallow impide que un usuario abra una URL?

No. Solo comunica preferencias de rastreo a bots compatibles; no aplica control de acceso.

¿Puedo añadir varias líneas Sitemap en robots.txt?

Sí. Escribe varias directivas sitemap= con URLs absolutas y el generador conservará cada una.

¿Cuál es la diferencia entre Allow y Disallow?

Disallow indica rutas que un crawler no debería rastrear; Allow puede crear una excepción más específica dentro de una ruta bloqueada.

¿Un robots.txt garantiza que una página no se indexará?

No. Para controlar indexación se usan mecanismos como meta robots o cabeceras X-Robots-Tag, según el recurso.

Módulos y salida

MóduloQué muestra
AgenteUser-agent
ReglasAllow y Disallow
DescubrimientoSitemap
Salidarobots.txt