Generador de robots.txt
- Empieza por una plantilla: permitir todo, bloquear todo, WordPress, Magento o personalizada.
- Ajusta las reglas por agente: qué rutas permitir y cuáles bloquear.
- Indica la URL del sitemap: esa línea es la que hace que los buscadores encuentren tu lista de páginas.
- Copia el resultado en un archivo llamado robots.txt en la raíz del dominio.
Controla el **rastreo**, no la indexación. Bloquear una ruta impide que el robot descargue la página, pero no impide que la URL aparezca en los resultados si hay enlaces apuntando a ella: el buscador muestra la dirección sin descripción, porque no pudo leer el contenido.
Para mantener una página fuera de los resultados, el instrumento correcto es la directiva noindex en la propia página. Y hay una trampa: si la página está bloqueada en robots.txt, el robot nunca la lee y por tanto nunca ve el noindex.
El archivo tampoco es un mecanismo de seguridad. Es público, cualquiera puede leerlo, y listar ahí una ruta sensible es señalar exactamente dónde está.
- Bloquear carpetas de CSS y JavaScript: el buscador necesita renderizar la página como la ve el usuario, y sin esos archivos la evaluación sale mal.
- Bloquear el sitio entero en producción, normalmente un resto de un entorno de pruebas promocionado sin revisión.
- Confiar en crawl-delay: los principales buscadores ignoran esa directiva. El ritmo de rastreo se ajusta según lo que aguanta el servidor.
- Olvidar la línea del sitemap, la forma más barata de exponer la lista completa de URLs.
El archivo debe estar exactamente en la raíz del dominio. En un subdirectorio se ignora. Los subdominios tienen archivos propios e independientes.
Las reglas se agrupan por agente. Cuando existe un bloque específico para un robot, ese robot ignora por completo el bloque genérico del asterisco en lugar de sumar ambos.
Entre reglas que se solapan gana la más específica —la de ruta más larga— y no la que aparece primero.
Preguntas frecuentes
No necesariamente. El robots.txt impide el rastreo, no la indexación. La URL puede seguir apareciendo, sin descripción, si hay enlaces hacia ella. Para eliminarla, usa noindex en la página y deja el rastreo permitido.
No. El archivo es público y listar una ruta ahí revela que existe. Usa autenticación para proteger contenido.
En la raíz del dominio, accesible como la dirección del sitio seguida de barra robots.txt. En un subdirectorio se ignora, y cada subdominio necesita el suyo.
Los principales buscadores ignoran la directiva. El ritmo de rastreo se ajusta automáticamente según responda el servidor.
No es obligatorio, pero es la forma más barata de asegurar que el rastreador encuentre la lista completa de URLs sin depender solo de los enlaces internos.