Gerador de robots.txt
- Comece por um modelo: liberar tudo, bloquear tudo, WordPress, Magento ou personalizado.
- Ajuste as regras por agente: quais caminhos liberar e quais bloquear.
- Informe a URL do sitemap — é a linha que faz os buscadores encontrarem sua lista de páginas.
- Copie o resultado para um arquivo chamado robots.txt na raiz do domínio.
Ele controla **rastreamento**, não indexação. Bloquear um caminho impede que o robô baixe a página, mas não impede que a URL apareça nos resultados se houver links apontando para ela — o buscador exibe o endereço sem descrição, porque não pôde ler o conteúdo.
Para manter uma página fora dos resultados, o instrumento correto é a diretiva noindex na própria página. E há uma armadilha: se a página estiver bloqueada no robots.txt, o robô nunca a lê e portanto nunca vê o noindex.
O arquivo também não é um mecanismo de segurança. Ele é público, qualquer pessoa pode lê-lo, e listar ali um caminho sensível é apontar exatamente onde ele está.
- Bloquear pastas de CSS e JavaScript: o buscador precisa renderizar a página como o usuário a vê, e sem esses arquivos a avaliação sai errada.
- Bloquear o site inteiro em produção — costuma ser resquício de um ambiente de homologação promovido sem revisão.
- Confiar em crawl-delay: os principais buscadores ignoram essa diretiva. O ritmo de rastreamento se ajusta pela capacidade do servidor.
- Esquecer a linha do sitemap, que é a forma mais barata de expor a lista completa de URLs.
O arquivo precisa estar exatamente na raiz do domínio. Em subdiretório, ele é ignorado. Subdomínios têm arquivos próprios e independentes.
As regras são agrupadas por agente. Quando existe um bloco específico para um robô, ele ignora completamente o bloco genérico do asterisco em vez de somar as duas.
Entre regras que se sobrepõem, vence a mais específica — a de caminho mais longo — e não a que aparece primeiro.
Perguntas frequentes
Não necessariamente. O robots.txt impede o rastreamento, não a indexação. A URL ainda pode aparecer, sem descrição, se houver links apontando para ela. Para removê-la, use noindex na página e deixe o rastreamento liberado.
Não. O arquivo é público e listar um caminho ali revela sua existência. Use autenticação para proteger conteúdo.
Na raiz do domínio, acessível como o endereço do site seguido de barra robots.txt. Em subdiretório ele é ignorado, e cada subdomínio precisa do seu próprio.
Os principais buscadores ignoram a diretiva. O ritmo de rastreamento é ajustado automaticamente conforme a resposta do servidor.
Não é obrigatório, mas é a forma mais barata de garantir que o buscador encontre a lista completa de URLs sem depender só dos links internos.