glossário
robots.txt
Arquivo na raiz do site que diz a cada robô o que ele pode rastrear. Controla o rastreio, e não a indexação: página bloqueada ainda pode aparecer.
O que é
O robots.txt segue o Protocolo de Exclusão de Robôs, publicado como RFC 9309 em 2022. Ele é dividido em grupos: cada grupo começa com uma ou mais linhas User-agent e segue com Allow e Disallow.
Três regras que quase todo mundo erra. Linhas User-agent seguidas se juntam no mesmo grupo. O grupo com o nome exato do robô vence o grupo *, mesmo que o * seja mais restritivo. E sem arquivo nenhum, tudo está liberado.
Ele controla o que o robô rastreia, e não o que aparece no resultado. Uma página bloqueada que recebe link de fora pode ser listada sem descrição.
O erro mais comum
Bloquear uma página no robots.txt para tirá-la do Google. O robô não entra, não lê o noindex, e a página pode continuar listada. Para tirar do índice, a página precisa estar liberada e declarar noindex.
Como o Indalo SEO mede isso no seu site
A leitura das portas de IA aplica essas três regras para seis robôs (dos motores do ChatGPT, do Gemini, do Perplexity e do Claude) e mostra a linha exata que decidiu cada porta. O nosso rastreador também obedece o robots.txt de quem ele lê.
Fontes
Veja também
Agora no seu site.
O raio-x lê 25 páginas sem cadastro e mostra onde cada um destes termos aparece.