Indalo SEO

glossário

robots.txt

Arquivo na raiz do site que diz a cada robô o que ele pode rastrear. Controla o rastreio, e não a indexação: página bloqueada ainda pode aparecer.

O que é

O robots.txt segue o Protocolo de Exclusão de Robôs, publicado como RFC 9309 em 2022. Ele é dividido em grupos: cada grupo começa com uma ou mais linhas User-agent e segue com Allow e Disallow.

Três regras que quase todo mundo erra. Linhas User-agent seguidas se juntam no mesmo grupo. O grupo com o nome exato do robô vence o grupo *, mesmo que o * seja mais restritivo. E sem arquivo nenhum, tudo está liberado.

Ele controla o que o robô rastreia, e não o que aparece no resultado. Uma página bloqueada que recebe link de fora pode ser listada sem descrição.

O erro mais comum

Bloquear uma página no robots.txt para tirá-la do Google. O robô não entra, não lê o noindex, e a página pode continuar listada. Para tirar do índice, a página precisa estar liberada e declarar noindex.

Como o Indalo SEO mede isso no seu site

A leitura das portas de IA aplica essas três regras para seis robôs (dos motores do ChatGPT, do Gemini, do Perplexity e do Claude) e mostra a linha exata que decidiu cada porta. O nosso rastreador também obedece o robots.txt de quem ele lê.

Fontes

Veja também

Agora no seu site.

O raio-x lê 25 páginas sem cadastro e mostra onde cada um destes termos aparece.

Sem cadastro e sem cartãoO raio-x não é gravado em lugar nenhum