SEO Log File Analyzer
Carregue os registos de acesso do seu servidor e veja como os rastreadores dos motores de busca e da inteligência artificial se movem realmente no seu site: quais passam, com que frequência e para onde vai o orçamento de rastreio.
- Limite diário 0/3
- Limite mensal 0/5
Carregue ou cole os logs de acesso do servidor (formato combined do Apache/Nginx) para ver como os robôs dos motores rastreiam o site. A análise é feita no servidor e nada é guardado.
Um rastreador diz-lhe o que está no seu site. Os registos do servidor dizem-lhe o que o Google faz realmente com ele. SEO Log File Analyzer lê os seus registos de acesso. Mostra que robôs passam, com que frequência e em que endereços. Mostra também quanto orçamento de rastreio se perde em erros. Analise agora os seus registos: carregue um ficheiro ou cole alguns milhares de linhas, nada fica guardado.
Este é o único conjunto de dados do SEO que não se pode adivinhar. As posições, as impressões e as estatísticas de rastreio chegam-lhe sempre em segunda mão. Os registos de acesso são o apontamento em bruto de cada pedido a que o seu servidor respondeu de facto. Quem os escreve é a sua própria máquina.
O que os registos mostram
Depois do carregamento, a ferramenta separa o tráfego dos robôs verdadeiros do resto. A seguir decompõe-o em números com que pode trabalhar.
- Que rastreadores passaram. Cada robô conhecido com as suas visitas, os endereços únicos e a distribuição dos códigos de estado recebidos.
- Com que frequência vieram. A frequência de rastreio por dia, para que uma queda ou um pico se veja em vez de ser suposto.
- Em que gastaram tempo. Os seus endereços mais rastreados, que raramente são a lista que teria imaginado.
- Onde o rastreio se perde. Redirecionamentos, 404, limitações de ritmo e erros do servidor, cada um como parte dos pedidos, com os respetivos endereços.
Os rastreadores de inteligência artificial têm uma vista própria
O GPTBot, o ClaudeBot e o PerplexityBot representam já uma parte real do tráfego automático. E comportam-se de forma muito diferente do Googlebot. Aparecem em separado, com o número de visitas e a data em que foram vistos pela última vez.
A atividade dos rastreadores de inteligência artificial mostra se esses rastreadores conhecidos encontram e descarregam o seu conteúdo. O operador por vezes documenta-o. Nesse caso cada rastreador é marcado como de treino, de pesquisa ou de descarga a pedido. Uma visita não garante a inclusão nem a citação em respostas geradas por inteligência artificial.
Eficiência de rastreio e para onde vai o rastreio
Da eficiência de rastreio só vale a pena falar com provas, e os registos são essa prova. Cada resposta é classificada pelo que significa. Bem-sucedida, não modificada (304 não é desperdício), redirecionamentos, 404 e 410, limitação de ritmo, erros do servidor. Cada classe é uma parte dos pedidos do robô, com os endereços.
Num site grande a surpresa costuma estar aqui. Os parâmetros nos endereços, os padrões de listagens e arquivos e os redirecionamentos antigos podem absorver boa parte do rastreio. A ferramenta agrupa-os por padrão e mostra a parte, o número de pedidos e o de endereços únicos. Assinala-os como possíveis ineficiências, não como problemas confirmados. O juízo é seu.
Cruzar os registos com um rastreio
Se também usa o DiagnoSEO Website Audit, escolha um projeto já rastreado. O analisador coloca então os dois conjuntos de dados lado a lado. Dessa comparação saem duas listas, e ambas são úteis.
Os endereços que o robô pediu e que o rastreio não descobriu são endereços possivelmente órfãos, nada mais. A ferramenta arruma-os em categorias prováveis, como endereços com parâmetros ou redirecionamentos antigos, e deixa-lhe a conclusão. Os endereços encontrados pelo rastreio e não pedidos surgem como não vistos por esse robô neste período. Uma janela curta nada diz sobre se uma página é ignorada.
Esta função é opcional. Sem o Website Audit instalado o seletor simplesmente não aparece e a análise de registos funciona da mesma maneira.
Onde encontrar os seus registos de acesso
A maioria dos painéis de alojamento disponibiliza-os com um nome semelhante a «raw access logs». Num servidor que administre, o Apache escreve por omissão em /var/log/apache2/access.log e o Nginx em /var/log/nginx/access.log.
O formato tem de ser o combined habitual, que é precisamente o que ambos escrevem de origem. O Cloudflare, uma CDN ou um balanceador à frente do servidor de origem alteram o que este chega a ver. Recolha os registos da camada que responde de facto ao rastreador.
O que acontece ao ficheiro
O processamento decorre no servidor, em memória. O próprio registo não é escrito em disco nem numa base de dados. Não há projeto para guardar nem histórico. A única coisa que fica é uma cache de curta duração dos resultados de verificação de endereços IP. Não contém endereços, identificadores de cliente nem dados de pedidos.
Os ficheiros acima de 12 MB são cortados nos primeiros 12 MB. Num site de dimensão média isso corresponde geralmente a vários dias de tráfego. Se o carregamento for recusado logo à partida, o limite é o post_max_size do seu servidor e não a ferramenta.
Log File Analyzer face a outras ferramentas
A análise de registos costuma ser um exercício de folha de cálculo ou um módulo enterrado numa plataforma cara. Aqui é uma única página que lê um ficheiro e lhe devolve as tabelas. A indicação «depende» significa que essa capacidade existe nalgumas ferramentas ou nos planos superiores.
| Capacidade | DiagnoSEO Log File Analyzer | Outras ferramentas |
|---|---|---|
| Carregar ou colar, com o resultado na mesma página | ✅ | ⚠️ depende |
| Nada fica guardado e não é preciso criar projeto | ✅ | ⚠️ depende |
| Vista separada para rastreadores de inteligência artificial (GPTBot, ClaudeBot, PerplexityBot) | ✅ | ❌ |
| Orçamento de rastreio desperdiçado, ordenado por endereço e estado | ✅ | ✅ |
| Frequência de rastreio por dia | ✅ | ✅ |
| Cruzamento com o seu próprio rastreio | ✅ | ⚠️ depende |
| Deteção de páginas órfãs a partir da comparação | ✅ | ⚠️ depende |
| Interface em 33 idiomas | ✅ | ❌ |
Perguntas frequentes
-
O formato combined habitual que o Apache e o Nginx escrevem por omissão. Cada linha precisa de um endereço IP, uma marca temporal, o pedido, um código de estado e um identificador do cliente. As linhas ilegíveis são ignoradas e contadas, para que veja se o ficheiro foi compreendido.
-
Não. O processamento decorre no servidor, em memória, e o resultado volta para o seu navegador. Nada é escrito no disco nem numa base de dados, e não há histórico porque a ferramenta não retém qualquer estado.
-
Até 12 MB por execução e até 300 000 linhas. Os ficheiros maiores são cortados em vez de recusados. Se o carregamento falhar antes de chegar à ferramenta, o limite a aumentar é o post_max_size do seu servidor.
-
Os robôs são reconhecidos pelo identificador do cliente, e qualquer pessoa o pode falsificar. Tome os números como um indício forte, não como prova. Se um robô mostrar um volume pouco credível, verifique uma amostra dos seus endereços IP com uma consulta DNS inversa antes de agir.
-
Normalmente os registos vêm da camada errada. Se o Cloudflare ou uma CDN estiver à frente do servidor de origem, é essa camada que responde à maioria dos pedidos e a origem nunca os vê. Recolha antes os registos na periferia.
-
Não. A análise de registos está completa por si só. O Website Audit acrescenta apenas o cruzamento, que confronta os registos com um rastreio e lista endereços possivelmente órfãos e endereços não vistos no período do registo.
-
A análise de registos está disponível a partir do plano Pro. Abra a ferramenta para ver o estado atual da sua conta.
-
Num site estável basta uma vez por mês. Consulte mais cedo depois de uma migração, de uma remodelação ou de uma quebra súbita de tráfego, porque o registo mostra a reação do rastreador antes de as posições a refletirem.
As posições contam o resultado. Os registos contam o comportamento que o produziu. Carregue um ficheiro de registo e veja o que os rastreadores andaram a fazer.