SEO Log File Analyzer
Caricate i log di accesso del vostro server e guardate come si muovono davvero sul sito i crawler dei motori di ricerca e dell'intelligenza artificiale: quali passano, con quale frequenza e dove finisce il budget di scansione.
- Limite giornaliero 0/3
- Limite mensile 0/5
Carica o incolla i log di accesso del server (formato combined di Apache/Nginx) per vedere come i bot dei motori scansionano il sito. L'analisi avviene sul server e non viene salvato nulla.
Un crawler vi dice che cosa c'è sul vostro sito. I log del server vi dicono che cosa Google ne fa davvero. SEO Log File Analyzer legge i vostri log di accesso. Mostra quali robot passano, con quale frequenza e su quali indirizzi. Mostra anche quanto budget di scansione si perde negli errori. Analizzate i log adesso: caricate un file oppure incollate qualche migliaio di righe, non viene salvato nulla.
Questo è l'unico insieme di dati della SEO che non si può indovinare. Posizioni, impressioni e statistiche di scansione vi arrivano sempre di seconda mano. I log di accesso sono la traccia grezza di ogni richiesta a cui il vostro server ha davvero risposto. A scriverli è la vostra stessa macchina.
Che cosa mostrano i log
Dopo il caricamento lo strumento separa il traffico dei robot veri dal resto. Poi lo scompone in numeri con cui potete lavorare.
- Quali crawler sono passati. Ogni robot noto con i suoi accessi, gli indirizzi unici e la distribuzione dei codici di stato ricevuti.
- Con quale frequenza sono tornati. La frequenza di scansione per giorno, così un calo o un picco si vede invece di essere supposto.
- Su che cosa hanno speso tempo. Gli indirizzi più scansionati, che raramente sono quelli che avreste immaginato.
- Dove la scansione si perde. Reindirizzamenti, 404, limitazioni di frequenza ed errori del server, ciascuno come quota delle richieste, con gli indirizzi relativi.
I crawler di intelligenza artificiale hanno una vista a parte
GPTBot, ClaudeBot e PerplexityBot rappresentano ormai una quota reale del traffico automatico. E si comportano in modo del tutto diverso da Googlebot. Sono elencati separatamente, con il numero di accessi e la data dell'ultimo passaggio.
L'attività dei crawler di intelligenza artificiale mostra se quei crawler noti trovano e scaricano i vostri contenuti. L'operatore a volte lo documenta. In tal caso ogni crawler è indicato come di addestramento, di ricerca o di recupero su richiesta. Una visita non garantisce né l'inclusione né la citazione nelle risposte generate dall'intelligenza artificiale.
Efficienza della scansione e dove va la scansione
Dell'efficienza di scansione vale la pena parlare solo con prove, e i log sono quella prova. Ogni risposta è classificata per ciò che significa. Riuscita, non modificata (304 non è spreco), reindirizzamenti, 404 e 410, limitazione di frequenza, errori del server. Ogni classe è una quota delle richieste del bot, con gli indirizzi.
Su un sito grande la sorpresa di solito sta qui. I parametri negli indirizzi, gli schemi di elenchi e archivi e i vecchi reindirizzamenti possono assorbire buona parte della scansione. Lo strumento li raggruppa per schema e mostra la quota, il numero di richieste e quello di indirizzi unici. Li segnala come possibili inefficienze, non come problemi confermati. Il giudizio resta vostro.
Confrontare i log con una scansione
Se usate anche DiagnoSEO Website Audit, scegliete un progetto già scansionato. L'analizzatore affianca allora i due insiemi di dati. Da quel confronto escono due elenchi, ed entrambi sono utili.
Gli indirizzi richiesti dal bot e non scoperti dalla scansione sono indirizzi potenzialmente orfani, nulla di più. Lo strumento li ordina in categorie probabili, come indirizzi con parametri o vecchi reindirizzamenti, e lascia a voi la conclusione. Gli indirizzi trovati dalla scansione e non richiesti risultano non visti da quel bot in questo periodo. Una finestra breve non dice nulla sul fatto che una pagina sia ignorata.
La funzione è facoltativa. Senza Website Audit installato il selettore semplicemente non compare e l'analisi dei log funziona allo stesso modo.
Dove trovare i log di accesso
La maggior parte dei pannelli di hosting li offre con un nome simile a «raw access logs». Su un server che gestite voi, Apache scrive per impostazione predefinita in /var/log/apache2/access.log e Nginx in /var/log/nginx/access.log.
Il formato deve essere il combined consueto, cioè proprio quello che entrambi scrivono di fabbrica. Cloudflare, una CDN o un bilanciatore davanti al server di origine cambiano ciò che quest'ultimo vede. Scaricate i log dal livello che risponde davvero al crawler.
Che fine fa il file
L'elaborazione avviene sul server, in memoria. Il log stesso non viene scritto né su disco né in un database. Non c'è un progetto da salvare né una cronologia. L'unica cosa che resta è una cache di breve durata dei risultati di verifica degli indirizzi IP. Non contiene indirizzi, identificativi del client o dati delle richieste.
I file oltre 12 MB vengono tagliati ai primi 12 MB. Su un sito di media grandezza sono di solito diversi giorni di traffico. Se il caricamento viene rifiutato subito, il limite è il post_max_size del vostro server e non lo strumento.
Log File Analyzer a confronto con altri strumenti
L'analisi dei log di solito è un esercizio di foglio di calcolo oppure un modulo sepolto in una piattaforma costosa. Qui è una sola pagina che legge un file e vi restituisce le tabelle. La dicitura «dipende» significa che la funzione esiste in alcuni strumenti o nei piani superiori.
| Funzione | DiagnoSEO Log File Analyzer | Altri strumenti |
|---|---|---|
| Caricare o incollare, con il risultato sulla stessa pagina | ✅ | ⚠️ dipende |
| Non viene salvato nulla e non serve creare un progetto | ✅ | ⚠️ dipende |
| Vista separata per i crawler di intelligenza artificiale (GPTBot, ClaudeBot, PerplexityBot) | ✅ | ❌ |
| Budget di scansione sprecato, ordinato per indirizzo e stato | ✅ | ✅ |
| Frequenza di scansione per giorno | ✅ | ✅ |
| Confronto con la vostra scansione | ✅ | ⚠️ dipende |
| Individuazione delle pagine orfane dal confronto | ✅ | ⚠️ dipende |
| Interfaccia in 33 lingue | ✅ | ❌ |
Domande frequenti
-
Il formato combined consueto che Apache e Nginx scrivono per impostazione predefinita. Ogni riga deve avere un indirizzo IP, una marca temporale, la richiesta, un codice di stato e un identificativo del client. Le righe illeggibili vengono saltate e contate, così vedete se il file è stato compreso.
-
No. L'elaborazione avviene sul server in memoria e il risultato torna al vostro browser. Nulla viene scritto su disco né in un database, e non c'è cronologia perché lo strumento non mantiene alcuno stato.
-
Fino a 12 MB per esecuzione e fino a 300 000 righe. I file più grandi vengono tagliati invece che rifiutati. Se il caricamento fallisce prima di arrivare allo strumento, il limite da alzare è il post_max_size del vostro server.
-
I robot si riconoscono dall'identificativo del client, che chiunque può falsificare. Prendete i numeri come un indizio forte, non come una prova. Se un singolo robot mostra volumi poco credibili, verificate un campione dei suoi indirizzi IP con una richiesta DNS inversa prima di agire.
-
Di solito i log provengono dal livello sbagliato. Se davanti al server di origine c'è Cloudflare o una CDN, è quel livello a rispondere alla maggior parte delle richieste e l'origine non le vede mai. Scaricate i log dal bordo della rete.
-
No. L'analisi dei log è completa da sola. Website Audit aggiunge soltanto il confronto, che mette i log a confronto con una scansione ed elenca gli indirizzi potenzialmente orfani e quelli non visti nel periodo del log.
-
L'analisi dei log è disponibile dal piano Pro in su. Aprite lo strumento per vedere lo stato attuale del vostro account.
-
Per un sito stabile basta una volta al mese. Guardate prima dopo una migrazione, un rifacimento o un calo improvviso di traffico, perché il log mostra la reazione del crawler prima che le posizioni la rispecchino.
Le posizioni raccontano il risultato. I log raccontano il comportamento che lo ha prodotto. Caricate un file di log e guardate che cosa hanno fatto i crawler.