SEO Log File Analyzer
Téléversez les journaux d'accès de votre serveur et voyez comment les robots des moteurs de recherche et de l'intelligence artificielle circulent vraiment sur votre site : lesquels passent, à quelle fréquence et où part le budget d'exploration.
- Limite quotidienne 0/3
- Limite mensuelle 0/5
Importez ou collez les logs d'accès du serveur (format combined Apache/Nginx) pour voir comment les robots des moteurs explorent votre site. L'analyse se fait sur le serveur et rien n'est conservé.
Un robot d'exploration vous dit ce qui figure sur votre site. Vos journaux de serveur vous disent ce que Google en fait réellement. SEO Log File Analyzer lit vos journaux d'accès. Il montre quels robots passent, à quelle fréquence et sur quelles adresses. Il montre aussi quelle part du budget d'exploration se perd dans les erreurs. Analysez vos journaux maintenant : téléversez un fichier ou collez quelques milliers de lignes, rien n'est conservé.
C'est le seul jeu de données du référencement qu'on ne peut pas deviner. Les positions, les impressions et les statistiques d'exploration vous parviennent toujours de seconde main. Les journaux d'accès sont la trace brute de chaque requête à laquelle votre serveur a vraiment répondu. C'est votre propre machine qui les écrit.
Ce que révèlent les journaux
Une fois le journal téléversé, l'outil sépare le trafic des vrais robots du reste. Il le décompose ensuite en chiffres exploitables.
- Quels robots sont venus. Chaque robot connu avec ses visites, ses adresses uniques et la répartition des codes d'état reçus.
- À quelle fréquence ils sont venus. La fréquence d'exploration par jour, si bien qu'une chute ou un pic se voit au lieu d'être supposé.
- Sur quoi ils ont passé du temps. Vos adresses les plus explorées, qui sont rarement celles qu'on aurait imaginées.
- Où l'exploration se perd. Redirections, 404, limitations de débit et erreurs serveur, chacune en part des requêtes, avec les adresses concernées.
Les robots d'intelligence artificielle ont leur propre vue
GPTBot, ClaudeBot et PerplexityBot représentent désormais une part réelle du trafic automatique. Et leur comportement n'a rien à voir avec celui de Googlebot. Ils sont listés à part, avec le nombre de visites et la date du dernier passage.
L'activité des robots d'intelligence artificielle montre si ces robots connus découvrent et téléchargent votre contenu. L'opérateur le documente parfois. Chaque robot est alors étiqueté d'entraînement, de recherche ou de récupération à la demande. Une visite ne garantit ni l'inclusion ni la citation dans les réponses générées par intelligence artificielle.
Efficacité d'exploration et destination de l'exploration
L'efficacité d'exploration ne se discute qu'avec des preuves, et les journaux sont cette preuve. Chaque réponse est classée selon son sens. Réussie, non modifiée (304 n'est pas du gaspillage), redirections, 404 et 410, limitation de débit, erreurs serveur. Chaque classe est une part des requêtes du robot, avec les adresses.
Sur un grand site, c'est là que se cache la surprise. Les paramètres d'adresse, les motifs de listes et d'archives et les anciennes redirections peuvent absorber une large part de l'exploration. L'outil les regroupe par motif et montre la part, le nombre de requêtes et celui d'adresses uniques. Il les signale comme inefficacités possibles, pas comme problèmes confirmés. Le jugement vous revient.
Confronter les journaux à une exploration
Si vous utilisez aussi DiagnoSEO Website Audit, choisissez un projet déjà exploré. L'analyseur met alors les deux jeux de données côte à côte. Cette comparaison produit deux listes, et toutes les deux sont utiles.
Les adresses demandées par le robot et non découvertes par l'exploration sont des adresses potentiellement orphelines, rien de plus. L'outil les range en catégories probables, comme les adresses à paramètres ou les anciennes redirections, et vous laisse la conclusion. Les adresses trouvées par l'exploration mais non demandées sont indiquées comme non vues par ce robot sur cette période. Une fenêtre courte ne dit rien sur le fait qu'une page soit ignorée.
Cette fonction est facultative. Sans Website Audit installé, le sélecteur n'apparaît tout simplement pas et l'analyse des journaux fonctionne à l'identique.
Où trouver vos journaux d'accès
La plupart des panneaux d'hébergement les proposent sous un nom du genre « raw access logs ». Sur un serveur que vous administrez, Apache écrit par défaut dans /var/log/apache2/access.log et Nginx dans /var/log/nginx/access.log.
Le format doit être le combined habituel, et c'est précisément celui que les deux écrivent d'origine. Cloudflare, un CDN ou un répartiteur de charge devant le serveur d'origine change ce que celui-ci voit. Récupérez les journaux de la couche qui répond vraiment au robot.
Ce qu'il advient du fichier
Le traitement a lieu sur le serveur, en mémoire. Le journal lui-même n'est écrit ni sur le disque ni dans une base de données. Il n'y a pas de projet à enregistrer ni d'historique. Seul subsiste un cache éphémère des résultats de vérification des adresses IP. Il ne contient ni adresses, ni identifiants de client, ni données de requêtes.
Les fichiers de plus de 12 Mo sont tronqués aux 12 premiers Mo. Sur un site de taille moyenne, cela représente en général plusieurs jours de trafic. Si le téléversement est refusé d'emblée, c'est le post_max_size de votre serveur qui vous limite, pas l'outil.
Log File Analyzer face aux autres outils
L'analyse de journaux est d'ordinaire soit un exercice de tableur, soit un module enfoui dans une plateforme coûteuse. Ici, c'est une seule page qui lit un fichier et vous rend les tableaux. La mention « selon les cas » signifie que la possibilité existe dans certains outils ou dans les forfaits supérieurs.
| Possibilité | DiagnoSEO Log File Analyzer | Autres outils |
|---|---|---|
| Téléverser ou coller, résultat sur la même page | ✅ | ⚠️ selon les cas |
| Rien n'est conservé, aucun projet à créer | ✅ | ⚠️ selon les cas |
| Vue distincte pour les robots d'intelligence artificielle (GPTBot, ClaudeBot, PerplexityBot) | ✅ | ❌ |
| Budget d'exploration gaspillé, classé par adresse et par code d'état | ✅ | ✅ |
| Fréquence d'exploration par jour | ✅ | ✅ |
| Confrontation avec votre propre exploration | ✅ | ⚠️ selon les cas |
| Détection des pages orphelines à partir de la comparaison | ✅ | ⚠️ selon les cas |
| Interface en 33 langues | ✅ | ❌ |
Questions fréquentes
-
Le format combined habituel qu'Apache et Nginx écrivent par défaut. Chaque ligne doit comporter une adresse IP, un horodatage, la requête, un code d'état et un identifiant du client. Les lignes illisibles sont ignorées et comptées, ce qui vous montre si le fichier a bien été compris.
-
Non. Le traitement a lieu sur le serveur, en mémoire, et le résultat repart vers votre navigateur. Rien n'est écrit sur le disque ni dans une base de données, et il n'y a pas d'historique puisque l'outil ne garde aucun état.
-
Jusqu'à 12 Mo par exécution et jusqu'à 300 000 lignes. Les fichiers plus gros sont tronqués plutôt que refusés. Si le téléversement échoue avant d'atteindre l'outil, c'est le post_max_size de votre serveur qu'il faut relever.
-
Les robots sont reconnus par l'identifiant du client, que n'importe qui peut falsifier. Prenez ces chiffres comme un indice fort, pas comme une preuve. Si un robot affiche un volume peu crédible, vérifiez un échantillon de ses adresses IP par une requête DNS inverse avant d'agir.
-
Les journaux viennent généralement de la mauvaise couche. Si Cloudflare ou un CDN se trouve devant votre serveur d'origine, c'est lui qui répond à la plupart des requêtes et l'origine ne les voit jamais. Récupérez plutôt les journaux en périphérie.
-
Non. L'analyse des journaux se suffit à elle-même. Website Audit n'ajoute que la confrontation, qui confronte les journaux à une exploration et liste les adresses potentiellement orphelines ainsi que celles non vues sur la période.
-
L'analyse des journaux est disponible à partir du forfait Pro. Ouvrez l'outil pour voir l'état actuel de votre compte.
-
Sur un site stable, une fois par mois suffit. Regardez plus tôt après une migration, une refonte ou une chute brutale de trafic, car le journal montre la réaction du robot avant que les positions ne la reflètent.
Les positions racontent le résultat. Les journaux racontent le comportement qui l'a produit. Téléversez un fichier de journal et voyez ce qu'ont fait les robots.