SEO Log File Analyzer
サーバーのアクセスログをアップロードすると、検索エンジンとAIのクローラーがサイトを実際にどう巡っているかが見えます。どのボットが、どれくらいの頻度で来て、クロール予算がどこへ消えているかが分かります。
- 1日の上限 0/3
- 1か月の上限 0/5
サーバーのアクセスログ(ApacheやNginxのcombined形式)をアップロードするか貼り付けると、検索エンジンのボットがサイトをどうクロールしているか分かります。処理はサーバー上で行い、何も保存しません。
クローラーはサイトに何があるかを教えてくれます。サーバーのログは、Googleがそれを実際にどう扱っているかを教えてくれます。SEO Log File Analyzerはアクセスログを読みます。どのボットが、どれくらいの頻度で、どのURLを訪れているかを示します。クロール予算がどれだけエラーに消えているかも分かります。今すぐログを分析する:ファイルを上げるか数千行を貼り付けるだけで、何も保存されません。
SEOの中で、推測では手に入らない唯一のデータがこれです。順位も表示回数もクロールの統計も、いつも誰かの手を経て届きます。アクセスログは、サーバーが実際に応答したすべてのリクエストの生の記録です。書いているのは自分の機械です。
ログから分かること
アップロードすると、本物のクローラーの通信をそれ以外から切り分けます。そのうえで、手を動かせる数字に分解します。
- どのクローラーが来たか。既知のボットごとに、アクセス数、重複しないURLの数、受け取ったステータスコードの内訳が出ます。
- どれくらいの頻度で来たか。日ごとのクロール頻度なので、落ち込みや急増を推測せずに見て取れます。
- 何に時間を使ったか。最もクロールされたURLで、これが予想どおりの並びであることはまずありません。
- クロールがどこで失われるか。 リダイレクト、404、レート制限、サーバーエラーを、リクエストに占める割合とアドレスで示します。
AIクローラーには専用の画面があります
GPTBot、ClaudeBot、PerplexityBotは、いまや自動アクセスの実質的な一角を占めています。しかもGooglebotとは動き方がまるで違います。これらは別枠で、アクセス数と最後に見かけた日付とともに並びます。
人工知能クローラーの活動は、既知のそうしたクローラーがコンテンツを見つけて取得しているかを示します。運営者が明示している場合、各クローラーは学習用、検索用、利用者の求めに応じた取得として区別されます。訪問があっても、人工知能の回答に含まれることも引用されることも保証されません。
クロール効率とクロールの行き先
クロール効率は根拠があってこそ語る価値があり、ログがその根拠です。すべての応答は意味に応じて分類されます。成功、変更なし(304は無駄ではありません)、リダイレクト、404と410、レート制限、サーバーエラー。各分類はボットのリクエストに占める割合で、アドレスも併せて示されます。
大規模サイトでは、意外な事実はたいていここに潜んでいます。アドレスのパラメータ、一覧やアーカイブのパターン、古いリダイレクトが、クロールの大きな部分を飲み込むことがあります。ツールはこれらをパターンごとにまとめ、割合、リクエスト数、固有アドレス数を示します。確認済みの問題ではなく、非効率の可能性として印を付けます。判断はあなたに委ねられます。
ログとクロール結果を突き合わせる
DiagnoSEO Website Auditも使っているなら、クロール済みのプロジェクトを選んでください。分析はそこで二つのデータを並べます。この突き合わせから二つの一覧が出て、どちらも役に立ちます。
ボットが要求し、クロールが見つけなかったアドレスは、孤立している可能性があるというだけです。ツールはパラメータ付きアドレスや古いリダイレクトなど、ありそうな分類に振り分け、結論はあなたに残します。クロールが見つけ、ボットが要求しなかったアドレスは、この期間にそのボットが訪れていないものとして示されます。短い期間は、ページが無視されているかどうかを何も語りません。
この機能は任意です。Website Auditが入っていなければ選択欄そのものが現れず、ログの分析はまったく同じように動きます。
アクセスログの在りか
多くのホスティング管理画面では「raw access logs」のような名前で提供されます。自分で管理するサーバーなら、Apacheは既定で/var/log/apache2/access.logに書きます。Nginxは/var/log/nginx/access.logです。
形式はよく使われるcombinedである必要があり、どちらも最初からそれを書きます。オリジンの前にCloudflareやCDN、負荷分散装置があると、そのサーバーが見るものは変わります。クローラーに実際に応答している層からログを取ってください。
ファイルはどうなるか
処理はサーバーのメモリ上で行われます。ログ自体はディスクにもデータベースにも書き込まれません。保存する案件も履歴もありません。残るのはクローラーのIPアドレス検証結果の短期キャッシュだけです。そこにページのアドレス、クライアントの表示、リクエストの内容は含まれません。
12MBを超えるファイルは先頭の12MBまでに切り詰められます。中規模のサイトなら、たいてい数日分のアクセスにあたります。アップロードが最初から拒まれるなら、制限しているのは道具ではなくサーバーのpost_max_sizeです。
ほかの道具との違い
ログの分析は、表計算での作業か、高価な基盤の奥に埋もれた機能かのどちらかになりがちです。ここではファイルを読んで表を返すだけの一枚のページです。「道具による」とあるのは、一部の道具か上位プランにだけある機能という意味です。
| 機能 | DiagnoSEO Log File Analyzer | ほかの道具 |
|---|---|---|
| アップロードか貼り付けで、結果は同じページに | ✅ | ⚠️ 道具による |
| 何も保存せず、プロジェクトを作る必要もない | ✅ | ⚠️ 道具による |
| AIクローラー専用の画面(GPTBot、ClaudeBot、PerplexityBot) | ✅ | ❌ |
| 無駄になったクロール予算をURLとステータスコード順に | ✅ | ✅ |
| 日ごとのクロール頻度 | ✅ | ✅ |
| 自分のクロール結果との突き合わせ | ✅ | ⚠️ 道具による |
| 突き合わせからの孤立ページの発見 | ✅ | ⚠️ 道具による |
| 33言語の画面 | ✅ | ❌ |
よくある質問
-
ApacheとNginxが既定で書く、よく使われるcombined形式です。各行にIPアドレス、時刻、リクエスト、ステータスコード、クライアントの名乗りが必要です。読めない行は読み飛ばして数えるので、ファイルが正しく解釈されたかどうかが分かります。
-
いいえ。処理はサーバーのメモリー上で行われ、結果はブラウザーに返ります。ディスクにもデータベースにも書きません。状態を持たないので履歴もありません。
-
一度につき12MBまで、行数は30万行までです。それより大きいファイルは拒まれるのではなく切り詰められます。道具に届く前にアップロードが失敗するなら、上げるべきはサーバーのpost_max_sizeです。
-
ボットはクライアントの名乗りで見分けますが、それは誰でも偽れます。数字は強い手がかりであって、証拠ではありません。ある一つのボットが信じ難い量を示すなら、動く前にそのIPアドレスを何件か逆引きで確かめてください。
-
たいていはログを取る層が違っています。オリジンの前にCloudflareやCDNがあると、その層が大半のリクエストに自分で応答し、オリジンは見ることがありません。ログは網の縁から取ってください。
-
いいえ。ログ解析はそれだけで完結します。Website Auditは照合を加えるだけです。ログをクロールと突き合わせ、孤立の可能性があるアドレスと、ログ期間に見られなかったアドレスを列挙します。ない場合、選択欄は隠れたままです。
-
ログの分析はProプラン以上で使えます。道具を開くと、いまのアカウントの状態が分かります。
-
落ち着いたサイトなら月に一度で十分です。移転や作り直し、急なアクセス減のあとは早めに見てください。順位に表れるより先に、ログがクローラーの反応を見せてくれます。
順位は結果を語ります。ログは、その結果を生んだふるまいを語ります。ログファイルを上げて、クローラーが何をしていたか確かめてください。