SEO Log File Analyzer

上传服务器的访问日志,看清搜索引擎和人工智能的抓取工具究竟如何在你的网站中穿行:哪些来过、来得多频繁,以及抓取预算都消耗在了哪里。

  • 每日上限 0/3
  • 每月上限 0/5
免费预览:仅分析了前 1,000 行。登录 Pro 套餐即可分析整个文件。 查看价格

上传或粘贴服务器访问日志(Apache/Nginx 的 combined 格式),即可看到搜索引擎机器人如何抓取你的网站。处理在服务器端完成,不会保存任何内容。

抓取工具告诉你网站上有什么。服务器日志告诉你 Google 实际拿它做了什么。SEO Log File Analyzer 读取你的访问日志,显示哪些机器人来过、来得多频繁、访问了哪些网址。它还会显示有多少抓取预算消耗在了错误上。立即分析你的日志:上传文件或粘贴几千行,什么都不会被保存。

这是搜索引擎优化中唯一无法靠猜测得到的数据。排名、展现和抓取统计传到你手里时,总是经过了别人转述。访问日志则是你的服务器真正回应过的每一次请求的原始记录,由你自己的机器写下。

日志能看出什么

上传之后,工具会把真实的抓取流量与其他一切分开,再把它拆成你能动手处理的数字。

  • 哪些抓取工具来过。每一个已知机器人,连同访问次数、不重复网址数量和它收到的状态码分布。
  • 它们来得多频繁。按天统计的抓取频率,让下滑或激增看得见,而不是靠推测。
  • 它们把时间花在哪里。被抓取最多的网址,而这很少是你以为的那份清单。
  • 抓取在哪里流失。 重定向、404 错误、速率限制和服务器错误,各自占请求的比例,并附上相应地址。

人工智能抓取工具有独立的视图

GPTBot、ClaudeBot 和 PerplexityBot 如今已占自动流量的实际一部分,而且行为方式与 Googlebot 完全不同。它们被单独列出,附带访问次数和最近一次到访的日期。

人工智能抓取工具的活动显示这些已知工具是否发现并下载您的内容。运营方有时会予以说明,此时每个工具会标注为训练型、搜索型或应用户请求下载。一次访问并不保证被收录,也不保证在人工智能的回答中被引用。

抓取效率与抓取的去向

抓取效率只有有证据时才值得讨论,而日志就是那份证据。每个响应都按其含义分类。成功、未修改(304 不是浪费)、重定向、404 与 410、速率限制、服务器错误。每一类都是机器人请求中的占比,并附上地址。

在大型网站上,意外之处通常就藏在这里。地址中的参数、列表与归档模式以及旧的重定向,可能吞掉很大一部分抓取。工具按模式将其归组,显示占比、请求数和唯一地址数。它把这些标为可能的低效,而不是已确认的问题,判断仍归您。

把日志和抓取结果对照

如果你也在用 DiagnoSEO Website Audit,选一个已经抓取过的项目,分析器就会把两份数据并排放在一起。这一对照会得出两份清单,两份都有用。

机器人请求过而抓取未发现的地址,只是可能的孤立地址而已。工具将其归入可能的类别,例如带参数的地址或旧的重定向,结论留给您。抓取找到而机器人未请求的地址,记为该机器人在本期日志中未曾访问。很短的日志窗口无法说明一个页面是否被忽略。

这项功能可选。没有安装 Website Audit 时,选择框根本不会出现,日志分析照常运行。

访问日志在哪里找

多数主机控制面板会以「raw access logs」之类的名称提供。在你自己管理的服务器上,Apache 默认写入 /var/log/apache2/access.log,Nginx 写入 /var/log/nginx/access.log。

格式必须是常见的 combined,两者出厂时写的正是这种。源站前面若有 Cloudflare、CDN 或负载均衡器,源站看到的内容就会不同。请从真正回应机器人的那一层取日志。

文件会怎样

处理在服务器内存中完成。日志本身不会写入磁盘,也不会写入数据库。没有项目需要保存,也没有历史记录。唯一保留的是抓取工具 IP 校验结果的短期缓存。其中不含页面地址、客户端标识或请求数据。

超过 12 MB 的文件会被截到前 12 MB。对中等规模的网站来说,这通常是好几天的流量。如果上传一开始就被拒绝,限制你的是服务器的 post_max_size,而不是工具。

与其他工具相比

日志分析通常要么是电子表格里的功课,要么是埋在昂贵平台深处的一个模块。这里只是一个页面,读入文件后把表格交给你。标注「视工具而定」表示该能力只存在于部分工具或更高档的套餐中。

能力DiagnoSEO Log File Analyzer其他工具
上传或粘贴,结果就在同一页✅⚠️ 视工具而定
什么都不保存,也不必创建项目✅⚠️ 视工具而定
人工智能抓取工具独立视图(GPTBot、ClaudeBot、PerplexityBot)✅❌
按网址和状态码排序的浪费抓取预算✅✅
按天统计的抓取频率✅✅
与你自己的抓取结果对照✅⚠️ 视工具而定
从对照中发现孤立页面✅⚠️ 视工具而定
界面支持 33 种语言✅❌

常见问题

  • Apache 和 Nginx 默认写出的常见 combined 格式。每一行都需要有 IP 地址、时间戳、请求、状态码和客户端标识。无法解析的行会被跳过并计数,因此你能看出文件是否被正确读取。

  • 不会。处理在服务器内存中完成,结果返回你的浏览器。不写入磁盘,也不写入数据库;工具不保留状态,因此也没有历史记录。

  • 每次运行最多 12 MB,最多 30 万行。更大的文件会被截断,而不是被拒绝。如果上传还没到达工具就失败,需要调高的是服务器的 post_max_size。

  • 机器人是靠客户端标识识别的,而任何人都能伪造它。请把数字当作有力线索,而不是证据。如果某个机器人显示的量高得不可信,先用反向 DNS 查询抽查它的几个 IP 地址,再决定怎么做。

  • 通常是日志取错了层。如果源站前面有 Cloudflare 或 CDN,大多数请求由那一层直接回应,源站根本看不到。请改从网络边缘取日志。

  • 不需要。日志分析本身已经完整。Website Audit 只增加比对,将日志与一次抓取并排,列出可能的孤立地址以及在日志期间未曾出现的地址。没有它,选择框会保持隐藏。

  • 日志分析自 Pro 套餐起提供。打开工具即可查看你账户的当前状态。

  • 网站稳定的话,每月一次就够。迁移、改版或流量骤降之后要早些看,因为排名还没反映出来时,日志已经显示了抓取工具的反应。

排名讲的是结果。日志讲的是造成这个结果的行为。上传一个日志文件,看看抓取工具究竟做了什么。

解锁更高排名与优质流量

借助首屈一指的 AI 全栈 SEO 与内容营销软件,助力企业增长。

升级到高级版