SEO Log File Analyzer

Hãy tải lên nhật ký truy cập của máy chủ và xem trình thu thập của công cụ tìm kiếm và trí tuệ nhân tạo thật sự di chuyển trong trang của bạn ra sao: loại nào ghé qua, bao lâu một lần và ngân sách thu thập đi đâu.

  • Giới hạn hằng ngày 0/3
  • Giới hạn hằng tháng 0/5
Xem trước miễn phí: chỉ 1,000 dòng đầu được phân tích. Đăng nhập gói Pro để phân tích toàn bộ tệp. Xem bảng giá

Hãy tải lên hoặc dán nhật ký truy cập của máy chủ (định dạng combined của Apache/Nginx) để xem rô-bốt của công cụ tìm kiếm quét trang web của bạn ra sao. Việc xử lý diễn ra trên máy chủ và không có gì được lưu lại.

Trình thu thập cho bạn biết trên trang của bạn có những gì. Nhật ký máy chủ cho biết Google thực sự làm gì với chúng. SEO Log File Analyzer đọc nhật ký truy cập của bạn. Nó cho thấy trình nào ghé qua, bao lâu một lần và tới những địa chỉ nào. Nó cũng cho thấy bao nhiêu ngân sách thu thập biến mất trong lỗi. Hãy phân tích nhật ký ngay: tải lên một tệp hoặc dán vài nghìn dòng, không có gì được lưu lại.

Đây là tập dữ liệu duy nhất trong tối ưu hóa công cụ tìm kiếm mà bạn không thể đoán ra. Thứ hạng, lượt hiển thị và thống kê thu thập luôn đến với bạn qua tay người khác. Nhật ký truy cập là ghi chép thô của từng yêu cầu mà máy chủ của bạn thật sự đã trả lời. Chính máy của bạn viết ra chúng.

Nhật ký cho thấy điều gì

Sau khi tải lên, công cụ tách luồng của trình thu thập thật khỏi mọi thứ khác. Rồi nó chia luồng ấy thành những con số bạn có thể dùng.

  • Những trình nào đã ghé. Mỗi trình đã biết kèm số lượt truy cập, các địa chỉ riêng biệt và phân bố mã trạng thái nhận được.
  • Chúng đến thường xuyên ra sao. Tần suất thu thập theo ngày, nên một cú sụt hay vọt lên là thấy được chứ không phải đoán.
  • Chúng dành thời gian cho gì. Các địa chỉ được thu thập nhiều nhất, và hiếm khi đó là danh sách bạn nghĩ tới.
  • Nơi thu thập bị hao hụt. Chuyển hướng, lỗi 404, giới hạn tốc độ và lỗi máy chủ, mỗi loại theo tỷ lệ yêu cầu, kèm địa chỉ tương ứng.

Trình thu thập trí tuệ nhân tạo có mục riêng

GPTBot, ClaudeBot và PerplexityBot nay chiếm một phần thật sự của luồng tự động. Hơn nữa chúng hành xử khác hẳn Googlebot. Chúng được liệt kê riêng, kèm số lượt và ngày ghé gần nhất.

Hoạt động của trình thu thập trí tuệ nhân tạo cho thấy các trình đó có tìm và tải nội dung của bạn hay không. Nhà vận hành đôi khi có ghi rõ điều này. Khi đó mỗi trình được đánh dấu là huấn luyện, tìm kiếm hoặc tải theo yêu cầu người dùng. Một lượt ghé không bảo đảm được đưa vào hay được trích dẫn.

Hiệu quả thu thập và nơi thu thập hướng tới

Hiệu quả thu thập chỉ đáng bàn khi có bằng chứng, và nhật ký chính là bằng chứng đó. Mỗi phản hồi được phân loại theo ý nghĩa. Thành công, không đổi (304 không phải lãng phí), chuyển hướng, 404 và 410, giới hạn tốc độ, lỗi máy chủ. Mỗi loại là một tỷ lệ yêu cầu của bot, kèm địa chỉ.

Trên trang lớn, bất ngờ thường nằm đúng ở đây. Tham số địa chỉ, mẫu danh sách và lưu trữ, cùng chuyển hướng cũ có thể nuốt phần lớn lượt thu thập. Công cụ gom chúng theo mẫu và hiện tỷ lệ, số yêu cầu và số địa chỉ duy nhất. Công cụ đánh dấu là kém hiệu quả tiềm tàng, không phải vấn đề đã xác nhận. Phán đoán vẫn thuộc về bạn.

Đối chiếu nhật ký với một lần thu thập

Nếu bạn cũng dùng DiagnoSEO Website Audit, hãy chọn một dự án đã thu thập. Bộ phân tích sẽ đặt hai tập dữ liệu cạnh nhau. Từ phép đối chiếu ấy ra hai danh sách và cả hai đều có ích.

Địa chỉ bot yêu cầu mà bản thu thập không tìm ra chỉ là địa chỉ có thể mồ côi. Công cụ xếp chúng vào nhóm khả dĩ, ví dụ địa chỉ có tham số hoặc chuyển hướng cũ, còn kết luận dành cho bạn. Địa chỉ bản thu thập tìm ra mà bot không yêu cầu được ghi là không thấy trong kỳ nhật ký này. Cửa sổ ngắn không nói gì về việc trang có bị bỏ qua hay không.

Tính năng này không bắt buộc. Không cài Website Audit thì ô chọn đơn giản là không hiện, còn phân tích nhật ký vẫn chạy y như cũ.

Tìm nhật ký truy cập ở đâu

Phần lớn bảng điều khiển lưu trữ cung cấp chúng dưới tên kiểu «raw access logs». Trên máy chủ bạn tự quản, Apache mặc định ghi vào /var/log/apache2/access.log còn Nginx vào /var/log/nginx/access.log.

Định dạng phải là combined thông thường, đúng thứ cả hai ghi ra từ đầu. Cloudflare, mạng CDN hay bộ cân bằng tải đứng trước máy chủ gốc sẽ đổi những gì máy chủ ấy thấy. Hãy lấy nhật ký từ lớp thật sự trả lời trình thu thập.

Tệp sẽ ra sao

Việc xử lý diễn ra trên máy chủ, trong bộ nhớ. Bản thân nhật ký không được ghi ra đĩa hay cơ sở dữ liệu. Không có dự án để lưu và không có lịch sử. Thứ duy nhất còn lại là bộ nhớ đệm ngắn hạn kết quả kiểm tra địa chỉ IP. Trong đó không có địa chỉ trang, dấu hiệu máy khách hay dữ liệu yêu cầu.

Tệp trên 12 MB bị cắt còn 12 MB đầu. Với trang cỡ vừa, đó thường là luồng của vài ngày. Nếu việc tải lên bị từ chối ngay, cái chặn bạn là post_max_size của máy chủ chứ không phải công cụ.

So với các công cụ khác

Phân tích nhật ký thường là bài tập trong bảng tính hoặc một phần chôn sâu trong nền tảng đắt tiền. Ở đây nó là một trang duy nhất, đọc tệp rồi trả bảng cho bạn. Ghi chú «tùy công cụ» nghĩa là khả năng ấy có ở một số công cụ hoặc ở gói cao hơn.

Khả năngDiagnoSEO Log File AnalyzerCông cụ khác
Tải lên hoặc dán, kết quả ngay trên cùng trang✅⚠️ tùy công cụ
Không lưu gì và không cần tạo dự án✅⚠️ tùy công cụ
Mục riêng cho trình thu thập trí tuệ nhân tạo (GPTBot, ClaudeBot, PerplexityBot)✅❌
Ngân sách thu thập phí phạm, xếp theo địa chỉ và mã trạng thái✅✅
Tần suất thu thập theo ngày✅✅
Đối chiếu với bản thu thập của chính bạn✅⚠️ tùy công cụ
Phát hiện trang mồ côi từ phép đối chiếu✅⚠️ tùy công cụ
Giao diện bằng 33 ngôn ngữ✅❌

Câu hỏi thường gặp

  • Định dạng combined thông thường mà Apache và Nginx ghi mặc định. Mỗi dòng cần có địa chỉ IP, dấu thời gian, yêu cầu, mã trạng thái và dấu hiệu của máy khách. Dòng không đọc được sẽ bị bỏ qua và được đếm, nên bạn biết tệp có được hiểu hay không.

  • Không. Việc xử lý diễn ra trên máy chủ trong bộ nhớ, còn kết quả quay về trình duyệt của bạn. Không có gì ghi xuống đĩa hay vào cơ sở dữ liệu, và không có lịch sử vì công cụ không giữ trạng thái.

  • Tối đa 12 MB mỗi lần chạy và tối đa 300 000 dòng. Tệp lớn hơn sẽ bị cắt chứ không bị từ chối. Nếu việc tải lên hỏng ngay trước khi tới công cụ, thứ cần nâng là post_max_size của máy chủ.

  • Trình thu thập được nhận ra qua dấu hiệu của máy khách, mà ai cũng có thể giả mạo. Hãy xem các con số như một dấu hiệu mạnh, không phải bằng chứng. Nếu một trình cho thấy khối lượng khó tin, hãy kiểm tra một ít địa chỉ IP của nó bằng truy vấn DNS ngược trước khi hành động.

  • Thường là nhật ký lấy từ sai lớp. Nếu trước máy chủ gốc có Cloudflare hay mạng CDN, chính lớp ấy trả lời phần lớn yêu cầu và máy chủ gốc không bao giờ thấy chúng. Hãy lấy nhật ký từ rìa mạng.

  • Không. Phân tích nhật ký đã trọn vẹn. Website Audit chỉ thêm phần đối chiếu, đặt nhật ký cạnh một bản thu thập và liệt kê địa chỉ có thể mồ côi cùng địa chỉ không thấy trong kỳ. Thiếu nó thì ô chọn vẫn ẩn.

  • Phân tích nhật ký có từ gói Pro trở lên. Hãy mở công cụ để xem tình trạng hiện tại của tài khoản bạn.

  • Với trang ổn định, mỗi tháng một lần là đủ. Hãy xem sớm hơn sau khi chuyển nhà, đổi giao diện hay lưu lượng sụt đột ngột, vì nhật ký cho thấy phản ứng của trình thu thập trước khi thứ hạng kịp phản ánh.

Thứ hạng kể về kết quả. Nhật ký kể về hành vi đã tạo ra kết quả ấy. Hãy tải lên một tệp nhật ký và xem các trình thu thập đã làm gì.

Mở khoá xếp hạng cao hơn và lưu lượng truy cập chất lượng

Phát triển doanh nghiệp của bạn với bộ phần mềm số 1 dùng AI cho SEO và tiếp thị nội dung.

Nâng cấp lên Advanced