Công cụ web / 02

Công cụ kiểm tra robots.txt

Biến tệp robots.txt của một trang web thành báo cáo chính sách trình thu thập dữ liệu nhanh chóng, dễ đọc.

Công cụ kiểm tra robots.txt: Đọc các quy tắc trình thu thập dữ liệu, nhóm tác nhân, khai báo sitemap và mã nguồn thô trong robots.txt của một trang web. TOEA tải tệp từ thư mục gốc của trang web và tóm tắt chính sách ký tự đại diện cho đường dẫn gốc. Công cụ giúp phát hiện các lệnh chặn diện rộng và quy tắc đặt sai vị trí; công cụ không kiểm tra liệu mọi trang có thể được lập chỉ mục hay không. Được xử lý an toàn theo yêu cầu.

Danh mục
Công cụ web
Lượt chạy
Trên máy chủ của TOEA
Chi phí
Miễn phí · không cần đăng ký
Trạng thái khả dụng
Sẵn sàng sử dụng
Trình đọc robots.txtKiểm tra URL công khai an toàn

TOEA kiểm tra tệp robots.txt trong thư mục gốc của trang web.

Ví dụ ngắn về robots.txt

Đặt tệp ở thư mục gốc của máy chủ, tại /robots.txt. User-agent chọn một nhóm trình thu thập dữ liệu, Disallow yêu cầu nhóm đó không tải các đường dẫn khớp, còn Allow có thể tạo ngoại lệ. Ví dụ này chặn một thư mục riêng tư, ngoại trừ thư mục báo chí công khai bên trong, và khai báo một sitemap.

User-agent: *
Disallow: /private/
Allow: /private/press/

Sitemap: https://example.com/sitemap.xml

Đường dẫn khớp dài nhất sẽ được ưu tiên; Allow thắng khi độ dài bằng nhau. Đường dẫn phân biệt chữ hoa chữ thường. Các quy tắc từ những nhóm khớp với cùng một tác nhân sẽ được kết hợp; trình thu thập có tên riêng không kế thừa quy tắc của nhóm ký tự đại diện. Tài liệu giao thức: https://www.rfc-editor.org/rfc/rfc9309.html

Các lỗi thường gặp cần kiểm tra

Disallow: / chặn mọi đường dẫn, trong khi giá trị Disallow trống không chặn gì. Tệp tại /blog/robots.txt không kiểm soát thư mục gốc của trang web, và các quy tắc trên một máy chủ không áp dụng cho tên miền phụ. Tránh chặn các tài nguyên mà công cụ tìm kiếm cần để hiển thị một trang.

Robots.txt kiểm soát việc thu thập dữ liệu, không kiểm soát quyền truy cập hoặc bảo đảm xóa khỏi kết quả tìm kiếm. Hãy dùng xác thực cho nội dung riêng tư. Với một trang công khai cần loại khỏi tìm kiếm, hãy cho phép thu thập dữ liệu và gửi noindex. Công cụ kiểm tra này tóm tắt các nhóm và chính sách gốc của ký tự đại diện; công cụ không kiểm tra mọi URL. Hướng dẫn tìm kiếm: https://developers.google.com/search/docs/crawling-indexing/robots/intro

Cách sử dụng

  1. Nhập bất kỳ trang nào trên trang web mà bạn muốn kiểm tra.
  2. Chọn “Kiểm tra robots.txt”.
  3. Xem các nhóm, tổng số quy tắc, sitemap và toàn bộ mã nguồn của tệp.

Quyền riêng tư và giới hạn

URL của trang web được gửi đến dịch vụ tải có giới hạn của TOEA và không được lưu trữ. Tệp robots.txt chỉ mang tính hướng dẫn; báo cáo này không chứng minh rằng mọi trình thu thập dữ liệu sẽ tuân theo tệp.

Công cụ liên quan

Câu hỏi thường gặp

robots.txt nên được đặt ở đâu?

Đặt tại /robots.txt trên máy chủ mà bạn muốn kiểm soát, chẳng hạn như https://example.com/robots.txt. Tệp nằm dưới /blog/ không kiểm soát toàn bộ trang web, và mỗi tên miền phụ cần có tệp riêng.

Disallow có xóa một trang khỏi kết quả tìm kiếm không?

Không. Robots.txt kiểm soát việc thu thập dữ liệu, không kiểm soát việc lập chỉ mục hoặc quyền truy cập. Một URL bị chặn vẫn có thể xuất hiện trong kết quả tìm kiếm. Để loại trừ một trang công khai, hãy cho phép thu thập dữ liệu và gửi chỉ thị noindex; hãy bảo vệ nội dung riêng tư bằng cơ chế xác thực.

Tôi nên kiểm tra những lỗi nào trước?

Disallow: / sẽ chặn toàn bộ trang web, còn giá trị Disallow trống thì không chặn gì. Hãy kiểm tra đường dẫn phân biệt chữ hoa chữ thường, ranh giới giữa các nhóm và việc các tài nguyên thiết yếu có bị chặn hay không. Một nhóm trình thu thập dữ liệu được nêu tên không kế thừa quy tắc từ nhóm ký tự đại diện.

Công cụ miễn phí · trên máy chủ của toea lượt chạy · không cần tài khoản