SEO / Thu thập dữ liệu

Trình tạo robots.txt

Tạo tệp robots.txt với quy tắc cho từng bot, các dòng sitemap và mẫu cho phép mọi bot, chặn trang staging hoặc chặn bot thu thập dữ liệu để huấn luyện AI.

Trình tạo robots.txt: robots.txt cho các bot thu thập dữ liệu biết chúng được phép truy cập những đường dẫn nào, theo tiêu chuẩn RFC 9309: mỗi nhóm nêu các user-agent, sau đó là các quy tắc Disallow và Allow; quy tắc khớp cụ thể nhất sẽ được ưu tiên. Mẫu huấn luyện AI thêm một nhóm cho GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot và meta-externalagent — đây là những tên mà đơn vị vận hành của chúng tài liệu hóa để từ chối việc dùng dữ liệu cho huấn luyện. Trình tạo sẽ cảnh báo về các đường dẫn không có dấu gạch chéo ở đầu, URL sitemap tương đối và các quy tắc chặn mọi bot thu thập dữ liệu. Chạy 100% cục bộ trong trình duyệt của bạn, không có tệp nào được tải lên máy chủ.

Danh mục
Công cụ web
Lượt chạy
Trong trình duyệt của bạn
Chi phí
Miễn phí · không cần đăng ký
Trạng thái khả dụng
Sẵn sàng sử dụng
Trình tạo robots.txtXử lý cục bộ

Chạy hoàn toàn trong trình duyệt của bạn

Nhóm 1
User-agent: *
Disallow: /admin/
Disallow: /cart/

Sitemap: https://example.com/sitemap.xml

Đặt tệp ở thư mục gốc của trang web, chẳng hạn https://example.com/robots.txt. Tệp này yêu cầu trình thu thập dữ liệu không truy cập; nó không ẩn hoặc bảo vệ bất kỳ thứ gì, và Google bỏ qua Crawl-delay. Tên các trình thu thập dữ liệu AI đã được kiểm tra vào ngày 2 tháng 10 năm 2026; các công ty có thể bổ sung tên mới, vì vậy hãy xem tài liệu của họ.

Các lỗi thường gặp

Việc chặn CSS và JavaScript khiến công cụ tìm kiếm không thể hiển thị trang đúng cách; chặn một trang mà bạn muốn xóa khiến trình thu thập không nhìn thấy thẻ noindex; để nguyên Disallow: / của một trang đang thử nghiệm sau khi ra mắt sẽ ẩn toàn bộ trang web. Hãy kiểm tra tệp đang hoạt động sau mỗi lần triển khai.

Để kiểm tra một tệp hiện có, hãy dùng công cụ kiểm tra robots.txt; để kiểm tra sitemap mà tệp đó trỏ đến, hãy dùng công cụ kiểm tra sitemap.

Ký tự đại diện

Google và Bing hỗ trợ * cho mọi ký tự và $ cho phần cuối của URL: Disallow: /*.pdf$ sẽ chặn mọi tệp PDF. Quy tắc khớp dài nhất sẽ được ưu tiên, vì vậy Allow: /shop/sale/ sẽ ghi đè Disallow: /shop/.

Cách sử dụng

  1. Bắt đầu từ một mẫu hoặc chỉnh sửa các nhóm user-agent và đường dẫn.
  2. Thêm URL sitemap của bạn.
  3. Sao chép hoặc tải xuống robots.txt, rồi đặt tệp này ở thư mục gốc của trang web.

Quyền riêng tư và giới hạn

Tệp được tạo trong trình duyệt của bạn.

Công cụ liên quan

Câu hỏi thường gặp

robots.txt có chặn các trang khỏi kết quả tìm kiếm Google không?

Tệp này ngăn việc thu thập dữ liệu, không ngăn lập chỉ mục: một trang bị chặn vẫn có thể xuất hiện trong kết quả nếu các trang web khác liên kết đến trang đó. Để giữ một trang khỏi kết quả tìm kiếm, hãy cho phép thu thập dữ liệu và thêm thẻ meta noindex.

Chặn bot thu thập dữ liệu AI có xóa nội dung của tôi khỏi các công cụ AI không?

Thao tác này yêu cầu các bot đó không thu thập các trang của bạn kể từ bây giờ; nó không xóa dữ liệu đã được thu thập, và chỉ những bot tuân thủ robots.txt mới thực hiện theo yêu cầu.

Crawl-delay có hoạt động không?

Bing và một số bot khác tôn trọng thiết lập này; Google bỏ qua thiết lập này và tự động điều chỉnh tốc độ thu thập dữ liệu.

Công cụ miễn phí · trong trình duyệt của bạn lượt chạy · không cần tài khoản