Alat web / 02
Pemeriksa Robots.txt
Ubah file robots.txt situs menjadi laporan kebijakan crawler yang ringkas dan mudah dibaca.
Pemeriksa Robots.txt: Baca aturan crawler robots.txt, grup agen, deklarasi sitemap, dan source mentah sebuah situs. TOEA mengambil file dari root situs dan merangkum kebijakan wildcard untuk path root. Ini membantu menemukan blokir umum dan aturan yang ditempatkan secara keliru; alat ini tidak menguji apakah setiap halaman dapat diindeks. Diproses secara aman sesuai permintaan.
- Kategori
- Tools web
- Dijalankan
- Di server TOEA
- Biaya
- Gratis · tanpa daftar
- Ketersediaan
- Siap digunakan
Contoh singkat robots.txt
Tempatkan file di root host, yaitu sebagai /robots.txt. User-agent memilih grup crawler, Disallow meminta grup tersebut tidak mengambil path yang cocok, dan Allow dapat membuat pengecualian. Contoh ini memblokir direktori privat kecuali folder pers publiknya, serta mendeklarasikan sitemap.
User-agent: *
Disallow: /private/
Allow: /private/press/
Sitemap: https://example.com/sitemap.xmlPath yang paling panjang dan cocok akan berlaku; Allow menang jika terjadi seri. Path peka terhadap huruf besar-kecil. Aturan dari grup yang cocok dengan agen yang sama akan digabungkan; crawler bernama tidak mewarisi aturan grup wildcard. Referensi protokol: https://www.rfc-editor.org/rfc/rfc9309.html
Kesalahan umum yang perlu diperiksa
Disallow: / memblokir setiap path, sedangkan nilai Disallow yang kosong tidak memblokir apa pun. File di /blog/robots.txt tidak mengontrol root situs, dan aturan pada satu host tidak berlaku untuk subdomain. Hindari memblokir aset yang diperlukan mesin pencari untuk merender halaman.
Robots.txt mengontrol crawling, bukan akses atau penghapusan yang dijamin dari hasil pencarian. Gunakan autentikasi untuk konten privat. Untuk halaman publik yang harus dikecualikan dari pencarian, izinkan crawling dan sajikan noindex. Checker ini merangkum grup dan kebijakan root wildcard; tool ini tidak menguji setiap URL. Panduan penelusuran: https://developers.google.com/search/docs/crawling-indexing/robots/intro
Cara menggunakannya
- Masukkan halaman apa pun dari situs yang ingin Anda periksa.
- Pilih “Periksa robots.txt.”
- Tinjau grup, total aturan, sitemap, dan source lengkapnya.
Privasi & batasan
URL situs dikirim ke layanan fetch terbatas milik TOEA dan tidak disimpan. File robots.txt bersifat advisory; laporan ini tidak membuktikan bahwa setiap crawler akan mengikutinya.
Alat terkait
Pertanyaan umum
Di mana robots.txt harus ditempatkan?
Di /robots.txt pada host yang ingin Anda kendalikan, misalnya https://example.com/robots.txt. File di dalam /blog/ tidak mengendalikan seluruh situs, dan subdomain memerlukan file sendiri.
Apakah Disallow menghapus halaman dari hasil pencarian?
Tidak. Robots.txt mengatur crawling, bukan indexing atau akses. URL yang diblokir masih dapat muncul di hasil pencarian. Untuk mengecualikan halaman publik, izinkan crawling dan berikan directive noindex; lindungi konten pribadi dengan autentikasi.
Kesalahan apa yang harus saya periksa terlebih dahulu?
Disallow: / memblokir seluruh situs, sedangkan nilai Disallow yang kosong tidak memblokir apa pun. Periksa path yang peka huruf besar-kecil, batas grup, dan apakah aset penting ikut diblokir. Grup crawler bernama tidak mewarisi aturan dari grup wildcard.
Alat gratis · berjalan di server toea · tanpa perlu akun