Pemeriksa Robot.txt

Tempelkan aturan robots.txt Anda dan jalur URL yang ingin Anda uji, lalu alat pemeriksa akan membaca baris Allow dan Disallow untuk memberi tahu apakah jalur tersebut akan diblokir atau diizinkan. Berguna saat sebuah halaman tiba-tiba hilang dari hasil pencarian Google dan Anda ingin memastikan apakah aturan Disallow yang terlalu ketat menjadi penyebabnya, atau saat Anda menyusun aturan baru dan ingin memverifikasi sebuah jalur sebelum menerapkan file tersebut.

Cara kerja alat pemeriksa

  1. 1

    Tempelkan aturan Anda

    Salin baris Allow dan Disallow dari robots.txt Anda ke kolom, atau tulis yang baru untuk mencobanya.

  2. 2

    Masukkan jalur untuk diuji

    Ketik jalur URL yang ingin Anda periksa, misalnya /private/page. Gunakan hanya jalurnya, bukan domain lengkap.

  3. 3

    Periksa aturannya

    Alat ini memindai baris Allow dan Disallow dan menemukan aturan yang cocok dengan jalur yang Anda masukkan.

  4. 4

    Baca hasilnya

    Anda mendapatkan jumlah aturan yang ditemukan, jalur yang diuji, dan keputusannya: diizinkan secara bawaan, diblokir oleh Disallow, atau diizinkan oleh Allow.

Robot.txt yang minimal dan benar

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
  • User-agent: \*. Berlaku untuk semua crawler yang tidak secara eksplisit disebutkan dalam blok lain.
  • Allow:/. Semua hal diizinkan secara default.
  • Disallow: /admin/. Direktori admin tidak dapat diakses.
  • Sitemap: Menunjukkan kepada mesin pencari lokasi file sitemap berformat XML.

Aturan yang sebenarnya diikuti oleh Googlebot

Parser Google merupakan standar yang secara faktual digunakan untuk menafsirkan aturan yang ambigu:

– Jalur yang membedakan huruf kapital dan kecil: /Admin/ dan /admin/ berbeda. – Pertandingan dengan panjang URL terpanjang yang menang: Allow: /admin/public/ mengalahkan Disallow: /admin/ untuk URL yang dimulai dengan /admin/public/.

  • Wildcard: * cocok dengan segala urutan karakter; $ berada di akhir URL.
  • Komentar dimulai dengan #. – Tidak bergantung pada urutan: Aturan dievaluasi berdasarkan spesifisitas (panjang jalur), bukan urutan penyajiannya.

Kesalahan Umum

Kesalahan Efek
Disallow: / di bagian atas, tidak diizinkan Seluruh situs diblokir
Disallow: *.pdf Banyak parser mengabaikannya, gunakan Disallow: /*.pdf$
URL relatif atau absolut dalam Disallow Diabaikan, jalur harus bersifat relatif
Berbagai garis User-agent sebelum aturan Terkombinasi; aturan berlaku untuk semua UA yang tercantum
Ruang kosong di akhir jalur Diperlakukan secara diam-diam sebagai jalur yang berbeda
Menempatkan file robots.txt di subdirektori Hanya file domain akar yang diambil

robots.txt vs noindex

File robots.txt menyatakan kepada crawler bahwa suatu URL tidak boleh diambil. Halaman yang telah terindeks namun kemudian diblokir dalam file robots.txt dapat tetap terindeks selama berbulan-bulan, crawler tidak dapat mengaksesnya untuk memastikan penghapusan tersebut. Jika Anda ingin halaman tersebut dihapus dari indeks, gunakan tag meta noindex atau header HTTP pada halaman itu sendiri agar crawler dapat melihatnya.

Keterlambatan Pengambilan Data (Crawl-delay)

Crawl-delay: 10 mewajibkan jeda selama 10 detik antara setiap permintaan pengindeksan. Google mengabaikan aturan ini (guna Search Console untuk mengatur frekuensi pengindeksan); sementara Bing, Yandex, dan beberapa crawler khusus lainnya mematuhinya. Gunakan aturan ini untuk situs kecil yang mengalami tekanan pengindeksan dari bot khusus.

Apa yang tidak dilakukan oleh “Disallow”?

  • Mencegah tautan ke URL tersebut. Situs lain tetap dapat membuat tautan ke URL yang dilarang, dan URL tersebut akan muncul dalam hasil pencarian hanya dengan isi URL-nya saja (tanpa judul atau deskripsi).
  • Mencegah halaman ditampilkan secara visual. Pengguna tetap dapat mengakses URL yang dilarang.
  • Tutup URL tersebut dari publik. File robots.txt bersifat publik; mencantumkan jalur rahasia di dalamnya berarti jalur tersebut akan terlihat oleh orang lain.

Pertanyaan yang Sering Diajukan

Karena fitur ini hanya mencegah blok dari melakukan pengindeksan, bukan proses pengejaran konten (crawling). Jika Google sudah mengetahui URL-nya (melalui tautan atau sitemap), mereka dapat tetap menampilkan URL tersebut dalam hasil pencarian. Gunakan tag noindex pada halaman dan biarkan Google mengambilnya untuk memastikan penghapusan yang dilakukan.

Ya. Gunakan blok User-agent: BadBot yang memiliki aturan khususnya sendiri. Perlu dicatat bahwa bot yang tidak berperilaku baik sama sekali mengabaikan file robots.txt; hanya bot yang mematuhi aturan tersebut yang menggunakannya.

File robots.txt bersifat publik; penempatannya secara terbuka mengungkapkan lokasi situs web. Sebaiknya gunakan mekanisme autentikasi dan kontrol akses pada tingkat server sebagai penggantinya.

Ya, untuk jalur URL. Disallow: /Admin/ tidak menghambat penggunaan /admin/. Sesuaikan bentuk URL Anda dengan format yang sesungguhnya.

Ya. Daftarkan beberapa baris Sitemap: untuk mengacu pada peta situs XML yang terpisah atau indeks peta situs.

Alat Terkait

Alat ini tersedia dalam bahasa lain