Pemeriksa Robot.txt
Tempelkan aturan robots.txt Anda dan jalur URL yang ingin Anda uji, lalu alat pemeriksa akan membaca baris Allow dan Disallow untuk memberi tahu apakah jalur tersebut akan diblokir atau diizinkan. Berguna saat sebuah halaman tiba-tiba hilang dari hasil pencarian Google dan Anda ingin memastikan apakah aturan Disallow yang terlalu ketat menjadi penyebabnya, atau saat Anda menyusun aturan baru dan ingin memverifikasi sebuah jalur sebelum menerapkan file tersebut.
Cara kerja alat pemeriksa
-
1
Tempelkan aturan Anda
Salin baris Allow dan Disallow dari robots.txt Anda ke kolom, atau tulis yang baru untuk mencobanya.
-
2
Masukkan jalur untuk diuji
Ketik jalur URL yang ingin Anda periksa, misalnya /private/page. Gunakan hanya jalurnya, bukan domain lengkap.
-
3
Periksa aturannya
Alat ini memindai baris Allow dan Disallow dan menemukan aturan yang cocok dengan jalur yang Anda masukkan.
-
4
Baca hasilnya
Anda mendapatkan jumlah aturan yang ditemukan, jalur yang diuji, dan keputusannya: diizinkan secara bawaan, diblokir oleh Disallow, atau diizinkan oleh Allow.
Robot.txt yang minimal dan benar
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
- User-agent: \*. Berlaku untuk semua crawler yang tidak secara eksplisit disebutkan dalam blok lain.
- Allow:/. Semua hal diizinkan secara default.
- Disallow: /admin/. Direktori admin tidak dapat diakses.
- Sitemap: Menunjukkan kepada mesin pencari lokasi file sitemap berformat XML.
Aturan yang sebenarnya diikuti oleh Googlebot
Parser Google merupakan standar yang secara faktual digunakan untuk menafsirkan aturan yang ambigu:
– Jalur yang membedakan huruf kapital dan kecil: /Admin/ dan /admin/ berbeda.
– Pertandingan dengan panjang URL terpanjang yang menang: Allow: /admin/public/ mengalahkan Disallow: /admin/ untuk URL yang dimulai dengan /admin/public/.
- Wildcard:
*cocok dengan segala urutan karakter;$berada di akhir URL. - Komentar dimulai dengan
#. – Tidak bergantung pada urutan: Aturan dievaluasi berdasarkan spesifisitas (panjang jalur), bukan urutan penyajiannya.
Kesalahan Umum
| Kesalahan | Efek |
|---|---|
Disallow: / di bagian atas, tidak diizinkan |
Seluruh situs diblokir |
Disallow: *.pdf |
Banyak parser mengabaikannya, gunakan Disallow: /*.pdf$ |
| URL relatif atau absolut dalam Disallow | Diabaikan, jalur harus bersifat relatif |
Berbagai garis User-agent sebelum aturan |
Terkombinasi; aturan berlaku untuk semua UA yang tercantum |
| Ruang kosong di akhir jalur | Diperlakukan secara diam-diam sebagai jalur yang berbeda |
| Menempatkan file robots.txt di subdirektori | Hanya file domain akar yang diambil |
robots.txt vs noindex
File robots.txt menyatakan kepada crawler bahwa suatu URL tidak boleh diambil. Halaman yang telah terindeks namun kemudian diblokir dalam file robots.txt dapat tetap terindeks selama berbulan-bulan, crawler tidak dapat mengaksesnya untuk memastikan penghapusan tersebut. Jika Anda ingin halaman tersebut dihapus dari indeks, gunakan tag meta noindex atau header HTTP pada halaman itu sendiri agar crawler dapat melihatnya.
Keterlambatan Pengambilan Data (Crawl-delay)
Crawl-delay: 10 mewajibkan jeda selama 10 detik antara setiap permintaan pengindeksan. Google mengabaikan aturan ini (guna Search Console untuk mengatur frekuensi pengindeksan); sementara Bing, Yandex, dan beberapa crawler khusus lainnya mematuhinya. Gunakan aturan ini untuk situs kecil yang mengalami tekanan pengindeksan dari bot khusus.
Apa yang tidak dilakukan oleh “Disallow”?
- Mencegah tautan ke URL tersebut. Situs lain tetap dapat membuat tautan ke URL yang dilarang, dan URL tersebut akan muncul dalam hasil pencarian hanya dengan isi URL-nya saja (tanpa judul atau deskripsi).
- Mencegah halaman ditampilkan secara visual. Pengguna tetap dapat mengakses URL yang dilarang.
- Tutup URL tersebut dari publik. File robots.txt bersifat publik; mencantumkan jalur rahasia di dalamnya berarti jalur tersebut akan terlihat oleh orang lain.
Pertanyaan yang Sering Diajukan
Karena fitur ini hanya mencegah blok dari melakukan pengindeksan, bukan proses pengejaran konten (crawling). Jika Google sudah mengetahui URL-nya (melalui tautan atau sitemap), mereka dapat tetap menampilkan URL tersebut dalam hasil pencarian. Gunakan tag noindex pada halaman dan biarkan Google mengambilnya untuk memastikan penghapusan yang dilakukan.
Ya. Gunakan blok User-agent: BadBot yang memiliki aturan khususnya sendiri. Perlu dicatat bahwa bot yang tidak berperilaku baik sama sekali mengabaikan file robots.txt; hanya bot yang mematuhi aturan tersebut yang menggunakannya.
File robots.txt bersifat publik; penempatannya secara terbuka mengungkapkan lokasi situs web. Sebaiknya gunakan mekanisme autentikasi dan kontrol akses pada tingkat server sebagai penggantinya.
Ya, untuk jalur URL. Disallow: /Admin/ tidak menghambat penggunaan /admin/. Sesuaikan bentuk URL Anda dengan format yang sesungguhnya.
Ya. Daftarkan beberapa baris Sitemap: untuk mengacu pada peta situs XML yang terpisah atau indeks peta situs.
Alat Terkait
Generator Skema FAQ
Buat markup JSON-LD FAQPage dari pasangan pertanyaan dan jawaban agar halaman Anda memenuhi syarat untuk hasil kaya (rich results) dan kotak jawaban Google.
Ekstraktor Tautan Eksternal
Tempelkan kode HTML mentah, tentukan URL dasar secara opsional, dan dapatkan daftar bersih tanpa duplikat dari semua tautan eksternal http/https dalam kode untuk audit tautan dan evaluasi SEO.
Pemeriksa Panjang Deskripsi Meta
Ukur meta deskripsi dalam karakter dan perkiraan piksel, bandingkan acuan editorial, lalu tinjau contoh tata letak desktop dan seluler.
Pemeriksa Hreflang
Periksa anotasi hreflang dalam HTML tempelan secara lokal: kode, URL lengkap, duplikat, posisi, dan referensi diri.
Simulator SERP Google
Periksa snippet perkiraan bergaya Google dengan batas karakter untuk seluler dan desktop. Draf Anda tetap di sesi browser ini.
Pemeriksa header keamanan HTTP
Tempel header respons HTTP dan tinjau HSTS, CSP, clickjacking, MIME, referrer, serta kebijakan lintas origin secara lokal.
Alat ini tersedia dalam bahasa lain
- Robots.txt-checker [NL]
- Vérificateur de Robots.txt [FR]
- أداة فحص ملف robots.txt [AR]
- Sprawdzanie robots.txt [PL]
- Robots.txt-Prüfer [DE]
- Verificador de robots.txt [ES]
- เครื่องมือตรวจสอบไฟล์ robots.txt [TH]
- Robots.txtチェッカー [JA]
- Robots.txt-kontroll [SV]
- Trình kiểm tra robots.txt [VI]
- Robots.txt 검사기 [KO]
- Verificador de Robots.txt [PT]
- Robots.txt Checker [EN]
- Controllore Robots.txt [IT]
- Проверка robots.txt [RU]
- Robots.txt Denetleyici [TR]
- Robots.txt 检查器 [ZH]