Generator Robots.txt

Tetapkan crawler yang Anda tuju, cantumkan jalur yang ingin diblokir dan yang ingin diizinkan, tambahkan crawl-delay opsional, dan arahkan ke sitemap Anda, lalu generator akan menyusun file robots.txt yang terformat dengan benar yang bisa Anda salin dan terapkan. Alat ini menangani format baris dan tanda baca yang tepat sehingga Anda tidak perlu menghafal sintaks atau ejaan user-agent.

Cara membuat file

  1. 1

    Tetapkan user-agent

    Masukkan crawler yang menjadi sasaran aturan, atau biarkan * untuk menargetkan semua bot.

  2. 2

    Cantumkan jalur yang diblokir

    Tambahkan direktori atau jalur yang akan diblokir, satu per baris, misalnya /admin/ atau /checkout/.

  3. 3

    Cantumkan jalur yang diizinkan

    Tambahkan jalur yang harus tetap dapat dirayapi, satu per baris, untuk membuat pengecualian di dalam Disallow yang lebih luas.

  4. 4

    Tambahkan sitemap dan crawl-delay

    Deklarasikan URL sitemap Anda dan, jika perlu, crawl-delay dalam detik.

  5. 5

    Salin dan terapkan

    Salin file yang dihasilkan dan letakkan di https://yourdomain.com/robots.txt, di direktori utama saja, bukan subdirektori.

Template awal yang umum

Izinkan semuanya (kebanyakan situs):

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

Blokir staging / admin:

User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml

Blokir crawler pelatihan AI, izinkan mesin pencari:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

User-agent yang perlu diketahui

User-agent Pemilik Tujuan
Googlebot Google Search Pengindeksan web
Googlebot-Image Google Pencarian gambar
Google-Extended Google Pelatihan Bard/Gemini (opsi keluar)
Bingbot Microsoft Pencarian Bing
DuckDuckBot DuckDuckGo Pencarian DDG
GPTBot OpenAI ChatGPT / pelatihan (opsi keluar)
ClaudeBot Anthropic Pelatihan Claude (opsi keluar)
CCBot Common Crawl Korpus yang digunakan banyak LLM
AhrefsBot Ahrefs Indeks tautan balik SEO
SemrushBot Semrush Riset SEO
MJ12bot Majestic Riset SEO

Bot pelatihan AI bersifat opsi keluar berdasarkan konvensi, bukan kewajiban hukum; operator yang beritikad baik mematuhi arahan ini, sedangkan yang kurang teliti tidak.

Aturan pencocokan jalur

  • Jalur bersifat relatif terhadap akar domain dan dimulai dengan /.
  • * cocok dengan karakter apa pun. Disallow: /*.pdf$ memblokir semua file PDF.
  • $ mengunci di akhir URL. Disallow: /*/trash$ memblokir /foo/trash tetapi bukan /foo/trashes/....
  • Kecocokan terpanjang yang menang. Allow: /admin/public/ menggantikan Disallow: /admin/ untuk sub-jalur itu.
  • Jalur membedakan huruf besar dan kecil.

Hal yang tidak dapat dilakukan robots.txt

  • Menghapus halaman dari Google. Gunakan tag meta noindex pada halaman itu sendiri.
  • Melindungi URL dari manusia. robots.txt bersifat publik dan hanya berupa saran bagi bot yang patuh.
  • Membatasi laju Googlebot. Crawl-delay diabaikan oleh Google; gunakan Search Console.
  • Memblokir bot yang mengabaikan robots.txt. Scraper spam tidak membaca file tersebut.

Daftar periksa penerapan

  1. Letakkan di https://yourdomain.com/robots.txt, di akar saja.
  2. Sajikan dengan Content-Type: text/plain (sebagian besar server melakukannya secara otomatis).
  3. Ukuran: kurang dari 500 KB. Google memotong file yang lebih besar.
  4. Setelah diterapkan, periksa file yang diambil di robots.txt Tester pada Google Search Console.
  5. Saat menghapus Disallow, perhatikan bahwa pembatalan pengindeksan bisa memakan waktu berminggu-minggu.

Pertanyaan yang Sering Diajukan

Tidak harus. Tanpa file itu, crawler menganggap “izinkan semua”. Jika ada yang perlu diblokir, staging, admin, checkout, pencarian internal, Anda memerlukannya.

Anda bisa meminta mereka berhenti lewat blok user-agent seperti GPTBot, ClaudeBot, CCBot, dan Google-Extended. Operator besar menghormatinya; scraper yang kurang teliti mengabaikannya sepenuhnya.

Crawler bersifat toleran, direktif yang tidak dikenal diabaikan. Kesalahan serius (HTTP 404 atau 500) diperlakukan sebagai “izinkan semua”. Validasi file sebelum menerapkannya.

Di akar setiap host yang ingin Anda cakup, https://www.example.com/robots.txt dan https://example.com/robots.txt adalah file terpisah untuk host terpisah.

Tidak. Jalur yang Anda masukkan hanya digunakan untuk menyusun file; tidak disimpan atau dicatat.

Alat Terkait

Alat ini tersedia dalam bahasa lain