Robots.txt vs Noindex: Apa Bedanya (dan Kapan Menggunakan Masing-masing)
Memblokir halaman di robots.txt dan menambahkan tag noindex melakukan hal yang sangat berbeda — menggunakan yang salah adalah cara umum halaman secara tidak sengaja tetap tertahan di hasil pencarian, atau justru hilang sama sekali darinya.
Keduanya menyelesaikan dua masalah berbeda
robots.txt mengontrol crawling — apakah bot mesin pencari diizinkan untuk mengambil sebuah URL sama sekali. Tag noindex mengontrol pengindeksan — apakah halaman yang sudah di-crawl diizinkan muncul di hasil pencarian. Mencampuradukkan keduanya adalah salah satu cara paling umum halaman berakhir tertahan di hasil pencarian padahal Anda ingin menghilangkannya, atau tidak terlihat padahal Anda sebenarnya ingin ditemukan.
Apa yang sebenarnya dilakukan robots.txt
Aturan Disallow di robots.txt meminta crawler yang berperilaku baik untuk tidak mengambil sebuah URL. Ini tidak menghapus halaman yang sudah terindeks. Jika Google mengindeks URL sebelum diblokir — atau menemukannya ditautkan dari tempat lain dan mengindeks hanya URL serta teks tautannya tanpa pernah mengambil halamannya — ia dapat terus menampilkan URL tersebut di hasil selamanya, biasanya tanpa judul atau deskripsi, karena Google menghormati blokir tersebut dan tidak pernah meng-crawl ulang untuk memeriksanya.
Apa yang sebenarnya dilakukan noindex
Tag <meta name="robots" content="noindex"> (atau header HTTP X-Robots-Tag yang setara) secara eksplisit memberi tahu crawler yang sudah mengambil halaman tersebut: Anda boleh membacanya, tetapi jangan masukkan ke indeks Anda. Ini adalah cara andal untuk menghapus halaman dari hasil pencarian — tetapi hanya jika crawler benar-benar diizinkan mengambil halaman dan melihat tag tersebut sejak awal.
Kesalahan klasik: memblokir halaman yang juga Anda noindex
Jika sebuah URL diblokir di robots.txt dan memiliki tag noindex, tag noindex tersebut tidak pernah terbaca — crawler diberi tahu untuk tidak mengambil halaman sama sekali, sehingga tidak pernah melihat instruksi yang ada di halaman itu. Halaman bisa tetap terindeks (jika sebelumnya sudah, atau ditautkan dari tempat lain) tanpa cara bagi Google untuk mengetahui sebaliknya, karena menghapusnya membutuhkan membaca tag yang justru diblokir untuk dibaca. Ini adalah cara yang benar-benar umum bagi situs secara tidak sengaja membuat halaman bernilai rendah tetap tertahan di hasil pencarian selama berbulan-bulan.
Kapan menggunakan robots.txt
- Mengelola anggaran crawl pada situs besar — menjauhkan crawler dari jalur bernilai rendah dan bervolume tinggi (hasil pencarian internal, kombinasi filter berfaset) sehingga mereka menghabiskan lebih banyak waktu pada halaman yang penting.
- Memblokir lingkungan staging, rute admin, dan endpoint API secara langsung.
- Halaman yang tidak pernah ingin Anda crawl sama sekali — bahkan untuk memeriksa kontennya — karena crawl itu sendiri memakan sumber daya di kedua sisi.
Kapan menggunakan noindex
- Halaman yang ingin Anda pertahankan dan dapat di-crawl — untuk tautan internal, untuk pengguna, untuk struktur situs — tetapi tidak pernah muncul di hasil pencarian: arsip tag/kategori, halaman berpaginasi di luar halaman pertama, halaman terima kasih.
- Konten tipis atau duplikat yang belum siap Anda hapus sepenuhnya, di mana Anda masih ingin tetap dapat diakses pengunjung dan alat internal.
- Menghapus halaman yang sudah terindeks — ini hanya berfungsi jika halaman tetap dapat di-crawl sehingga Google benar-benar dapat melihat tag tersebut.
Aturan keputusan cepat
Tanyakan: apakah crawler perlu membaca halaman ini untuk tahu apa yang harus dilakukan dengannya? Jika instruksinya bergantung pada konten halaman itu sendiri yang terlihat (seperti tag noindex), robots.txt harus mengizinkan crawl-nya. Jika Anda ingin mencegah crawl itu sendiri — apa pun isi halamannya — robots.txt adalah alat yang tepat, dan noindex jadi berlebihan karena tidak akan pernah terbaca. Untuk konten yang dapat di-crawl dan duplikatif alih-alih tidak diinginkan sama sekali, tag canonical sering kali lebih sesuai daripada keduanya.
Ingin halaman berikutnya ditemukan lebih cepat daripada mengandalkan crawling organik saja?
IndexLaunch langsung mengirim setiap URL yang Anda kirimkan ke Bing, Yandex, Seznam, dan Naver melalui IndexNow saat itu juga saat Anda memasukkannya ke antrean.
Lihat Harga