Cloudflare AI Crawl Control: Cara Menolak Bot Latihan AI Tanpa Kehilangan Pengunjung
Empat bulan lalu seorang pemilik kedai kopi di Braga mengirim pesan singkat. Pelanggannya turun drastis dalam tiga pekan terakhir, padahal produk dan harganya tidak berubah sama sekali. Tiga hari kemudian saya membuka laporan pengunjungnya untuk melihat dari mana penurunan itu datang.
Sebagian besar pengunjungnya masih datang dari pencarian Google. Hanya saja kata kunci yang biasanya menduduki posisi pertama tiba-tiba tidak muncul sama sekali di hasil pencarian. Halaman produknya masih ada, tapi membeku di halaman kedua.
Dua hari kemudian saya cek file robots.txt website itu. Ada satu blok baru yang tidak pernah ada sebelumnya, dan blok itu hanya berlaku untuk satu crawler saja. Hasilnya jelas: Googlebot tidak lagi boleh membaca halaman mana pun di website itu.
Keinginannya sederhana dan wajar. Dia hanya ingin isi website-nya tidak dipakai untuk melatih model kecerdasan buatan.

Tiga jenis bot, bukan satu
Sebelum 1 Juli 2026, semua bot AI dianggap satu jenis. Sekarang Cloudflare membelahnya menjadi tiga.
Kategori pertama adalah bot Search. Bot ini mengindeks halaman Anda supaya bisa muncul di hasil pencarian dan menjadi rujukan saat menjawab pertanyaan.
Kategori kedua adalah bot Training. Bot ini menyerap isi website Anda untuk melatih model. Datanya diserap permanen ke dalam bobot model, dan tidak bisa ditarik kembali meski Anda menghapusnya.
Hal inilah yang membuat banyak pemilik usaha kecil tidak nyaman. Menghapus halaman di website Anda tidak akan menarik kembali apa pun yang sudah diserap model.
Kalau Anda berubah pikiran di tengah jalan, menutup pintu setelah isinya masuk tidak akan mengembalikan apa pun.
Kategori ketiga adalah bot Agent. Bot ini tidak mengindeks, melainkan bertindak untuk seseorang secara langsung. Contohnya memesan produk atau mengisi formulir di website Anda.
Pembagian ini bukan detail teknis yang bisa diabaikan. Bagi website UMKM, hanya kategori pertama yang membawa pelanggan.
Perlu saya tegaskan di sini, karena sering disalahpahami. Bot pencarian dan bot latihan sama-sama membaca halaman Anda. Bedanya ada di hasil akhir pembacaan itu.
Tapi memisahkan ketiganya tidak sesederhana yang dibayangkan, karena sebagian crawler mengerjakan lebih dari satu tugas sekaligus.
Masalahnya: satu crawler untuk dua keperluan
Inilah inti persoalan yang membuat pemilik kedai di Braga itu kehilangan pelanggan. Googlebot, Bingbot, dan Applebot bukan crawler khusus training. Mereka crawler campuran.
Satu crawler itu melakukan dua pekerjaan sekaligus, yaitu mengindeks untuk pencarian dan sekaligus mengumpulkan bahan latihan model.
Sebelum September 2026, tidak ada cara untuk memisahkan dua hal ini. Anda hanya punya dua pilihan, dan keduanya tidak memuaskan.
Bot pencarian menyimpan salinan halaman supaya bisa ditampilkan kembali ketika ada yang mencarinya. Bot latihan justru mengubah isi halaman menjadi pola di dalam bobot model, dan pola itu tidak bisa dibalik menjadi teks asli.
Perbedaannya terasa saat Anda mengubah isi halaman. Pada bot pencarian, perubahan itu langsung terbaca. Pada bot latihan, yang tersisa hanyalah pola, bukan teks yang bisa Anda koreksi lagi.
Data dari Cloudflare menunjukkan arah kebalikannya. Kurang dari satu persen situs memblokir bot pencarian, sementara sekitar tujuh belas persen memblokir bot latihan dengan cara apa pun.
Jadi memblokir bot latihan masih dianggap urusan yang belum mendesak, sementara memblokir bot pencarian hampir tidak pernah dilakukan.
Pengaturan baru dan jebakan yang menyesatkan
Perubahan besar Cloudflare datang pada 15 September 2026.
Saat itu Cloudflare memperkenalkan sebuah pilihan baru bernama Disallow AI Training, dan mengubah cara kerja kontrol botnya.
Cara kerjanya begini. Preferensi menolak ini ditulis di file robots.txt, supaya bisa dibaca crawler mana pun.
Crawler yang disebut accountable, yaitu Google, Apple, dan Microsoft, tetap boleh merayapi website Anda untuk kebutuhan pencarian.
Sementara crawler khusus latihan milik empat perusahaan besar dihentikan langsung di sisi server.
Jebakan besar: Jangan pilih Block
Di sinilah banyak pemilik website menyalahi langkah. Mereka membuka panel kendali bot, lalu memilih kata Block pada kategori Training.
Setelah 15 September 2026, pilihan Block itu punya efek yang jauh lebih besar dari yang dibayangkan.
Block pada kategori Training kini juga memblokir Googlebot, Bingbot, dan Applebot sekaligus.
Ini persis kesalahan yang dilakukan pemilik kedai di Braga. Dia menolak training, lalu kehilangan pencarian.
Solusinya sederhana, yaitu pilih Disallow AI Training, bukan Block.
Cloudflare sudah menyiapkan migrasi otomatis untuk situs yang tertimpa perubahan ini, sehingga sebagian besar kasus sudah ditangani tanpa campur tangan pemilik.
Migrasi ini berjalan sendiri di latar belakang, jadi sebagian besar kasus sudah tertangani tanpa campur tangan pemilik.
Perbandingan pengaturan
| Kategori | Googlebot dan sejenisnya | Bot latihan | Bot agent |
|---|---|---|---|
| Allow | Tetap mengindeks, aman | Data masuk bobot model | Bot bisa bertindak |
| Disallow AI Training | Tetap mengindeks | Ditolak di sisi server | Tidak ada pengaturan |
| Block | Hilang dari pencarian | Ditolak | Ditolak |
Domain yang memakai aturan lama dipindahkan sendiri ke pengaturan yang baru.
Domain yang sebelumnya memakai aturan blokir bot AI lama mendapat pengaturan baru, yaitu pencarian diizinkan, latihan ditolak, dan bot agent diblokir hanya pada halaman beriklan.
Untuk domain baru, aturan bakanya sudah disiapkan sejak 15 September 2026. Website yang memasang iklan mendapat pencarian diizinkan, latihan ditolak, dan bot agent diblokir pada halaman beriklan.
Website tanpa iklan mendapat semua diizinkan. Perhatikan satu hal penting: belum ada pengaturan untuk menolak bot agent.
Alasannya, belum ada standar internet yang disepakati untuk hal ini. Semua fitur ini juga hanya berlaku kalau website Anda berjalan di belakang Cloudflare.
Perlu ditambahkan soal paket gratis. Di paket gratis, Cloudflare hanya mengenali crawler AI dari nama user agent-nya. Deteksi yang lebih akurat butuh paket berbayar.
Perlu dijelaskan sedikit cara kerjanya, karena itu menjawab kenapa bot agent tidak punya tombol penolakan sendiri. Kontrol bot ini bekerja di sisi server, bukan lewat file robots.txt. Bot yang dikenali dihentikan sebelum sempat sampai ke hosting Anda, sehingga tidak pernah menyentuh isi website sama sekali.
Fitur ini juga menggantikan fungsi Managed Robots.txt yang sebelumnya tersedia. Sekarang aturan Anda disisipkan di awal file robots.txt yang sudah ada, bukan menggantikannya. Ini penting karena aturan lama Anda tetap terbaca.

Yang saya cek di website sendiri
Sebelum menulis artikel ini saya cek antond.net, karena kami rutin mengerjakan maintenance website klien.
Hasil pertama yang perlu saya sampaikan terus terang. antond.net tidak memakai Cloudflare sama sekali.
Header responsnya menunjukkan platform: hostinger dan server: hcdn. Jadi seluruh pengaturan yang saya bahas di artikel ini tidak berlaku untuk website ini.
Untuk website tanpa Cloudflare, hanya ada dua pilihan, yaitu menulis aturan manual di file robots.txt atau mengganti layanan CDN.
Temuan kedua lebih serius. File robots.txt antond.net punya blok duplikat yang saling bertabrakan.
Baris awal memblokir folder WooCommerce dan area administrative WordPress. Tapi blok dari plugin SEO di bawahnya menulis ulang dengan aturan kosong untuk semua crawler.
Akibatnya aturan asli di baris atas praktis tidak berlaku lagi. Ini bukan kasus langka. Banyak website yang memakai plugin SEO punya pola serupa.
Saya akan memperbaikinya, tapi saya tidak ingin mengarang hasil yang belum ada, jadi di sini saya cukup melaporkan apa yang benar-benar saya temukan.
Temuan kedua yang perlu dilaporkan menyangkut isi file robots.txt itu sendiri.
Sekarang mari kita lihat dampaknya di Indonesia, karena angka global kadang tidak mencerminkan kondisi pasar kita. Snapshot Piperic pada 13 Juli 2026 memeriksa 28.218 website Indonesia.
Hasilnya, 89,5 persen website Indonesia masih terbuka untuk latihan AI. Hanya 10,53 persen yang memblokir minimal satu crawler AI.
Angka yang lebih menarik justru yang berikutnya, yaitu 84,65 persen berstatus terbuka karena diam. Artinya sebagian besar belum pernah mengambil keputusan sama sekali.
Dari semua website yang diperiksa itu, hanya sebagian kecil yang benar-benar mengambil keputusan. Kebanyakan berjalan tanpa pernah menyinggung topik ini sama sekali.
Di antara yang memblokir, 1,2 persen memblokir GPTBot sekaligus memblokir crawler pencarian AI. Akibatnya website mereka hilang dari pencarian ChatGPT.
Kasus 1,2 persen itu paling perlu diwaspadai, karena menunjukkan bahwa orang yang memblokir bot latihan tanpa sadar juga memblokir pencarian di dalam AI.
Data ini juga mencatat 4.252 toko online Indonesia yang terbuka untuk crawler AI.
Satu jebakan lagi yang jarang disebut: Google-Extended
Banyak orang mengira Google-Extended adalah crawler terpisah. Padahal itu hanya token di file robots.txt, bukan bot yang datang sendiri.
Perlu digarisbawahi bahwa Google-Extended ini punya sifat yang berbeda dari bot AI pada umumnya. Google-Extended bukan crawler yang datang mengunjuki Anda. Ia hanya nama label yang Anda tulis sendiri di file robots.txt, lalu dibaca Google untuk memutuskan apakah halaman Anda boleh dipakai atau tidak.
Artinya, kalau Anda tidak menulis apa pun tentang Google-Extended, Anda otomatis mengizinkan pemakaiannya. Berbeda dengan bot lain yang datang sendiri, di sini tidak ada crawler yang tiba-tiba menghilang.
Kalau Anda menulis aturan tolak untuk token itu, Anda menolak dua hal sekaligus, yaitu latihan model dan penggunaan halaman Anda sebagai sitasi di Gemini.
Yang tidak terpengaruh adalah peringkat pencarian Google. Tapi ada harga yang harus dibayar.
Anda bisa kehilangan kesempatan disebut di jawaban AI, atau sebaliknya.
Bing belum mendukung pengaturan ini. Dukungan diperkirakan baru hadir pada awal 2027.
Untuk Bing, satu-satunya pilihan yang tersedia saat ini adalah tag noarchive di dalam halaman Anda. Jadi kalau Anda memakai Bing, penolakannya harus ditulis manual, bukan lewat panel Cloudflare.

Langkah praktis yang saya sarankan
Langkah pertama, cek apakah website Anda memakai Cloudflare. Kalau tidak, seluruh isi artikel ini tidak berlaku untuk Anda.
Namun ada satu hal yang sering terlewat. Semua yang saya bahas di atas berlaku kalau website Anda memakai Cloudflare sebagai lapisan depan.
Untuk memastikannya, buka saja header respons di browser atau pakai alat pemeriksa header. Kalau barisnya tidak memuat Cloudflare, Anda tahu sejak awal bahwa aturan ini bukan untuk Anda.
Langkah kedua, masuk ke panel kendali bot dan pastikan kategori Search dalam keadaan Allow. Jangan pernah mengubahnya menjadi Block.
Langkah ketiga, untuk kategori Training, pilihkan Disallow AI Training kalau Anda memang tidak ingin isi website dipakai untuk melatih model.
Langkah keempat, periksa file robots.txt Anda setelah perubahan. Pastikan tidak ada blok ganda yang saling menimpa.
Langkah kelima, kalau Anda memakai plugin SEO, matikan dulu fitur robots.txt buatannya sebelum mengedit manual. Plugin itu akan menimpa perubahan Anda kembali.
Langkah keenam, untuk kategori Agent, biarkan saja pada pengaturan bawaan dari Cloudflare. Belum ada cara menolak jenis bot ini secara terpisah.
Langkah ketujuh, bila Anda memang ingin muncul di jawaban AI, jangan menambahkan aturan tolak untuk token Google-Extended.
Langkah kedelapan, tunggu beberapa hari setelah perubahan, lalu cek laporan penelusuran di Search Console untuk memastikan tidak ada halaman yang hilang.
Penutup
Kabar baik dari perubahan ini adalah Anda sekarang bisa menolak pelatihan model tanpa kehilangan posisi di pencarian.
Hal itu mustahil dilakukan sebelum 15 September 2026. Pengaturan Disallow AI Training menutup celah yang selama ini jadi alasan banyak orang memilih tidak melakukan apa-apa.
Sebelum menutup, izinkan saya mengulang satu peringatan. Kata Block dan kata Disallow AI Training kedengarannya mirip, tetapi dampaknya sama sekali berbeda.
Tapi jangan terburu-buru menekan tombol yang salah. Satu klik di pilihan Block bisa menghapus semua halaman Anda dari hasil pencarian.
Kalau website Anda tidak berjalan di Cloudflare, jangan buru-buru pindah CDN hanya untuk ikut tren ini. Perbaiki dulu file robots.txt yang berantakan.
Sekarang Anda sudah tahu bedanya, dan bisa mengambil keputusan tanpa perlu panik. Untuk website UMKM, keputusan yang paling masuk akal hampir selalu sama, yaitu biarkan pencarian terbuka, tolak bot latihan, dan biarkan pengaturan bot agent mengikuti bawaan Cloudflare.
Dan yang terakhir, kunci dulu halaman utama Anda di Search Console sebelum melakukan perubahan apa pun. Selalu siapkan jalan kembali sebelum menutup pintu.
Kalau ada satu pesan yang bisa saya bawa pulang dari kejadian di Braga, pesan itu sederhana. Menolak agar isi website tidak dipakai untuk melatih model adalah keputusan yang wajar. Yang keliru bukan niatnya, melainkan cara teknis yang dipilih.
Satu klik yang salah tidak bisa dibatalkan dalam semalam. Kerugiannya baru terlihat di laporan pengunjung beberapa pekan kemudian, ketika sudah terlambat untuk bereaksi cepat.
Kalau ada yang ingin ditanyakan atau ingin website Anda diperiksa, silakan kirim pesannya. Saya akan jawab berdasarkan hasil cek, bukan perkiraan.
Minggu ini, sebelum menyalin pengaturan apa pun dari mana pun, buka file robots.txt website Anda dan baca sendiri isinya. Kalau Anda tidak tahu apa yang tertulis di sana, Anda belum siap mengubah apa pun juga.