Tim teknik Wikimedia menyatakan bahwa crawler bertenaga AI menghasilkan 65% dari trafik termahal di platform tersebut, mengubah lonjakan bot yang tampak tidak berbahaya menjadi pos pengeluaran dalam tagihan server. Pola yang sama kini muncul pada blog kecil dan situs hobi.

Mengapa lonjakan ini penting

Pengunjung manusia menghabiskan waktu di halaman-halaman populer—halaman beranda, artikel unggulan, dan konten terkenal lainnya. CDN menyimpan cache halaman-halaman tersebut di lokasi edge, sehingga server asal (origin server) jarang melakukan pekerjaan berat. Sebaliknya, crawler AI mengambil data (scrape) ribuan URL yang tidak dikenal dalam satu kali jalan. Halaman-halaman tersebut jarang disimpan dalam cache, sehingga setiap permintaan harus dikirim kembali hingga ke infrastruktur asal Wikimedia. Hasilnya: penggunaan komputasi, penyimpanan, dan jaringan yang tidak proporsional untuk porsi trafik total yang relatif kecil.

Blog teknik yang merilis data tersebut mencatat bahwa meskipun bot hanya menyumbang sebagian kecil dari keseluruhan permintaan, mereka mendominasi kategori "berbiaya tinggi".

Siapa yang merasakan dampaknya

Operator yang lebih kecil tidak memiliki bantalan tersebut. Biaya tersembunyi ini bukan hanya soal uang; hal ini juga berisiko menurunkan performa bagi pengunjung yang sah.

Apa yang dapat dilakukan pemilik situs

  • Mulailah dengan pembatasan laju (rate-limiting) – batasi jumlah permintaan yang dapat dilakukan oleh satu IP dalam jendela waktu singkat. Ini akan memperlambat crawler yang agresif tanpa menolak akses mereka sepenuhnya.
  • Timbang visibilitas terhadap biaya – memblokir bot mesin pencari mungkin dapat mengurangi trafik, tetapi hal itu juga dapat membuat halaman Anda hilang dari indeks, yang merusak ketertemukan (discoverability) secara organik.
  • Klasifikasikan bot – tidak semua crawler diciptakan sama. Beberapa adalah alat pencari sah yang mendatangkan trafik; yang lainnya adalah scraper murni yang tidak memberikan nilai tambah.
  • Terapkan tantangan proof-of-work – wajibkan teka-teki komputasi kecil sebelum menyajikan halaman. Browser manusia menyelesaikannya secara instan; bot harus menghabiskan siklus ekstra, sehingga meningkatkan biaya mereka.
  • Gunakan analitik CDN – sebagian besar CDN menampilkan metrik permintaan per-bot. Identifikasi agen mana yang paling sering membebani server asal dan sesuaikan aturan Anda.

Kesimpulannya sederhana: crawler AI bukan lagi sekadar rasa ingin tahu yang menumpang gratis; mereka adalah pusat biaya yang terukur. Baik Anda mengelola ensiklopedia global atau portofolio satu halaman, memperlakukan trafik bot sebagai pos pengeluaran dalam anggaran infrastruktur Anda dapat mencegah tagihan tak terduga dan menjaga situs Anda tetap responsif bagi pengguna asli.