Pasukan kejuruteraan Wikimedia menyatakan bahawa crawler berkuasa AI menjana 65% daripada trafik paling mahal platform tersebut, mengubah lonjakan bot yang kelihatan tidak berbahaya menjadi item dalam bil pelayan. Corak yang sama kini muncul pada blog kecil dan laman hobi.

Mengapa lonjakan ini penting

Pelawat manusia meluangkan masa di halaman popular—laman utama, artikel pilihan, dan kandungan terkenal lain. CDN menyimpan cache halaman tersebut di lokasi pinggir (edge locations), jadi pelayan asal (origin server) jarang melakukan kerja berat. Sebaliknya, crawler AI menyedut (scrape) beribu-ribu URL yang tidak dikenali dalam satu sesi. Halaman tersebut jarang disimpan dalam cache, jadi setiap permintaan dihantar terus ke infrastruktur asal Wikimedia. Hasilnya: penggunaan pengkomputeran, storan, dan rangkaian yang tidak seimbang bagi bahagian trafik keseluruhan yang agak kecil.

Blog kejuruteraan yang mengeluarkan data tersebut menyatakan bahawa walaupun bot hanya membentuk sebahagian kecil daripada keseluruhan permintaan, mereka mendominasi kategori "berkos tinggi".

Siapa yang terkesan

Pengendali yang lebih kecil tidak mempunyai perlindungan tersebut. Kos tersembunyi bukan sekadar wang; ia juga berisiko menjejaskan prestasi bagi pelawat yang sah.

Apa yang boleh dilakukan oleh pemilik laman web

  • Mulakan dengan had kadar (rate-limiting) – kawal jumlah permintaan yang boleh dibuat oleh satu IP dalam tempoh masa yang singkat. Ini memperlahankan crawler yang agresif tanpa menyekat akses mereka sepenuhnya.
  • Timbang keterlihatan berbanding kos – menyekat bot enjin carian mungkin dapat mengurangkan trafik, tetapi ia juga boleh mengeluarkan halaman anda daripada indeks, sekali gus menjejaskan kebolehtemuan organik.
  • Klasifikasikan bot – tidak semua crawler adalah sama. Sesetengahnya adalah alat carian sah yang membawa trafik; yang lain pula hanyalah penyedut data (scrapers) tulen yang tidak memberi sebarang nilai.
  • Gunakan cabaran bukti-kerja (proof-of-work) – perlukan teka-teki pengkomputeran kecil sebelum memaparkan halaman. Pelayar manusia menyelesaikannya dengan serta-merta; bot pula perlu menggunakan kitaran tambahan, sekali gus meningkatkan kos mereka.
  • Gunakan analitik CDN – kebanyakan CDN memaparkan metrik permintaan bagi setiap bot. Kenal pasti ejen mana yang paling kerap menghubungi pelayan asal dan sesuaikan peraturan mengikut keperluan.

Kesimpulannya mudah: crawler AI bukan lagi sekadar keunikan yang menumpang percuma; mereka adalah pusat kos yang boleh diukur. Sama ada anda mengendalikan ensiklopedia global atau portfolio satu halaman, menganggap trafik bot sebagai item dalam bajet infrastruktur anda dapat mengelakkan bil mengejut dan memastikan laman anda kekal responsif untuk pengguna sebenar.