ทีมวิศวกรของ Wikimedia กล่าวว่า crawler ที่ขับเคลื่อนด้วย AI สร้างทราฟฟิกที่มีค่าใช้จ่ายสูงที่สุดถึง 65% ของแพลตฟอร์ม เปลี่ยนการเพิ่มขึ้นของบอทที่ดูเหมือนไม่มีพิษมีภัยให้กลายเป็นรายการค่าใช้จ่ายในบิลค่าเซิร์ฟเวอร์ รูปแบบเดียวกันนี้กำลังปรากฏให้เห็นในบล็อกขนาดเล็กและเว็บไซต์งานอดิเรกต่างๆ ด้วยเช่นกัน

ทำไมการพุ่งสูงขึ้นนี้จึงสำคัญ

ผู้เข้าชมที่เป็นมนุษย์มักจะใช้เวลาอยู่กับหน้าเพจยอดนิยม เช่น หน้าแรก บทความเด่น และเนื้อหาที่เป็นที่รู้จักอื่นๆ ซึ่ง CDN จะทำ cache หน้าเพจเหล่านั้นไว้ที่ edge locations ทำให้ origin server แทบไม่ต้องทำงานหนัก ในทางตรงกันข้าม AI crawlers จะทำการ scrape URL ที่ไม่ค่อยมีคนรู้จักจำนวนหลายพันรายการในการทำงานเพียงครั้งเดียว หน้าเพจเหล่านั้นมักจะไม่ถูกทำ cache ดังนั้นทุกคำขอ (request) จึงต้องส่งกลับไปยังโครงสร้างพื้นฐานต้นทาง (origin infrastructure) ของ Wikimedia ผลลัพธ์ที่ได้คือ การใช้ทรัพยากรในการประมวลผล (compute) พื้นที่จัดเก็บข้อมูล (storage) และเครือข่าย (network) ที่สูงเกินสัดส่วนเมื่อเทียบกับปริมาณทราฟฟิกทั้งหมดที่มีเพียงเล็กน้อย

บล็อกด้านวิศวกรรมที่เปิดเผยข้อมูลระบุว่า แม้บอทจะมีสัดส่วนเพียงเล็กน้อยของคำขอทั้งหมด แต่พวกมันกลับครองสัดส่วนส่วนใหญ่ในกลุ่ม "ที่มีค่าใช้จ่ายสูง"

ใครคือผู้ที่ได้รับผลกระทบ

ผู้ให้บริการรายเล็กไม่มีเกราะป้องกัน (cushion) ดังกล่าว ต้นทุนที่แฝงอยู่ไม่ใช่แค่เรื่องเงินเท่านั้น แต่ยังเสี่ยงต่อการทำให้ประสิทธิภาพการทำงานลดลงสำหรับผู้เข้าชมที่เป็นมนุษย์จริงๆ อีกด้วย

เจ้าของเว็บไซต์สามารถทำอะไรได้บ้าง

  • เริ่มด้วยการทำ rate-limiting – จำกัดจำนวนคำขอที่ IP เดียวสามารถส่งมาได้ในช่วงเวลาสั้นๆ วิธีนี้จะช่วยชะลอ crawler ที่รุกรานหนักโดยไม่เป็นการปฏิเสธการเข้าถึงโดยสิ้นเชิง
  • ชั่งน้ำหนักระหว่างการมองเห็นกับค่าใช้จ่าย – การบล็อกบอทของ search engine อาจช่วยลดทราฟฟิกได้ แต่ก็อาจทำให้หน้าเพจของคุณหายไปจากดัชนี (indexes) ซึ่งจะส่งผลเสียต่อการถูกค้นพบแบบ organic
  • จำแนกประเภทของบอท – crawler ไม่ได้เหมือนกันไปเสียหมด บางตัวเป็นเครื่องมือค้นหาที่ถูกกฎหมายซึ่งช่วยนำทราฟฟิกมาให้ ในขณะที่บางตัวเป็นเพียง scraper ที่ไม่ได้สร้างมูลค่าใดๆ
  • ใช้การท้าทายด้วย proof-of-work – กำหนดให้มีการแก้โจทย์คำนวณเล็กน้อยก่อนที่จะแสดงหน้าเพจ เบราว์เซอร์ของมนุษย์จะแก้โจทย์ได้ทันที แต่บอทจะต้องใช้ทรัพยากรประมวลผลเพิ่มขึ้น ซึ่งเป็นการเพิ่มต้นทุนให้กับพวกมัน
  • ใช้การวิเคราะห์จาก CDN – CDN ส่วนใหญ่จะแสดงข้อมูลสถิติคำขอแยกตามบอท (per-bot request metrics) ให้คุณระบุได้ว่า agent ตัวไหนที่เรียกไปยัง origin บ่อยที่สุด และปรับแต่งกฎการใช้งานให้เหมาะสม

บทสรุปนั้นเรียบง่าย: AI crawlers ไม่ใช่แค่เรื่องน่าสงสัยที่เข้ามาใช้ทรัพยากรฟรีอีกต่อไป แต่พวกมันคือศูนย์รวมต้นทุน (cost center) ที่วัดผลได้ ไม่ว่าคุณจะบริหารสารานุกรมระดับโลกหรือพอร์ตโฟลิโอหน้าเดียว การปฏิบัติกับทราฟฟิกจากบอทเสมือนเป็นรายการหนึ่งในงบประมาณโครงสร้างพื้นฐานของคุณ จะช่วยป้องกันบิลค่าใช้จ่ายที่น่าตกใจ และช่วยให้เว็บไซต์ของคุณยังคงตอบสนองได้ดีสำหรับผู้ใช้งานจริง