ผมสร้างเว็บไซต์ที่ต้องการให้ AI assistant นำไปอ้างอิง และแทนที่จะใช้วิธีเดาสุ่ม ผมได้นำสัญญาณสามอย่างที่ได้รับคำแนะนำอย่างแพร่หลายมาทดลองใช้จริง ได้แก่ การตั้งค่าใน robots.txt เพื่ออนุญาตให้ crawler สไตล์ GPT เข้าถึงได้, ไฟล์ llms.txt ที่รวบรวมทุกหน้าเว็บเอาไว้ และ JSON-LD schema ที่อธิบายเนื้อหา หลังจากทดสอบแต่ละอย่างแล้ว ผมพบว่ามีเพียงอย่างเดียวเท่านั้นที่สามารถล้มเหลวได้โดยไม่มีการแจ้งเตือน ส่วนอย่างอื่นนั้นไม่ได้ทำงานอย่างที่คนส่วนใหญ่กล่าวอ้าง

ทำไมสัญญาณทั้งสามนี้ถึงสำคัญ

Webmaster มักได้รับคำแนะนำว่า crawler ที่เน้น AI จำเป็นต้องได้รับอนุญาตอย่างชัดเจน, ไฟล์ดัชนีแบบข้อความธรรมดาอย่าง “llms.txt” จะช่วยให้โมเดลภาษาขนาดใหญ่ (LLMs) ค้นหาเนื้อหาที่เกี่ยวข้องได้ง่ายขึ้น และข้อมูลโครงสร้าง JSON-LD จะช่วยเพิ่มโอกาสในการถูกนำไปอ้างอิง คำมั่นสัญญาที่ได้รับนั้นเรียบง่าย: เพียงแค่เพิ่มไฟล์เหล่านี้ เว็บไซต์ของคุณก็จะเริ่มปรากฏในคำตอบที่สร้างโดย AI ซึ่งจะช่วยดึงดูดทราฟฟิกและเพิ่มการมองเห็นแบรนด์

1. การอนุญาตให้ AI crawler เข้าถึงผ่าน robots.txt

บรรทัดใน robots.txt ที่ระบุถึง GPTBot (หรือ AI bot อื่นๆ) เป็นเพียงการ "ร้องขอ" เท่านั้น หาก Content Delivery Network (CDN) หรือ Firewall บล็อก bot นั้นไว้ คำร้องขอจะส่งไปไม่ถึงเว็บไซต์ และ crawler ก็จะไม่สามารถอ่านไฟล์ได้เลย วิธีเดียวที่เชื่อถือได้ในการตรวจสอบว่า bot สามารถเข้าถึงคุณได้หรือไม่ คือการตรวจสอบ HTTP status code ของ bot หลักแต่ละตัว หากได้รับผลลัพธ์เป็น 403 (forbidden) หรือ 503 (service unavailable) นั่นหมายความว่าระบบพื้นฐานที่เหลือก็ไม่มีความหมาย—เมื่อไม่มี bot ก็ไม่มีการทำ indexing และไม่มีการอ้างอิง

2. ไฟล์ llms.txt

ไฟล์ llms.txt เป็นเพียงรายการ URL ในรูปแบบ markdown ซึ่งมีจุดประสงค์เพื่อให้ LLMs มีแผนผังเว็บไซต์ที่สะอาดตา เพื่อที่พวกเขาจะได้ไม่ต้องคาดเดาโครงสร้างการนำทางจาก HTML เพียงอย่างเดียว แต่ในทางปฏิบัติ เอกสารของ Google ระบุว่าพวกเขาจะเพิกเฉยต่อไฟล์นี้ และยังไม่มี Search Engine รายใหญ่รายใดให้คำมั่นว่าจะใช้ไฟล์นี้เพื่อวัตถุประสงค์ในการอ้างอิง การมีไฟล์นี้ไว้แทบไม่มีต้นทุนใดๆ และอาจมีประโยชน์สำหรับ AI agent ที่ปรับแต่งเอง แต่ไม่ควรโฆษณาว่ามันเป็นทางลัดในการเพิ่มการอ้างอิงจาก AI

3. JSON-LD schema

JSON-LD จะฝังข้อมูลที่มีโครงสร้าง (structured data) เช่น ชื่อผู้เขียน, วันที่เผยแพร่, รหัสสินค้า ไว้ในหน้าเว็บโดยตรง นักการตลาดหลายคนทึกทักเอาเองว่าการเพิ่ม schema จะทำให้หน้าเว็บของพวกเขาปรากฏในคำตอบของ AI บ่อยขึ้น แต่จากการศึกษาหน้าเว็บ 1,885 หน้า พบว่าไม่มีการเพิ่มขึ้นของการอ้างอิงที่วัดผลได้จากการใช้ schema markup เพียงอย่างเดียว คุณค่าที่แท้จริงของ JSON-LD อยู่ที่การระบุตัวตน (entity resolution): มันช่วยบอกเครื่องจักรว่า “Jane Doe” ในหน้าหนึ่งคือ “Jane Doe” คนเดียวกับในอีกหน้าหนึ่ง ซึ่งช่วยป้องกันความสับสนระหว่างบุคคลหรือผลิตภัณฑ์ที่มีชื่อคล้ายกัน

คอขวดที่แท้จริง: การทำ indexing

สัญญาณทั้งสามอย่างเป็นเพียงระบบพื้นฐาน (plumbing) ซึ่งจะทำงานได้ก็ต่อเมื่อหน้าเว็บนั้นถูกทำ index ไว้แล้วเท่านั้น หน้าเว็บที่ไม่เคยปรากฏในดัชนี (index) จะไม่สามารถถูกดึงข้อมูลมาได้ ไม่ว่าคุณจะเพิ่มการอนุญาตให้ crawler หรือเพิ่ม schema tags มากมายเพียงใดก็ตาม ตัวบ่งชี้ที่เชื่อถือได้ที่สุดของสุขภาพการทำ indexing คือรายงานการครอบคลุม (coverage report) ใน Google Search Console (หรือเครื่องมือที่เทียบเท่าสำหรับ Search Engine อื่นๆ) หากหน้าเว็บแสดงสถานะเป็น “not indexed” คุณต้องแก้ไขปัญหานั้นก่อนที่จะไปกังวลเรื่องสัญญาณเฉพาะสำหรับ AI

รายการตรวจสอบที่นำไปใช้ได้จริง

  1. ตรวจสอบการเข้าถึงของ crawler – ทดสอบ HTTP response สำหรับ GPTBot, ClaudeBot หรือ crawler ตัวอื่นๆ ที่คุณให้ความสำคัญ ขั้นตอนนี้อาจล้มเหลวเงียบๆ โดยที่การบล็อกจะไม่สร้างคำเตือนในระบบ analytics ของคุณ
  2. ยืนยันการครอบคลุมของ index – ใช้ Search Console เพื่อดูว่าหน้าเว็บใดถูก index แล้ว หน้าเว็บใดถูกยกเว้น และเพราะเหตุใด แก้ไข "crawl errors" หรือคำสั่ง "noindex" ให้เรียบร้อยก่อน
  3. เพิ่มระบบพื้นฐาน – เมื่อการเข้าถึงและการทำ indexing มั่นคงแล้ว จึงค่อยใส่ llms.txt และ JSON-LD เข้าไป ให้มองว่าสิ่งเหล่านี้เป็นตัวช่วยที่ดูแลรักษาง่าย มากกว่าที่จะเป็นเครื่องการันตีการถูกอ้างอิง

มุมมองที่ต่างออกไป

ผู้ให้บริการบางรายยังคงทำการตลาดเครื่องมือสร้าง llms.txt และปลั๊กอิน schema ว่าเป็นตัวช่วยเพิ่ม SEO สำหรับ AI ข้อมูลที่ผมรวบรวมมา ประกอบกับจุดยืนอย่างเป็นทางการจาก Search Engine รายใหญ่ ชี้ให้เห็นว่าคำกล่าวอ้างเหล่านั้นเกินจริงไป เครื่องมือเหล่านี้ไม่ได้เป็นอันตราย แต่ไม่ควรเป็นหัวใจสำคัญของกลยุทธ์การสร้างการอ้างอิงจาก AI

สิ่งที่ควรติดตามต่อไป

คอยตรวจสอบ crawler logs, ติดตามการแจ้งเตือนใน Search Console และทดสอบ JSON-LD ของคุณเป็นระยะด้วยเครื่องมือตรวจสอบ (validation tools) เพื่อให้ระบบการทำงานไหลลื่นอยู่เสมอ

บทสรุป: หากคุณต้องการให้ AI นำเว็บไซต์ของคุณไปอ้างอิง เลิกมองว่า llms.txt และ schema เป็นตั๋ววิเศษได้แล้ว ตรวจสอบให้แน่ใจว่า bot สามารถเข้าถึงคุณได้จริงๆ และหน้าเว็บของคุณถูกทำ index เรียบร้อยแล้ว เมื่อนั้นไฟล์เสริมเหล่านี้จึงจะทำหน้าที่สนับสนุนในระดับที่เหมาะสมได้

ที่มา: โพสต์ต้นฉบับบน dev.to