Pangram สตาร์ทอัพจากนิวยอร์กที่ก่อตั้งโดยศิษย์เก่าด้าน AI จาก Stanford อย่าง Max Spero และ Bradley Emi เพิ่งปิดรอบระดมทุน Series A มูลค่า 9 ล้านดอลลาร์ นำโดย Menlo Ventures เงินทุนนี้จะนำไปใช้พัฒนา API สำหรับแพลตฟอร์มต่างๆ และส่วนขยาย Chrome (Chrome extension) ราคา 20 ดอลลาร์ต่อเดือน ซึ่งอ้างว่าสามารถตรวจจับข้อความที่ใช้ AI ช่วยเขียนได้แม่นยำถึง 99 เปอร์เซ็นต์ ซึ่งเป็นคำกล่าวอ้างที่อาจเปลี่ยนโฉมวิธีการที่นักข่าว นักวิชาการ และผู้สรรหาบุคลากรใช้ในการตรวจสอบความถูกต้องของข้อมูล
การทะลักเข้ามาของ "slop" ที่สร้างโดย AI
ปัจจุบัน Large language models (LLM) สามารถผลิตบทความ โพสต์บนโซเชียลมีเดีย และแม้แต่การอ้างอิงทางกฎหมายได้ในปริมาณมหาศาล ผลลัพธ์ที่ได้คือสแปม SEO คุณภาพต่ำที่หลั่งไหลเข้ามา แคมเปญบิดเบือนข้อมูลที่มีการประสานงานกัน และ "พื้นที่สีเทา" ที่มนุษย์นำร่างข้อความที่ AI สร้างขึ้นมาขัดเกลาต่อ สถาบันต่างๆ เริ่มมีการตอบโต้แล้ว เช่น arXiv ซึ่งเป็นเซิร์ฟเวอร์สำหรับบทความวิจัยก่อนตีพิมพ์ (pre-print server) ได้เตือนว่าผู้เขียนที่ส่งผลลัพธ์จาก LLM โดยไม่มีการตรวจสอบอาจถูกสั่งห้ามใช้งานเป็นเวลาหนึ่งปี และศาลเริ่มมีการลงโทษทนายความที่ใช้การอ้างอิงที่ถูกสร้างขึ้นมาเองโดย AI แรงกดดันในการแยกแยะผลงานของมนุษย์ออกจากเครื่องจักรจึงเพิ่มสูงขึ้น และ Pangram เชื่อมั่นว่าเทคโนโลยีของตนจะสามารถกลายเป็นชั้นการตรวจสอบมาตรฐาน (default verification layer) ได้
Synthetic mirroring: การฝึกฝนด้วยข้อมูลคู่ขนานของทุกเอกสาร
Pangram 4 ซึ่งเป็นโมเดลเรือธงของ Pangram ใช้ระเบียบวิธีที่บริษัทเรียกว่า “synthetic mirroring” สำหรับเอกสารที่เขียนโดยมนุษย์แต่ละฉบับในชุดข้อมูลฝึกฝน ซึ่งมีจำนวนหลายสิบล้านชิ้นที่ผ่านการตรวจสอบแล้ว ทีมงานได้สร้างคู่ขนานขึ้นมาโดยใช้ frontier LLM โดย "ฝาแฝดสังเคราะห์" นี้จะมีหัวข้อ ความยาว และน้ำเสียงที่ตรงกับต้นฉบับ แต่ถูกสร้างขึ้นโดย AI การป้อนข้อมูลทั้งสองเวอร์ชันเข้าสู่โครงข่ายประสาทเทียม (neural net) เดียวกัน ช่วยให้ Pangram สอนโมเดลให้ตรวจจับ "ลายนิ้วมือทางสถิติ" (statistical fingerprints) ที่ละเอียดอ่อนซึ่งยังคงปรากฏอยู่ในข้อความที่สร้างโดย AI แม้ว่าผู้เขียนจะใช้เครื่องมือ "AI humanizer" ที่ออกแบบมาเพื่อพรางผลลัพธ์จากเครื่องจักรก็ตาม
คู่แข่งรายอื่นมักพึ่งพา metadata หรือลายน้ำที่มองไม่เห็น (invisible watermarks) ซึ่งสามารถถูกลบหรือเพิกเฉยได้ แต่ Pangram กลับมุ่งเน้นไปที่การวิเคราะห์เชิงสไตล์ (stylistic analysis) เช่น รูปแบบการเลือกใช้คำ จังหวะของประโยค และการกระจายตัวของโทเคน (token distribution) ที่ยังคงมีความสม่ำเสมอในผลลัพธ์ของโมเดล จากข้อมูลที่บริษัทเปิดเผย ในการทดสอบภายใน ระบบสามารถตรวจจับงานเขียนที่ใช้ AI ช่วยได้อย่างแม่นยำถึง 99 เปอร์เซ็นต์
จาก API สู่เบราว์เซอร์: เทคโนโลยีนี้จะไปอยู่ที่ไหนบ้าง
Pangram วางตำแหน่งตัวเองเป็นโครงสร้างพื้นฐาน (infrastructure) มากกว่าจะเป็นแอปพลิเคชันที่ใช้งานเพียงอย่างเดียว API ของบริษัทได้รวมเข้ากับ Substack แล้ว ซึ่งจดหมายข่าวจะแสดงป้ายกำกับที่ระบุสัดส่วนของเนื้อหาที่สร้างโดย AI นอกจากนี้ กลุ่มผู้ใช้งานกลุ่มแรกยังรวมถึงแพลตฟอร์มถาม-ตอบอย่าง Quora, ศูนย์การเขียนของมหาวิทยาลัยหลายแห่ง และบริษัทจัดหางานที่จำเป็นต้องตรวจสอบความแปลกใหม่ (originality) ของผลงานที่ผู้สมัครส่งมา
สำหรับผู้ใช้งานทั่วไป สตาร์ทอัพรายนี้มีส่วนขยาย Chrome ที่จะแสดง "คะแนนสุขภาพของฟีด" (feed health score) ทับซ้อนบนเว็บไซต์ต่างๆ เช่น X, LinkedIn, Reddit และ Medium โดยคะแนนนี้จะแยกแยะเปอร์เซ็นต์ของข้อความที่โมเดลเชื่อว่าเป็นฝีมือมนุษย์เทียบกับ AI ผู้สมัครสมาชิกต้องจ่ายเงิน 20 ดอลลาร์ต่อเดือน เพื่อรับการติดป้ายกำกับแบบเรียลไทม์และความสามารถในการทำเครื่องหมายข้อความที่น่าสงสัยเพื่อการตรวจสอบเพิ่มเติม
มุมมองเชิงวิพากษ์
คำกล่าวอ้างเรื่องความแม่นยำย่อมดึงดูดการตรวจสอบอย่างหลีกเลี่ยงไม่ได้ การตรวจจับการใช้ AI ช่วยใน "พื้นที่สีเทา" ซึ่งเป็นกรณีที่ผู้เขียนนำร่างที่สร้างโดยโมเดลมาแก้ไขต่อ ยังคงเป็นเป้าหมายที่เปลี่ยนแปลงตลอดเวลา (moving target) เมื่อโมเดลเชิงสร้างสรรค์ (generative models) พัฒนาขึ้น ช่องว่างทางสไตล์ที่ Pangram อาศัยอยู่อาจแคบลง ซึ่งจะนำไปสู่การแข่งขันทางเทคโนโลยี (arms race) ระหว่างเทคนิคการตรวจจับและเทคนิคการหลบเลี่ยง นอกจากนี้ นักวิจารณ์ยังเตือนเรื่อง "ผลบวกปลอม" (false positives) หรือการระบุว่างานเขียนของมนุษย์จริงๆ เป็นงานที่สร้างโดย AI ซึ่งอาจทำลายชื่อเสียงได้ โดยเฉพาะในบริบททางวิชาการหรือทางกฎหมายที่มีเดิมพันสูง
Pangram ยอมรับถึงความท้าทายนี้ โดยระบุว่าบริษัททำการฝึกฝนโมเดลใหม่ด้วย synthetic mirrors ชุดใหม่ๆ อย่างต่อเนื่องเมื่อมี LLM ใหม่ๆ ปรากฏขึ้น อย่างไรก็ตาม บริษัทยังไม่ได้เปิดเผยผลการทดสอบมาตรฐาน (benchmark) จากหน่วยงานอิสระนอกเหนือจากการทดสอบภายในของตนเอง ทำให้ชุมชนในวงกว้างยังต้องรอการตรวจสอบตัวเลข 99 เปอร์เซ็นต์นี้
สิ่งที่ต้องจับตามอง
ในอีกไม่กี่เดือนข้างหน้า จะเป็นตัวบ่งชี้ว่า Pangram สามารถก้าวข้ามจากการทดสอบนำร่องไปสู่การใช้งานในแพลตฟอร์มที่กว้างขึ้นได้หรือไม่ โดยตัวบ่งชี้สำคัญ ได้แก่:
- การขยายสัญญาการใช้ API นอกเหนือจากรายชื่อพันธมิตรกลุ่มแรกในปัจจุบัน
- ผลตอบรับจากผู้ใช้งานในระดับสถาบัน เกี่ยวกับอัตราการเกิดผลบวกปลอม (false-positive) และผลกระทบต่อกระบวนการทำงานด้านบรรณาธิการ
- ปฏิกิริยาจากผู้พัฒนา LLM ซึ่งอาจตอบโต้ด้วยการอัปเดตโมเดลที่มุ่งเน้นการเลียนแบบสไตล์ของมนุษย์ให้แนบเนียนยิ่งขึ้น
- การพัฒนาด้านกฎระเบียบ ที่อาจทำให้เครื่องมือตรวจจับ AI กลายเป็นสิ่งจำเป็นสำหรับสิ่งพิมพ์หรือการส่งผลงานทางวิชาการบางประเภท
หากสตาร์ทอัพรายนี้สามารถรักษาความได้เปรียบในการตรวจจับไปพร้อมกับรักษาอัตราความผิดพลาดให้ต่ำได้ ก็อาจกลายเป็นมาตรฐานโดยพฤตินัย (de-facto standard) สำหรับความถูกต้องของข้อมูลดิจิทัล แต่หากไม่เป็นเช่นนั้น ตลาดอาจแตกออกเป็นกลุ่มเครื่องมือที่แข่งขันกัน ซึ่งแต่ละเครื่องมือก็จะมีข้อดีและข้อเสียที่แตกต่างกันไป
บทสรุป
การอัดฉีดเงินทุนจำนวน 9 ล้านดอลลาร์ของ Pangram จะช่วยขับเคลื่อนกลยุทธ์การตรวจจับที่อาศัยรูปแบบการฝึกฝนด้วยเอกสารคู่ เพื่อมุ่งสู่การตรวจจับการใช้ AI ช่วยเหลือได้อย่างแม่นยำเกือบสมบูรณ์แบบ ความสำเร็จของกลยุทธ์นี้จะขึ้นอยู่กับว่าวิธีการดังกล่าวจะสามารถขยายขีดความสามารถให้รองรับโมเดลภาษาที่พัฒนาไปอย่างต่อเนื่องได้หรือไม่ และจะสามารถสร้างความเชื่อมั่นให้กับแพลตฟอร์มและสถาบันต่างๆ ที่มีความต้องการใช้งานมากที่สุดได้หรือไม่
