پژوهشگران هوش مصنوعی تلاش هماهنگی را توسط شبکه‌ای متشکل از حدود ۱۵۰ سایت خبری کم‌بازدید برای بمباران داده‌های آموزشی مدل‌های زبانی بزرگ (LLM) با روایت‌های طرفدار کرملین کشف کرده‌اند. این سایت‌ها که مجموعاً با نام شبکه Pravda شناخته می‌شوند، سالانه تقریباً سه میلیون مقاله منتشر می‌کنند و محتوای آن‌ها اکنون در مجموعه داده Common Crawl که سوخت بسیاری از سیستم‌های تجاری هوش مصنوعی را تأمین می‌کند، دیده می‌شود.

نحوه عملکرد خط لوله اطلاعات نادرست

هدف شبکه Pravda جذب خوانندگان انسانی نیست. در عوض، هر سایت مقالات تکراری منتشر می‌کند که مجموعه‌ای محدود از نکات بحث را تکرار می‌کنند. با پر کردن متن از کلمات کلیدی که موتورهای جستجو و خزنده‌های وب به آن‌ها اولویت می‌دهند، این سایت‌ها شانس مواجهه مدل‌های هوش مصنوعی با آن‌ها را در طول جمع‌آوری داده‌ها افزایش می‌دهند.

دو مکانیسم مسموم‌سازی (poisoning) در اینجا نقش دارند:

  • مسموم‌سازی در زمان بازیابی (Retrieval-time poisoning) – زمانی که یک دستیار هوش مصنوعی اطلاعات زنده را از وب استخراج می‌کند، ممکن است یک مقاله Pravda را در کنار منابع معتبر نمایش دهد. مسدود کردن دامنه‌های مخرب شناخته‌شده می‌تواند این مواجهه را کاهش دهد.
  • مسموم‌سازی در زمان آموزش (Training-time poisoning) – اگر این مقالات به مجموعه‌های عظیم داده‌ای (corpora) که برای پیش‌آموزش یک مدل استفاده می‌شوند نفوذ کنند، ادعاهای نادرست به بخشی از دانش داخلی مدل تبدیل می‌شوند. حذف چنین محتوایی پس از وقوع، بسیار دشوارتر است.

پژوهشگران پیش از این مقالات Pravda را در Common Crawl، یک آرشیو عمومی که برای آموزش بسیاری از مدل‌های هوش مصنوعی استفاده می‌شود، ردیابی کرده‌اند. این بدان معناست که مسموم‌سازی یک فرضیه نیست؛ بلکه پیش از این پایگاه دانش مدل‌هایی را که امروزه بسیاری از کاربران به آن‌ها متکی هستند، تغییر داده است.

چرا این موضوع اهمیت دارد

فقط به این دلیل که هوش مصنوعی می‌گوید «منابع زیادی با هم موافق هستند»، به آن اعتماد نکنید. اگر ابزارهای هوش مصنوعی می‌سازید، از لیست‌های سیاه (blocklists) برای سایت‌های شناخته‌شده‌ی انتشار اطلاعات نادرست استفاده کنید. از «تعداد دفعات ذکر شدن» به عنوان راهی برای سنجش حقیقت استفاده نکنید. کمیت برابر با کیفیت نیست. هر آنچه را که هوش مصنوعی به شما می‌گوید، به‌ویژه اگر سوگیرانه به نظر می‌رسد، تأیید کنید.

اینترنت مجموعه آموزشی فناوری‌های آینده ماست. هر کسی با داشتن یک وب‌سایت می‌تواند سعی کند ماشین‌هایی را که به آن‌ها متکی هستیم، دچار سوگیری کند.

توسعه‌دهندگان اکنون چه کاری می‌توانند انجام دهند

  • نگهداری لیست‌های سیاه – دامنه‌های شناخته‌شده‌ی انتشار اطلاعات نادرست را به فیلترهای خزش (crawling filters) اضافه کنید؛ یک لیست سیاه هم از مواجهه در زمان بازیابی و هم در زمان آموزش جلوگیری می‌کند.
  • بازنگری در میان‌برهای مبتنی بر فراوانی (frequency heuristics) – از معادل دانستن تعداد دفعات ذکر شدن با حقیقت خودداری کنید. یک ادعا که در ده‌ها سایت بی‌کیفیت تکرار شده است، می‌تواند در یک مدل ساده‌ی مبتنی بر فراوانی، بر یک منبع معتبر غلبه کند.
  • اعمال بررسی‌های منشأ (provenance checks) – اطلاعات را تا منبع اصلی‌اش ردیابی کنید. اگر زنجیره به سایتی با ترافیک ناچیز و سابقه تبلیغات سیاسی (propaganda) ختم شد، خروجی را برای بازبینی علامت‌گذاری کنید.
  • اجرای پاکسازی پس از آموزش (post-training sanitization) – بازرسی‌های دقیق و منتخب (curated audits) را روی خروجی‌های مدل که به موضوعات حساس سیاسی می‌پردازند، انجام دهید. بازبین‌های انسانی می‌توانند سوگیری‌های سیستماتیکی را که فیلترهای خودکار از دست می‌دهند، شناسایی کنند.

دیدگاه‌های مخالف و چالش‌ها

ایجاد تعادل بین امنیت و فراگیر بودن (inclusivity) همچنان یک مسئله حل‌نشده است.

نگاه به آینده

شبکه Pravda نشان می‌دهد که چگونه بازیگران دولتی می‌توانند از وبِ آزاد به عنوان سلاحی برای شکل دادن به نسل بعدی هوش مصنوعی استفاده کنند.

نکته کلیدی: سلامت هوش مصنوعی به پاکیزگی داده‌هایی که از آن‌ها یاد می‌گیرد بستگی دارد. هجوم هماهنگ سایت‌های کم‌بازدید و مملو از تبلیغات سیاسی می‌تواند از همین حالا دروغ‌ها را در مدل‌هایی که به آن‌ها اعتماد می‌کنیم، نهادینه کند. توسعه‌دهندگان باید اعتبار منبع را به عنوان یک اولویت اصلی، و نه یک موضوع جانبی، در نظر بگیرند تا از تبدیل شدن ماشین‌هایی که می‌سازند به سخنگویان ناخواسته اطلاعات نادرست جلوگیری کنند.