پژوهشگران هوش مصنوعی تلاش هماهنگی را توسط شبکهای متشکل از حدود ۱۵۰ سایت خبری کمبازدید برای بمباران دادههای آموزشی مدلهای زبانی بزرگ (LLM) با روایتهای طرفدار کرملین کشف کردهاند. این سایتها که مجموعاً با نام شبکه Pravda شناخته میشوند، سالانه تقریباً سه میلیون مقاله منتشر میکنند و محتوای آنها اکنون در مجموعه داده Common Crawl که سوخت بسیاری از سیستمهای تجاری هوش مصنوعی را تأمین میکند، دیده میشود.
نحوه عملکرد خط لوله اطلاعات نادرست
هدف شبکه Pravda جذب خوانندگان انسانی نیست. در عوض، هر سایت مقالات تکراری منتشر میکند که مجموعهای محدود از نکات بحث را تکرار میکنند. با پر کردن متن از کلمات کلیدی که موتورهای جستجو و خزندههای وب به آنها اولویت میدهند، این سایتها شانس مواجهه مدلهای هوش مصنوعی با آنها را در طول جمعآوری دادهها افزایش میدهند.
دو مکانیسم مسمومسازی (poisoning) در اینجا نقش دارند:
- مسمومسازی در زمان بازیابی (Retrieval-time poisoning) – زمانی که یک دستیار هوش مصنوعی اطلاعات زنده را از وب استخراج میکند، ممکن است یک مقاله Pravda را در کنار منابع معتبر نمایش دهد. مسدود کردن دامنههای مخرب شناختهشده میتواند این مواجهه را کاهش دهد.
- مسمومسازی در زمان آموزش (Training-time poisoning) – اگر این مقالات به مجموعههای عظیم دادهای (corpora) که برای پیشآموزش یک مدل استفاده میشوند نفوذ کنند، ادعاهای نادرست به بخشی از دانش داخلی مدل تبدیل میشوند. حذف چنین محتوایی پس از وقوع، بسیار دشوارتر است.
پژوهشگران پیش از این مقالات Pravda را در Common Crawl، یک آرشیو عمومی که برای آموزش بسیاری از مدلهای هوش مصنوعی استفاده میشود، ردیابی کردهاند. این بدان معناست که مسمومسازی یک فرضیه نیست؛ بلکه پیش از این پایگاه دانش مدلهایی را که امروزه بسیاری از کاربران به آنها متکی هستند، تغییر داده است.
چرا این موضوع اهمیت دارد
فقط به این دلیل که هوش مصنوعی میگوید «منابع زیادی با هم موافق هستند»، به آن اعتماد نکنید. اگر ابزارهای هوش مصنوعی میسازید، از لیستهای سیاه (blocklists) برای سایتهای شناختهشدهی انتشار اطلاعات نادرست استفاده کنید. از «تعداد دفعات ذکر شدن» به عنوان راهی برای سنجش حقیقت استفاده نکنید. کمیت برابر با کیفیت نیست. هر آنچه را که هوش مصنوعی به شما میگوید، بهویژه اگر سوگیرانه به نظر میرسد، تأیید کنید.
اینترنت مجموعه آموزشی فناوریهای آینده ماست. هر کسی با داشتن یک وبسایت میتواند سعی کند ماشینهایی را که به آنها متکی هستیم، دچار سوگیری کند.
توسعهدهندگان اکنون چه کاری میتوانند انجام دهند
- نگهداری لیستهای سیاه – دامنههای شناختهشدهی انتشار اطلاعات نادرست را به فیلترهای خزش (crawling filters) اضافه کنید؛ یک لیست سیاه هم از مواجهه در زمان بازیابی و هم در زمان آموزش جلوگیری میکند.
- بازنگری در میانبرهای مبتنی بر فراوانی (frequency heuristics) – از معادل دانستن تعداد دفعات ذکر شدن با حقیقت خودداری کنید. یک ادعا که در دهها سایت بیکیفیت تکرار شده است، میتواند در یک مدل سادهی مبتنی بر فراوانی، بر یک منبع معتبر غلبه کند.
- اعمال بررسیهای منشأ (provenance checks) – اطلاعات را تا منبع اصلیاش ردیابی کنید. اگر زنجیره به سایتی با ترافیک ناچیز و سابقه تبلیغات سیاسی (propaganda) ختم شد، خروجی را برای بازبینی علامتگذاری کنید.
- اجرای پاکسازی پس از آموزش (post-training sanitization) – بازرسیهای دقیق و منتخب (curated audits) را روی خروجیهای مدل که به موضوعات حساس سیاسی میپردازند، انجام دهید. بازبینهای انسانی میتوانند سوگیریهای سیستماتیکی را که فیلترهای خودکار از دست میدهند، شناسایی کنند.
دیدگاههای مخالف و چالشها
ایجاد تعادل بین امنیت و فراگیر بودن (inclusivity) همچنان یک مسئله حلنشده است.
نگاه به آینده
شبکه Pravda نشان میدهد که چگونه بازیگران دولتی میتوانند از وبِ آزاد به عنوان سلاحی برای شکل دادن به نسل بعدی هوش مصنوعی استفاده کنند.
نکته کلیدی: سلامت هوش مصنوعی به پاکیزگی دادههایی که از آنها یاد میگیرد بستگی دارد. هجوم هماهنگ سایتهای کمبازدید و مملو از تبلیغات سیاسی میتواند از همین حالا دروغها را در مدلهایی که به آنها اعتماد میکنیم، نهادینه کند. توسعهدهندگان باید اعتبار منبع را به عنوان یک اولویت اصلی، و نه یک موضوع جانبی، در نظر بگیرند تا از تبدیل شدن ماشینهایی که میسازند به سخنگویان ناخواسته اطلاعات نادرست جلوگیری کنند.
