از زمانی که ChatGPT به یک نام آشنا تبدیل شده است، افسانه‌ای پیرامون تشخیص‌دهنده‌های هوش مصنوعی شکل گرفته است. مردم آن‌ها را مانند سگ‌های شکاری دیجیتالی تصور می‌کنند که در جستجوی ردپای ChatGPT هستند. واقعیت بسیار کمتر از این‌ها سینمایی است. این ابزارها یک پایگاه داده مخفی از تمام آنچه یک LLM تاکنون نوشته است را جستجو نمی‌کنند. آن‌ها هیچ خط مستقیمی به تاریخچه مرورگر شما ندارند. کاری که آن‌ها واقعاً انجام می‌دهند این است که متن شما را از طریق مدل‌های آماری عبور می‌دهند و به دنبال سیگنال‌های ریاضی می‌گردند که با نثر تولیدشده توسط ماشین همبستگی دارند. درک این سیگنال‌ها به شما کمک می‌کند تا نتایج آن‌ها را هوشمندانه تفسیر کنید و از اعتماد کورکورانه به یک امتیاز درصدی جلوگیری می‌کند.

نحوه عملکرد واقعی این ابزارها

در هسته خود، تشخیص‌دهنده‌های هوش مصنوعی موتورهای تطبیق الگو هستند که با احتمالات تغذیه می‌شوند. مدل‌های زبانی بزرگ (LLM) با پیش‌بینی محتمل‌ترین توکن بعدی، جمله پس از جمله، کار می‌کنند. در طول هزاران کلمه، این عادت یک باقی‌مانده آماری از خود به جای می‌گذارد. تشخیص‌دهنده‌ها سعی می‌کنند آن باقی‌مانده را اندازه‌گیری کنند.

آن را مانند تحلیل دست‌خط در نظر بگیرید. یک کارشناس، حرف "g" شما را با یک پایگاه داده مرجع از تمام "g"هایی که تا به حال نوشته شده است، مقایسه نمی‌کند. در عوض، آن‌ها به ریتم، شیب، فشار و فاصله‌گذاری نگاه می‌کنند. تشخیص‌دهنده‌ها منطق مشابهی را در متن اعمال می‌کنند. آن‌ها بررسی می‌کنند که زبان چقدر قابل پیش‌بینی است، ساختار تا چه حد یکنواخت باقی می‌ماند و آیا واژگان با محدوده آماری باریکی که در نوشته‌های مصنوعی رایج است، مطابقت دارد یا خیر.

از آنجایی که هر ارائه‌دهنده تشخیص‌دهنده، مدل خود را بر روی مجموعه‌داده‌های (corpora) مختلف آموزش می‌دهد و حساسیت خود را به گونه‌ای متفاوت تنظیم می‌کند، یک پاراگراف مشابه می‌تواند در یک پلتفرم ۱۲ درصد و در پلتفرم دیگر ۸۷ درصد امتیاز بگیرد. هیچ استاندارد جهانی برای «هوش مصنوعی بودن» وجود ندارد. هر ابزار در واقع یک نظر است که با ریاضیات بیان شده است.

چهار سیگنالی که تشخیص‌دهنده‌ها به دنبال آن هستند

بیشتر پلتفرم‌های تشخیص، به دنبال تعدادی از نشانگرهای خاص می‌گردند. دانستن اینکه این نشانگرها چه هستند، بسیاری از ابهامات را برطرف می‌کند.

پیش‌بینی‌پذیری زبان انسان بی‌ثبات است. فردی که یک کافه را توصیف می‌کند ممکن است به بوی سوخته اسپرسو اشاره کند، سپس به خاطره‌ای از آشپزخانه مادربزرگش برود و سپس به صحبت درباره کف‌پوش‌های لکه‌دار بازگردد. یک هوش مصنوعی تمایل دارد مسیر با بالاترین احتمال را دنبال کند. هوش مصنوعی کلماتی را انتخاب می‌کند که داده‌های آموزشی آن نشان داده‌اند ایمن‌ترین و مورد انتظارترین انتخاب هستند. تشخیص‌دهنده‌ها این موضوع را از طریق معیارهایی مانند پرپلکسیتی (perplexity) اندازه‌گیری می‌کنند. اگر متن شما به ندرت مدل زبانی داخلیِ خودِ تشخیص‌دهنده را غافلگیر کند، ابزار به دخالت هوش مصنوعی مشکوک می‌شود. هرچه نثر پیش‌بینی‌پذیرتر باشد، احتمال تشخیص بالاتر می‌رود.

تنوع جملات اگر هزار کلمه از خروجی ویرایش‌نشده هوش مصنوعی را با صدای بلند بخوانید، ممکن است متوجه یک اثر مترونوم باشید. جملات اغلب در محدوده تعداد کلمات مشابهی قرار می‌گیرند، که معمولاً ساختارهای مرکبی هستند که با حروف ربط به هم وصل شده‌اند. نویسندگان انسانی به شکل متفاوتی در صفحه نفس می‌کشند. آن‌ها جملات کوتاه می‌نویسند. آن‌ها اجازه می‌دهند یک جمله کوتاه و تک‌کلمه‌ای، پس از یک جمله طولانی و پیچیده، ضربه‌ای بزند. آن‌ها سوال می‌پرسند. آن‌ها عمداً ریتم را می‌شکنند. تشخیص‌دهنده‌ها به دنبال این بی‌نظمی هستند که اغلب «انفجار» (burstiness) نامیده می‌شود. آهنگ یکنواخت و نرم، آماری به نظر می‌رسد. آهنگ ناگهانی و نامنظم، انسانی به نظر می‌رسد.

ثبات لحن و دیدگاه خروجی هوش مصنوعی تمایل دارد از اولین جمله تا آخرین جمله در همان سطح زبانی (register) باقی بماند. اگر با لحنی رسمی و سوم‌شخص شروع شود، معمولاً همان‌طور باقی می‌ماند. انسان‌ها تغییر مسیر می‌دهند. آن‌ها با یک مشاهده حرفه‌ای شروع می‌کنند، سپس یک خاطره شخصی را یادآوری می‌کنند، سپس شوخی می‌کنند و دوباره جدی می‌شوند. آن‌ها از جملات حاشیه‌ای استفاده می‌کنند، واژگان را تغییر می‌دهند یا پس از تأمل، با نکته‌ای که قبلاً گفته‌اند تناقض ایجاد می‌کنند. بازسازی این نوسانات لحنی در قطعات طولانی برای مدل‌های زبانی فعلی به شکلی متقاعدکننده دشوار است. تشخیص‌دهنده‌ها این عدم ثبات را به عنوان مدرکی از وجود یک فرد واقعی پشت کیبورد در نظر می‌گیرند.

انتخاب کلمات و سطح زبان نوشته‌های مصنوعی معمولاً در یک حد وسطِ به‌طور عجیبی رسمی قرار دارند. آن‌ها اسامی انتزاعی رایج و افعال پرکاربرد را به اصطلاحات عامیانه خاص، اصطلاحات منطقه‌ای یا کلمات اختصاری تخصصی ترجیح می‌دهند. یک برنامه‌نویس انسانی ممکن است بنویسد که یک اسکریپت را «سرهم کرده» (hacked together) یا با «خط لوله ساخت» (build pipeline) «کلنجار رفته» است. یک هوش مصنوعی به احتمال زیاد می‌گوید که یک «راهکار توسعه داده» یا «به مسئله استقرار رسیدگی کرده» است. تشخیص‌دهنده‌ها زمانی متوجه می‌شوند که متن در یک محدوده واژگانی باریک و با فرکانس بالا باقی می‌ماند و به ندرت خطر استفاده از یک عبارت غیرمعمول یا یک پیچش دستوری عمدی را می‌پذیرد.

چرا امتیاز شما در پلتفرم‌های مختلف تغییر می‌کند

اگر یک مقاله یکسان را در سه تشخیص‌دهنده مختلف کپی کنید، ممکن است سه حکم ناسازگار دریافت کنید. این اتفاق به این دلیل می‌افتد که ماشین‌آلات زیربنایی به روش‌های معناداری با هم متفاوت هستند.

برخی ابزارها عمدتاً بر اساس خروجی‌های قدیمی‌تر GPT-3.5 آموزش دیده‌اند. برخی دیگر نسل‌های جدیدتر GPT-4 را دریافت می‌کنند یا متن‌های مصنوعی از چندین مدل مختلف را با هم ترکیب می‌کنند. وزن‌دهی ویژگی‌های آن‌ها نیز متفاوت است. یک پلتفرم ممکن است یکنواختی طول جملات را بسیار مهم بداند، در حالی که پلتفرم دیگری بر «سرگشتگی» (perplexity) تمرکز می‌کند. آستانه‌ها انتخاب‌های داخلی و قراردادی هستند. یک فروشنده ممکن است هر چیزی بالاتر از ۶۰ درصد اطمینان را «احتمالاً هوش مصنوعی» برچسب بزند، در حالی که رقیب آن را برای ۹۰ درصد رزرو می‌کند.

هیچ نهاد حاکمی وجود ندارد که این ابزارها را تأیید کند. آن‌ها ابزارهای آزمایشی هستند که با پوششی از قطعیت بازاریابی می‌شوند. برخورد با احکام آن‌ها به عنوان مدرک قانونی یا دلیلی برای تنبیه آکادمیک، مانند استفاده از یک ایستگاه هواشناسی دستی برای پیش‌بینی عملکرد محصول برای یک فصل کامل است.

مشکل مثبت کاذب

از آنجایی که تشخیص‌دهنده‌ها به جای اثبات مستقیم، بر همبستگی آماری تکیه می‌کنند، به طور معمول نوشته‌های انسانی را به اشتباه به عنوان متن مصنوعی شناسایی می‌کنند. چندین دسته از نثر مشروع، به‌ویژه آسیب‌پذیر هستند.

مقالات دانشگاهی از قراردادهای سختگیرانه‌ای پیروی می‌کنند. مجهول بودن جملات، عبارات احتیاطی و عناوین بخش‌های استاندارد، یک پروفایل آماری بسیار منظم ایجاد می‌کنند که مشابه داده‌های آموزشی مدل‌های هوش مصنوعی است. دفترچه‌های راهنمای فنی نیز با همین مشکل روبرو هستند. آن‌ها از اصطلاحات ثابت، جملات خبری کوتاه و تنوع احساسی حداقلی استفاده می‌کنند که همگی باعث ایجاد سوءظن مبتنی بر الگو می‌شوند. اسناد حقوقی اساساً قالب‌های ساختاریافته هستند و دقت تکراری آن‌ها برای یک طبقه‌بندی‌کننده، الگوریتمی به نظر می‌رسد.

افراد غیرانگلیسی‌زبانی که از زبان انگلیسی استفاده می‌کنند، اغلب نوشته‌هایی تولید می‌کنند که از نظر گرامری صحیح اما از نظر نحو ساده‌تر است. ساختار دقیق آن‌ها — دقیقاً به این دلیل که از آشفتگی اصطلاحی یک گوینده بومی اجتناب می‌کند — می‌تواند در همان منطقه آماری متن ماشینی قرار بگیرد. دانشجویی که ساعت‌ها برای نوشتن یک مقاله تلاش کرده است، ممکن است صرفاً به این دلیل که جملات منضبط و شفافش برای تشخیص‌دهنده بیش از حد منظم به نظر می‌رسند، به اشتباه متهم شود.

استفاده از تشخیص‌دهنده‌ها بدون اینکه اجازه دهید آن‌ها از شما استفاده کنند

سالم‌ترین راه تعامل با این ابزارها این است که با آن‌ها به عنوان یک فیلتر اولیه برخورد کنید، نه یک حکم قطعی. اگر ویرایشگر، معلم یا مدیر استخدام هستید، اجازه دهید یک امتیاز بالا به جای اتهام، باعث ایجاد یک گفتگو شود. از نویسنده درباره فرآیند کارش بپرسید. از او طرح کلی یا پیش‌نویس اولیه را بخواهید. به دنبال تفکر اصلی در پسِ متن بگردید.

اگر نویسنده هستید، نوشته خود را برای فریب دادن یک تشخیص‌دهنده بهینه نکنید. لحظه‌ای که شروع به وارد کردن غلط‌های املایی تصادفی، تکه‌تکه کردن مصنوعی جملات یا جایگزین کردن کلمات دقیق با مترادف‌های عجیب برای «انسانی‌تر» به نظر رسیدن می‌کنید، وضوح را فدای پارانویا کرده‌اید. شما دیگر برای یک خواننده نمی‌نویسید؛ شما در حال اجرا برای یک الگوریتم هستید.

همان‌گونه که فکر می‌کنید، بنویسید. ریتم خود را به طور طبیعی تغییر دهید. از واژگان تخصصی حوزه خود استفاده کنید. مشاهداتی را بگنجانید که فقط خودتان می‌توانید انجام دهید. این بافت و اصالت، بهترین دفاع شما در برابر هر تشخیص‌دهنده‌ای است و مهم‌تر از آن، همان چیزی است که نوشته شما را در وهله اول ارزش خواندن می‌بخشد.

نتیجه‌گیری اصلی

تشخیص‌دهنده‌های هوش مصنوعی، همراهان تحلیلی هستند، نه رانندگان. آن‌ها می‌توانند پیشنهاد دهند که متن از نظر آماری روان به نظر می‌رسد، اما نمی‌توانند بینش، خلاقیت یا تجربه زیسته را اندازه‌گیری کنند. یک امتیاز بالا نمی‌تواند به شما بگوید که آیا یک استدلال اصیل است، یک داستان واقعی است یا یک توضیح فنی دقیق است.

بر وضوح تمرکز کنید. انسانی را که در آن سوی صفحه قرار دارد در اولویت قرار دهید. ایده‌های اصیل بافتی دارند که هیچ طبقه‌بندی‌کننده‌ای نمی‌تواند به طور کامل آن را ثبت کند و هیچ درصدی هرگز جایگزین قضاوت یک خواننده دقیق نخواهد شد.