از زمانی که ChatGPT به یک نام آشنا تبدیل شده است، افسانهای پیرامون تشخیصدهندههای هوش مصنوعی شکل گرفته است. مردم آنها را مانند سگهای شکاری دیجیتالی تصور میکنند که در جستجوی ردپای ChatGPT هستند. واقعیت بسیار کمتر از اینها سینمایی است. این ابزارها یک پایگاه داده مخفی از تمام آنچه یک LLM تاکنون نوشته است را جستجو نمیکنند. آنها هیچ خط مستقیمی به تاریخچه مرورگر شما ندارند. کاری که آنها واقعاً انجام میدهند این است که متن شما را از طریق مدلهای آماری عبور میدهند و به دنبال سیگنالهای ریاضی میگردند که با نثر تولیدشده توسط ماشین همبستگی دارند. درک این سیگنالها به شما کمک میکند تا نتایج آنها را هوشمندانه تفسیر کنید و از اعتماد کورکورانه به یک امتیاز درصدی جلوگیری میکند.
نحوه عملکرد واقعی این ابزارها
در هسته خود، تشخیصدهندههای هوش مصنوعی موتورهای تطبیق الگو هستند که با احتمالات تغذیه میشوند. مدلهای زبانی بزرگ (LLM) با پیشبینی محتملترین توکن بعدی، جمله پس از جمله، کار میکنند. در طول هزاران کلمه، این عادت یک باقیمانده آماری از خود به جای میگذارد. تشخیصدهندهها سعی میکنند آن باقیمانده را اندازهگیری کنند.
آن را مانند تحلیل دستخط در نظر بگیرید. یک کارشناس، حرف "g" شما را با یک پایگاه داده مرجع از تمام "g"هایی که تا به حال نوشته شده است، مقایسه نمیکند. در عوض، آنها به ریتم، شیب، فشار و فاصلهگذاری نگاه میکنند. تشخیصدهندهها منطق مشابهی را در متن اعمال میکنند. آنها بررسی میکنند که زبان چقدر قابل پیشبینی است، ساختار تا چه حد یکنواخت باقی میماند و آیا واژگان با محدوده آماری باریکی که در نوشتههای مصنوعی رایج است، مطابقت دارد یا خیر.
از آنجایی که هر ارائهدهنده تشخیصدهنده، مدل خود را بر روی مجموعهدادههای (corpora) مختلف آموزش میدهد و حساسیت خود را به گونهای متفاوت تنظیم میکند، یک پاراگراف مشابه میتواند در یک پلتفرم ۱۲ درصد و در پلتفرم دیگر ۸۷ درصد امتیاز بگیرد. هیچ استاندارد جهانی برای «هوش مصنوعی بودن» وجود ندارد. هر ابزار در واقع یک نظر است که با ریاضیات بیان شده است.
چهار سیگنالی که تشخیصدهندهها به دنبال آن هستند
بیشتر پلتفرمهای تشخیص، به دنبال تعدادی از نشانگرهای خاص میگردند. دانستن اینکه این نشانگرها چه هستند، بسیاری از ابهامات را برطرف میکند.
پیشبینیپذیری زبان انسان بیثبات است. فردی که یک کافه را توصیف میکند ممکن است به بوی سوخته اسپرسو اشاره کند، سپس به خاطرهای از آشپزخانه مادربزرگش برود و سپس به صحبت درباره کفپوشهای لکهدار بازگردد. یک هوش مصنوعی تمایل دارد مسیر با بالاترین احتمال را دنبال کند. هوش مصنوعی کلماتی را انتخاب میکند که دادههای آموزشی آن نشان دادهاند ایمنترین و مورد انتظارترین انتخاب هستند. تشخیصدهندهها این موضوع را از طریق معیارهایی مانند پرپلکسیتی (perplexity) اندازهگیری میکنند. اگر متن شما به ندرت مدل زبانی داخلیِ خودِ تشخیصدهنده را غافلگیر کند، ابزار به دخالت هوش مصنوعی مشکوک میشود. هرچه نثر پیشبینیپذیرتر باشد، احتمال تشخیص بالاتر میرود.
تنوع جملات اگر هزار کلمه از خروجی ویرایشنشده هوش مصنوعی را با صدای بلند بخوانید، ممکن است متوجه یک اثر مترونوم باشید. جملات اغلب در محدوده تعداد کلمات مشابهی قرار میگیرند، که معمولاً ساختارهای مرکبی هستند که با حروف ربط به هم وصل شدهاند. نویسندگان انسانی به شکل متفاوتی در صفحه نفس میکشند. آنها جملات کوتاه مینویسند. آنها اجازه میدهند یک جمله کوتاه و تککلمهای، پس از یک جمله طولانی و پیچیده، ضربهای بزند. آنها سوال میپرسند. آنها عمداً ریتم را میشکنند. تشخیصدهندهها به دنبال این بینظمی هستند که اغلب «انفجار» (burstiness) نامیده میشود. آهنگ یکنواخت و نرم، آماری به نظر میرسد. آهنگ ناگهانی و نامنظم، انسانی به نظر میرسد.
ثبات لحن و دیدگاه خروجی هوش مصنوعی تمایل دارد از اولین جمله تا آخرین جمله در همان سطح زبانی (register) باقی بماند. اگر با لحنی رسمی و سومشخص شروع شود، معمولاً همانطور باقی میماند. انسانها تغییر مسیر میدهند. آنها با یک مشاهده حرفهای شروع میکنند، سپس یک خاطره شخصی را یادآوری میکنند، سپس شوخی میکنند و دوباره جدی میشوند. آنها از جملات حاشیهای استفاده میکنند، واژگان را تغییر میدهند یا پس از تأمل، با نکتهای که قبلاً گفتهاند تناقض ایجاد میکنند. بازسازی این نوسانات لحنی در قطعات طولانی برای مدلهای زبانی فعلی به شکلی متقاعدکننده دشوار است. تشخیصدهندهها این عدم ثبات را به عنوان مدرکی از وجود یک فرد واقعی پشت کیبورد در نظر میگیرند.
انتخاب کلمات و سطح زبان نوشتههای مصنوعی معمولاً در یک حد وسطِ بهطور عجیبی رسمی قرار دارند. آنها اسامی انتزاعی رایج و افعال پرکاربرد را به اصطلاحات عامیانه خاص، اصطلاحات منطقهای یا کلمات اختصاری تخصصی ترجیح میدهند. یک برنامهنویس انسانی ممکن است بنویسد که یک اسکریپت را «سرهم کرده» (hacked together) یا با «خط لوله ساخت» (build pipeline) «کلنجار رفته» است. یک هوش مصنوعی به احتمال زیاد میگوید که یک «راهکار توسعه داده» یا «به مسئله استقرار رسیدگی کرده» است. تشخیصدهندهها زمانی متوجه میشوند که متن در یک محدوده واژگانی باریک و با فرکانس بالا باقی میماند و به ندرت خطر استفاده از یک عبارت غیرمعمول یا یک پیچش دستوری عمدی را میپذیرد.
چرا امتیاز شما در پلتفرمهای مختلف تغییر میکند
اگر یک مقاله یکسان را در سه تشخیصدهنده مختلف کپی کنید، ممکن است سه حکم ناسازگار دریافت کنید. این اتفاق به این دلیل میافتد که ماشینآلات زیربنایی به روشهای معناداری با هم متفاوت هستند.
برخی ابزارها عمدتاً بر اساس خروجیهای قدیمیتر GPT-3.5 آموزش دیدهاند. برخی دیگر نسلهای جدیدتر GPT-4 را دریافت میکنند یا متنهای مصنوعی از چندین مدل مختلف را با هم ترکیب میکنند. وزندهی ویژگیهای آنها نیز متفاوت است. یک پلتفرم ممکن است یکنواختی طول جملات را بسیار مهم بداند، در حالی که پلتفرم دیگری بر «سرگشتگی» (perplexity) تمرکز میکند. آستانهها انتخابهای داخلی و قراردادی هستند. یک فروشنده ممکن است هر چیزی بالاتر از ۶۰ درصد اطمینان را «احتمالاً هوش مصنوعی» برچسب بزند، در حالی که رقیب آن را برای ۹۰ درصد رزرو میکند.
هیچ نهاد حاکمی وجود ندارد که این ابزارها را تأیید کند. آنها ابزارهای آزمایشی هستند که با پوششی از قطعیت بازاریابی میشوند. برخورد با احکام آنها به عنوان مدرک قانونی یا دلیلی برای تنبیه آکادمیک، مانند استفاده از یک ایستگاه هواشناسی دستی برای پیشبینی عملکرد محصول برای یک فصل کامل است.
مشکل مثبت کاذب
از آنجایی که تشخیصدهندهها به جای اثبات مستقیم، بر همبستگی آماری تکیه میکنند، به طور معمول نوشتههای انسانی را به اشتباه به عنوان متن مصنوعی شناسایی میکنند. چندین دسته از نثر مشروع، بهویژه آسیبپذیر هستند.
مقالات دانشگاهی از قراردادهای سختگیرانهای پیروی میکنند. مجهول بودن جملات، عبارات احتیاطی و عناوین بخشهای استاندارد، یک پروفایل آماری بسیار منظم ایجاد میکنند که مشابه دادههای آموزشی مدلهای هوش مصنوعی است. دفترچههای راهنمای فنی نیز با همین مشکل روبرو هستند. آنها از اصطلاحات ثابت، جملات خبری کوتاه و تنوع احساسی حداقلی استفاده میکنند که همگی باعث ایجاد سوءظن مبتنی بر الگو میشوند. اسناد حقوقی اساساً قالبهای ساختاریافته هستند و دقت تکراری آنها برای یک طبقهبندیکننده، الگوریتمی به نظر میرسد.
افراد غیرانگلیسیزبانی که از زبان انگلیسی استفاده میکنند، اغلب نوشتههایی تولید میکنند که از نظر گرامری صحیح اما از نظر نحو سادهتر است. ساختار دقیق آنها — دقیقاً به این دلیل که از آشفتگی اصطلاحی یک گوینده بومی اجتناب میکند — میتواند در همان منطقه آماری متن ماشینی قرار بگیرد. دانشجویی که ساعتها برای نوشتن یک مقاله تلاش کرده است، ممکن است صرفاً به این دلیل که جملات منضبط و شفافش برای تشخیصدهنده بیش از حد منظم به نظر میرسند، به اشتباه متهم شود.
استفاده از تشخیصدهندهها بدون اینکه اجازه دهید آنها از شما استفاده کنند
سالمترین راه تعامل با این ابزارها این است که با آنها به عنوان یک فیلتر اولیه برخورد کنید، نه یک حکم قطعی. اگر ویرایشگر، معلم یا مدیر استخدام هستید، اجازه دهید یک امتیاز بالا به جای اتهام، باعث ایجاد یک گفتگو شود. از نویسنده درباره فرآیند کارش بپرسید. از او طرح کلی یا پیشنویس اولیه را بخواهید. به دنبال تفکر اصلی در پسِ متن بگردید.
اگر نویسنده هستید، نوشته خود را برای فریب دادن یک تشخیصدهنده بهینه نکنید. لحظهای که شروع به وارد کردن غلطهای املایی تصادفی، تکهتکه کردن مصنوعی جملات یا جایگزین کردن کلمات دقیق با مترادفهای عجیب برای «انسانیتر» به نظر رسیدن میکنید، وضوح را فدای پارانویا کردهاید. شما دیگر برای یک خواننده نمینویسید؛ شما در حال اجرا برای یک الگوریتم هستید.
همانگونه که فکر میکنید، بنویسید. ریتم خود را به طور طبیعی تغییر دهید. از واژگان تخصصی حوزه خود استفاده کنید. مشاهداتی را بگنجانید که فقط خودتان میتوانید انجام دهید. این بافت و اصالت، بهترین دفاع شما در برابر هر تشخیصدهندهای است و مهمتر از آن، همان چیزی است که نوشته شما را در وهله اول ارزش خواندن میبخشد.
نتیجهگیری اصلی
تشخیصدهندههای هوش مصنوعی، همراهان تحلیلی هستند، نه رانندگان. آنها میتوانند پیشنهاد دهند که متن از نظر آماری روان به نظر میرسد، اما نمیتوانند بینش، خلاقیت یا تجربه زیسته را اندازهگیری کنند. یک امتیاز بالا نمیتواند به شما بگوید که آیا یک استدلال اصیل است، یک داستان واقعی است یا یک توضیح فنی دقیق است.
بر وضوح تمرکز کنید. انسانی را که در آن سوی صفحه قرار دارد در اولویت قرار دهید. ایدههای اصیل بافتی دارند که هیچ طبقهبندیکنندهای نمیتواند به طور کامل آن را ثبت کند و هیچ درصدی هرگز جایگزین قضاوت یک خواننده دقیق نخواهد شد.
