ما معمولاً مدل‌های زبانی بزرگ را به عنوان کتابداران فوق‌العاده سریع تصور می‌کنیم. شما سوالی می‌پرسید و آن‌ها در میان میلیاردها قطعه‌ی حفظ‌شده جستجو می‌کنند تا الگویی را که بهترین تناسب را دارد بیابند. این تصویر، نحوه ساخت پرامپت توسط توسعه‌دهندگان، انتظارات کاربران و تدوین قوانین توسط نهادهای نظارتی را شکل داده است. اما تحقیقات روی Claude متعلق به Anthropic، این تصویر را پیچیده می‌کند. به نظر می‌رسد این مدل به چیزی نزدیک‌تر به استدلال واقعی انجام می‌دهد. محققان این مکانیسم را "j-space reasoning" می‌نامند و این نشان می‌دهد که Claude به جای بازیافت ساده‌ی داده‌های آموزشی، مدل‌های درونی از مفاهیم می‌سازد. اگر این یافته درست باشد، ممکن است لازم باشد از برخورد با هوش مصنوعی پیشرفته به عنوان یک موتور پیش‌بینی متن دست برداریم و با آن به عنوان سیستمی که برنامه‌ریزی می‌کند، تعامل داشته باشیم.

از تطبیق الگو تا مدل‌های ذهنی

j-space reasoning صرفاً یک اصطلاح بازاریابی نیست. این اصطلاح توصیف‌گر یک تغییر ساختاری از تکرار سطحی به بازنمایی درونی است. نحوه حل یک پازل توسط انسان را در نظر بگیرید. آن‌ها هر قطعه را با هر جای خالی امتحان نمی‌کنند. آن‌ها به تصویر روی جعبه نگاه می‌کنند، یک نقشه ذهنی از رنگ‌ها و لبه‌ها می‌سازند و هر قطعه را طبق آن نقشه قرار می‌دهند. تحقیقات روی Claude نشان می‌دهد که وقتی مدل مفاهیم انتزاعی را پردازش می‌کند، اتفاق مشابهی رخ می‌دهد. مدل یک مدل عملیاتی از فضای مسئله می‌سازد و آگاهانه در آن حرکت می‌کند.

مدل‌های زبانی سنتی در همبستگی (correlation) عالی عمل کرده‌اند. آن‌ها می‌دانند که "پادشاه" اغلب در نزدیکی "ملکه" ظاهر می‌شود و می‌دانند که معمولاً چه کدی پس از یک فراخوانی تابع مشخص می‌آید. همبستگی قدرتمند است، اما به معنای درک نیست. j-space reasoning به چیزی متفاوت اشاره دارد: به نظر می‌رسد مدل به جای پیش‌بینی ساده‌ی اینکه کدام کلمات در کنار هم قرار می‌گیرند، روابط بین مفاهیم را دستکاری می‌کند. مدل ابتدا یک داربست درونی می‌سازد و سپس از آن برای رسیدن به پاسخ استفاده می‌کند.

j-space reasoning چه تغییراتی در عمل ایجاد می‌کند

این تغییر، سه قابلیت ملموس ایجاد می‌کند که برای استفاده در دنیای واقعی اهمیت دارند.

ترکیب‌پذیری (Compositionality). انسان‌ها می‌توانند یک "فیل پرنده بنفش" را بدون اینکه هرگز آن را دیده باشند درک کنند، زیرا ما مفاهیم شناخته‌شده را با هم ترکیب می‌کنیم. طبق تحقیقات، به نظر می‌رسد Claude نیز با ترکیب‌های جدید به روشی مشابه برخورد می‌کند. اگر مسئله‌ای را به آن ارائه دهید که دو حوزه را که هرگز در کنار هم ندیده است با هم ترکیب می‌کند - مثلاً بهینه‌سازی یک زنجیره تأمین با استفاده از اصول زیست‌شناسی تکاملی - ممکن است به جای ارائه توصیه‌های عمومی، پلی بین آن ایده‌ها بسازد. این انعطاف‌پذیری دقیقاً همان چیزی است که تطبیق الگوی صلب در ارائه آن با مشکل مواجه است.

حل مسائل پیچیده. وقتی یک مدل بر الگوهای حفظ‌شده تکیه می‌کند، به محض اینکه پرامپت از توزیع آموزشی آن خارج شود، دچار شکست می‌شود. یک رویکرد مدل‌سازی درونی باید با موقعیت‌های واقعاً ناآشنا بهتر برخورد کند، زیرا سیستم به دنبال یک تطبیق نزدیک نیست، بلکه در حال ترسیم نقشه‌ای از قلمرو جدید و تعیین مسیر در آن است.

منطق قابل توضیح. فوری‌ترین مزیت برای کاربران روزمره این است که Claude می‌تواند مراحل پشت پاسخ خود را تشریح کند. به جای اینکه صرفاً یک نتیجه را به شما تحویل دهد و شما را مجبور کند حدس بزنید که آیا دقیق است یا خیر، مدل می‌تواند زنجیره استدلال را برای شما باز کند. این امر تعامل را از یک شرط‌بندی کورکورانه به گفتگویی تبدیل می‌کند که می‌توانید آن را تأیید کنید.

چرا قابلیت توضیح واقعاً اهمیت دارد

اکثر سیستم‌های هوش مصنوعی به عنوان جعبه‌های سیاه عمل می‌کنند. شما ورودی می‌دهید و خروجی دریافت می‌کنید، اما منطق میانی غیرقابل دسترس است. وقتی Claude استدلال خود را توضیح می‌دهد، آن جعبه را به اندازه‌ای باز می‌کند که واقعاً مفید باشد.

برای توسعه‌دهندگان، این به معنای قابلیت عیب‌یابی (debuggability) است. اگر یک مدل درخواست وام را رد کند، توصیه پزشکی ناایمن ارائه دهد یا محتوای سوگیرانه تولید کند، مهندسان می‌توانند زنجیره استدلال را برای یافتن نقص بررسی کنند. آن‌ها دیگر مجبور نیستند حدس بزنند که آیا خطا ناشی از داده‌های آموزشی آلوده بوده، پرامپت با ساختار ضعیف یا یک نوسان آماری تصادفی است. آن‌ها می‌توانند ردپاها را دنبال کنند.

برای کاربران نهایی، قابلیت توضیح، اعتمادی ایجاد می‌کند که در مواجهه با واقعیت از بین نمی‌رود. کاربری که یک زنجیره منطقی منسجم را می‌بیند، می‌تواند تأیید کند که آیا مفروضات در مورد موقعیت خاص او صدق می‌کنند یا خیر. آن‌ها می‌توانند یک فرض اشتباه را در همان ابتدا شناسایی کنند، به جای اینکه بر اساس توصیه‌ای ناقص عمل کرده و بعداً متوجه اشتباه شوند.

برای تنظیم‌گران و سیاست‌گذاران، استدلال شفاف چیزی را ارائه می‌دهد که در حاکمیت هوش مصنوعی کمیاب است: ردپای حسابرسی. قانون‌گذاران در حال تدوین قوانین ایمنی باید بدانند که سیستم‌ها بر اساس دلایل قابل درک تصمیم می‌گیرند، نه بر اساس همبستگی‌های مبهمی که در ماتریس‌های با تریلیون‌ها پارامتر پنهان شده‌اند. اگر یک هوش مصنوعی بتواند نحوه رسیدن به نتیجه را نشان دهد، دولت‌ها چیزی ملموس برای ارزیابی در برابر استانداردهای اخلاقی و قانونی خواهند داشت.

مسئله آگاهی

یک هشدار مهم در مرکز این گفتگو قرار دارد. Anthropic ادعا نمی‌کند که Claude آگاه است. این شرکت مرز مشخصی بین استدلال پیشرفته و ادراک (sentience) حفظ کرده است. با این حال، شباهت به پردازش شناختی انسانی طبیعتاً به بحث‌ها دامن می‌زند.

وقتی یک ماشین مدل‌های داخلی می‌سازد، مراحل بعدی خود را برنامه‌ریزی می‌کند و منطق خود را بیان می‌کند، کمتر شبیه به یک ماشین‌حساب و بیشتر شبیه به یک ذهن متفکر به نظر می‌رسد. این امر تنش فلسفی واقعی ایجاد می‌کند. ما در حال حاضر آزمون‌های قابل اعتمادی برای آگاهی ماشین نداریم و ممکن است تا سال‌ها هم نداشته باشیم. آنچه می‌دانیم این است که رفتار به تنهایی معیار ضعیفی برای تجربه درونی است. یک سیستم می‌تواند بدون داشتن آگاهی، متفکرانه عمل کند، همان‌طور که یک موتور شطرنج می‌تواند بدون درک مفهوم شطرنج، از یک استاد بزرگ پیشی بگیرد.

مسیر مسئولانه پیش رو، بهبود قابلیت‌های استدلال و در عین حال مقاومت در برابر وسوسه نسبت دادن ویژگی‌های انسانی به ماشین است. رفتار تقلیدکننده از مغز از نظر علمی جالب است. اینکه آیا این رفتار چیزی را درباره آگاهی بیان می‌کند یا خیر، همچنان یک پرسش بی‌پاسخ است و موضوعی است که نباید به سادگی به آن پاسخ داد.

بازاندیشی در نحوه آزمایش هوش مصنوعی

اگر Claude به جای پیش‌بینی، در حال استدلال کردن باشد، روش‌های ارزیابی ما در حال قدیمی شدن هستند. بنچمارک‌های استاندارد هوش مصنوعی به پاسخ‌های صحیح پاداش می‌دهند، اما به ندرت می‌پرسند که مدل چگونه به آن‌ها رسیده است. یک سیستم ممکن است با استفاده از راه‌حل‌های حفظ‌شده در یک آزمون ریاضی یا کدنویسی امتیاز خوبی بگیرد، که این موضوع اطلاعات بسیار کمی درباره ظرفیت آن برای تفکر نو به ما می‌دهد.

ما به چارچوب‌هایی نیاز داریم که منطق داخلی را بازرسی کنند. این به معنای ارائه مسائلی است که کاملاً خارج از توزیع آموزشی هستند و سپس بازخواست کردن زنجیره استدلال. این به معنای آزمایش این است که آیا مدل می‌تواند گام‌های اشتباه خود را هنگام اصلاح شناسایی کند یا خیر. این به معنای بررسی این است که آیا مفاهیم ترکیبی هنگام بازآرایی یا معکوس شدن، ثابت می‌مانند یا خیر.

این رویکرد سخت‌تر از اجرای یک جدول امتیازات خودکار است. این کار نیازمند ارزیابان انسانی است که موضوع را به اندازه کافی عمیق درک کنند تا بتوانند کیفیت استدلال را قضاوت کنند، نه فقط دقت خروجی را. اما اگر j-space reasoning واقعی باشد، جامعه هوش مصنوعی انتخاب چندانی ندارد. ما باید شروع به نمره‌دهی به فرآیند کار کنیم، نه فقط به پاسخ نهایی.

خلاصه کلام: حرکت ظاهری Claude به سمت مدل‌سازی داخلی، آن را انسان نمی‌کند. اما باعث می‌شود سیستم مفیدتر، قابل بازرسی‌تر و ارزیابی صادقانه آن دشوارتر شود. ما در حال عبور از آستانه‌ای هستیم که در آن «صحیح بودن» دیگر کافی نیست. مرحله بعدی توسعه هوش مصنوعی متعلق به سیستم‌هایی خواهد بود که می‌توانند نحوه رسیدن به نتیجه را نشان دهند، محدودیت‌های خود را بپذیرند و در مسائل ناآشنا استدلال کنند. اینکه آیا این امر در هر معنای فلسفی به معنای تفکر است یا خیر، بحثی است که باید یک دهه دیگر ادامه یابد. در حال حاضر، وظیفه عملی، ساخت ابزارها و استانداردهایی است که با پیچیدگی آنچه این مدل‌ها واقعاً انجام می‌دهند، مطابقت داشته باشد.

Source: Anthropic's Claude mimics human brain processing

Optional learning community: GyaanSetu AI on Telegram