Deep Interaction به توسعه‌دهندگان اجازه می‌دهد زنجیره استدلال یک مدل زبانی را در لحظه ویرایش کنند، که باعث افزایش بیش از ۲۵ درصدی موفقیت در اصلاح و کاهش تقریباً ۴۰ درصدی مصرف توکن در مسائل STEM می‌شود.

چرا روش‌های اصلاحی موجود ناکافی هستند

مدل‌های زبانی بزرگ (LLMs) که از روش زنجیره تفکر (chain-of-thought) استفاده می‌کنند، سوالات پیچیده را به مجموعه‌ای از گام‌های منطقی تجزیه می‌کنند. وقتی یک مرحله اشتباه پیش می‌رود، توسعه‌دهندگان معمولاً گفتگو را از ابتدا شروع می‌کنند یا یک پرامپت اصلاحی به ابتدای آن اضافه می‌کنند. هر دو روش باعث اتلاف وقت می‌شوند: مدل اغلب همان اشتباه را تکرار می‌کند یا بدون یادگیری، یک عذرخواهی کلی ارائه می‌دهد. در نهایت، توسعه‌دهندگان مجبور می‌شوند ده‌ها پرامپت ارسال کنند تا فقط مدل را دوباره به مسیر درست هدایت کنند، که این امر باعث افزایش تعداد توکن‌ها و هزینه‌های محاسباتی می‌شود.

تفاوت Deep Interaction در چیست

این تکنیک جدید، خروجی مدل را به جای یک پاسخ «جعبه سیاه»، به عنوان متنی قابل ویرایش در نظر می‌گیرد. گردش کار به این صورت است:

  1. شناسایی خطا – توسعه‌دهنده دقیقاً همان مرحله‌ای از زنجیره استدلال را که اشتباه است، مشخص می‌کند.
  2. ویرایش در محل – توسعه‌دهنده آن خط را بازنویسی می‌کند، در حالی که مراحل صحیح اطراف آن را حفظ می‌کند.
  3. خلاصه‌سازی ویرایش – سیستم، اصلاح انجام‌شده توسط انسان را به یک پرامپت مختصر تبدیل می‌کند که منطق مورد نظر را در خود جای داده است.
  4. هدایت مدل – مدل زبانی بزرگ (LLM) این پرامپت خلاصه‌شده را دریافت کرده و استدلال را از نقطه اصلاح‌شده به بعد ادامه می‌دهد.

ارائه یک اصلاح متمرکز به مدل به جای ارسال مجدد کل پرامپت، از بازتولید بخش‌های قبلی پاسخ که از قبل صحیح بوده‌اند، جلوگیری می‌کند.

دستاوردهای قابل اندازه‌گیری

بنچمارک‌ها در مجموعه‌ای از وظایف STEM تأثیر این روش را به وضوح نشان می‌دهند. زمانی که توسعه‌دهندگان از Deep Interaction استفاده کردند، نسبت پاسخ‌های اصلاح‌شده با موفقیت، در مقایسه با روش استاندارد ارسال مجدد پرامپت، بیش از یک‌چهارم افزایش یافت. در عین حال، مصرف توکن حدود ۴۰ درصد کاهش یافت که منجر به کاهش هزینه‌های محاسبات ابری و افزایش سرعت اپلیکیشن‌های تعاملی شد.

چه کسانی از این قابلیت بهره‌مند می‌شوند

  • توسعه‌دهندگان – دیگر نیازی به نوشتن حلقه‌های بی‌پایان برای تنظیم پرامپت (prompt-tuning) ندارند. یک ویرایش واحد می‌تواند یک لغزش منطقی را برطرف کند و زمان را برای کارهای سطح بالاتر آزاد کند.
  • شرکت‌هایی که ابزارهای علمی یا مهندسی می‌سازند – استدلال قابل‌اعتمادتر به معنای خطاهای کمتر در مراحل بعدی شبیه‌سازی‌ها، محاسبات یا خطوط پردازش تحلیل داده است.
  • کاربران نهایی – پاسخ‌های سریع‌تر و هزینه‌های خدمات کمتر، تجربه کلی دستیارهای مبتنی بر هوش مصنوعی را بهبود می‌بخشد.

محدودیت‌ها و نکات متقابل

Deep Interaction با این فرض عمل می‌کند که توسعه‌دهنده می‌تواند نقص منطقی دقیق را شناسایی و بیان کند. در حوزه‌هایی که خطا ظریف است یا استدلال مبهم است، ویرایش دستی ممکن است غیرعملی باشد. همچنین، دستاوردهای گزارش‌شده مربوط به بنچمارک‌های کنترل‌شده در حوزه STEM است.

خلاصه کلام

Deep Interaction توسعه‌دهنده را از یک کاربر غیرفعال به یک معلم فعال تبدیل می‌کند و امکان اصلاح دقیق و کم‌هزینه استدلال LLM را فراهم می‌سازد.