یک توسعه‌دهنده یک مدل زبانی با ۳۵۰ میلیون پارامتر را گرفت، آن را بازتنظیم (fine-tune) کرد و به عنوان یک دستیار هوش مصنوعی کاملاً کاربردی که در هر مرورگر وب مدرنی اجرا می‌شود، مستقر کرد؛ بدون نیاز به فراخوانی سرور، کلید API یا هزینه‌های ابری.

این پروژه وزن‌های مدل را همراه با یک صفحه وب ایستا (static) ارائه می‌دهد که به عامل (agent) اجازه می‌دهد ابزارها را انتخاب کند، آرگومان‌ها را متصل کند، ارجاعاتی مانند «دومی» را تفسیر کند و در صورت کمبود اطلاعات از پاسخگویی خودداری کند؛ و تمام این‌ها در حالی انجام می‌شود که داده‌های شما روی دستگاه خودتان باقی می‌ماند.

نحوه ساخت عامل مبتنی بر مرورگر

نقطه شروع، خانواده LFM2.5 از LiquidAI، به‌ویژه نسخه‌های ۲۳۰ میلیون و ۳۵۰ میلیون پارامتری بود.

به جای چپاندن کاتالوگ محصولات یا جداول قیمت در مدل، آموزش‌دهنده الگوهای تعامل را به آن آموخت. عامل هرگز یک SKU خاص را نمی‌شناسد؛ بلکه یاد می‌گیرد که چگونه:

  • ابزار مناسب را برای یک درخواست مشخص انتخاب کند.
  • آرگومان‌ها و شناسه‌های صحیح را به آن ابزار متصل کند.
  • ارجاعات مبهم («یک دوجین»، «دومی») را تفسیر کند.
  • متن خارجی را فراخوانی کرده و از آن برای پاسخ به سوالات استفاده کند.
  • در صورت نبود اطلاعات مورد نیاز، از پاسخگویی امتناع کند.
  • گفتگو را در موضوع اصلی نگه دارد.

مجموعه ابزارها عمداً ایستا است: list_items ،get_item ،search_knowledge ،add_to_cart ،remove_from_cart ،clear_cart ،checkout و navigate. ثابت نگه داشتن این لیست از مدل جلوگیری می‌کند که شناسه‌های ابزار را حفظ کند و حجم داده‌های بازتنظیم (fine-tuning) را کم نگه می‌دارد.

سه انتخاب مهندسی باعث سبک ماندن سیستم می‌شود:

  1. لیست ابزارهای ثابت – مدل یک لیست مشخص از اقدامات را می‌بیند، بنابراین نیازی به دایره لغات بزرگی از نام ابزارها ندارد.
  2. RAG به عنوان یک ابزار – تولید تقویت‌شده با بازیابی (RAG) مانند هر تابع دیگری عمل می‌کند. عامل برای دریافت متن، search_knowledge را فراخوانی می‌کند و سپس آن متن را مستقیماً در پاسخ خود قرار می‌دهد؛ این کار از ایجاد یک خط لوله (pipeline) جداگانه برای بازیابی که باعث افزایش تأخیر و بار حافظه می‌شود، جلوگیری می‌کند.
  3. رمزگشایی با محدودیت دستور زبان (Grammar-constrained decoding) – در طول فرآیند تولید، رمزگشا (decoder) از یک دستور زبان ساده پیروی می‌کند که خروجی را مجبور می‌کند در یک ساختار معتبر برای فراخوانی ابزار قرار گیرد. این محدودیت باعث حذف توکن‌های هدر رفته و کاهش دستورات ناقص می‌شود.

آموزش از روش تقطیر داده‌های مصنوعی (synthetic data distillation) استفاده کرد. نویسنده ۱۸ دستورالعمل تعامل تعریف کرد که هر کدام یک تبادل معمول بین کاربر و دستیار را توصیف می‌کرد. یک مدل «معلم» بزرگ‌تر، بخش زبان طبیعی را تولید کرد، در حالی که یک اسکریپت قطعی (deterministic)، قالب دقیق فراخوانی ابزار را ایجاد کرد. فرآیند بازتنظیم تقریباً ۳۰ میلیون توکن مصرف کرد و در یک GPU با ۱۶ گیگابایت حافظه جای گرفت.

چرا اجرای روی دستگاه اهمیت دارد

  • حریم خصوصی – تمام دستورات کاربر در حافظه مرورگر باقی می‌مانند. هیچ داده‌ای (telemetry) از دستگاه خارج نمی‌شود که این موضوع برای پرس‌وجوهای حساس بسیار مهم است.
  • قابلیت آفلاین – از آنجایی که مدل به صورت محلی ذخیره (cache) می‌شود، دستیار بدون اتصال اینترنت نیز کار می‌کند که امکاناتی را برای کارهای میدانی یا سفر فراهم می‌کند.
  • هزینه – ارائه فایل‌های ایستای مدل، نیاز به سرورهای استنتاج (inference) مبتنی بر GPU یا هزینه‌های API برای هر فراخوانی را از بین می‌برد.
  • دسترسی‌پذیری – ناوبری صوتی در رابط‌های کاربری پیچیده وب در دستگاه‌های با مشخصات پایین امکان‌پذیر می‌شود و دسترسی به اپلیکیشن‌های وب را برای کاربرانی که به فناوری‌های کمکی متکی هستند، گسترش می‌دهد.

این مزایا بحث را از «آیا یک مدل غول‌پیکر می‌تواند به این پاسخ دهد؟» به «یک مدل چقدر می‌تواند کوچک باشد و همچنان کمک‌های مفیدی ارائه دهد؟» تغییر می‌دهد.

محدودیت‌های احتمالی

مدلی با این اندازه نمی‌تواند حقایق دانشنامه‌ای را حفظ کند. وقتی کاربر قیمت محصول خاص یا تیتر خبری اخیر را می‌پرسد، دستیار یا اطلاعات را از طریق search_knowledge بازیابی می‌کند و یا با ادب از پاسخگویی خودداری می‌کند. این طراحی از حریم خصوصی محافظت می‌کند اما سیستم را به کیفیت و تازگی منبع دانش خارجی خود وابسته می‌سازد.

آنچه باید در آینده دنبال کرد

نسخه نمایشی عمومی در یک آدرس ساده GitHub Pages قرار دارد و کد منبع آن به صورت آزاد در دسترس است.

نتیجه‌گیری: با آموزش یک LLM با اندازه متوسط برای پیروی از یک دستور زبان ابزار دقیق و با در نظر گرفتن بازیابی (retrieval) به عنوان یک تابع دیگر، توسعه‌دهندگان می‌توانند یک دستیار هوش مصنوعی کاربردی عرضه کنند که کاملاً در مرورگر اجرا می‌شود؛ و بدون فدا کردن توانایی‌های اصلی گفتگو، حریم خصوصی، استفاده آفلاین و هزینه ابری صفر را ارائه می‌دهد.