یک توسعهدهنده یک مدل زبانی با ۳۵۰ میلیون پارامتر را گرفت، آن را بازتنظیم (fine-tune) کرد و به عنوان یک دستیار هوش مصنوعی کاملاً کاربردی که در هر مرورگر وب مدرنی اجرا میشود، مستقر کرد؛ بدون نیاز به فراخوانی سرور، کلید API یا هزینههای ابری.
این پروژه وزنهای مدل را همراه با یک صفحه وب ایستا (static) ارائه میدهد که به عامل (agent) اجازه میدهد ابزارها را انتخاب کند، آرگومانها را متصل کند، ارجاعاتی مانند «دومی» را تفسیر کند و در صورت کمبود اطلاعات از پاسخگویی خودداری کند؛ و تمام اینها در حالی انجام میشود که دادههای شما روی دستگاه خودتان باقی میماند.
نحوه ساخت عامل مبتنی بر مرورگر
نقطه شروع، خانواده LFM2.5 از LiquidAI، بهویژه نسخههای ۲۳۰ میلیون و ۳۵۰ میلیون پارامتری بود.
به جای چپاندن کاتالوگ محصولات یا جداول قیمت در مدل، آموزشدهنده الگوهای تعامل را به آن آموخت. عامل هرگز یک SKU خاص را نمیشناسد؛ بلکه یاد میگیرد که چگونه:
- ابزار مناسب را برای یک درخواست مشخص انتخاب کند.
- آرگومانها و شناسههای صحیح را به آن ابزار متصل کند.
- ارجاعات مبهم («یک دوجین»، «دومی») را تفسیر کند.
- متن خارجی را فراخوانی کرده و از آن برای پاسخ به سوالات استفاده کند.
- در صورت نبود اطلاعات مورد نیاز، از پاسخگویی امتناع کند.
- گفتگو را در موضوع اصلی نگه دارد.
مجموعه ابزارها عمداً ایستا است: list_items ،get_item ،search_knowledge ،add_to_cart ،remove_from_cart ،clear_cart ،checkout و navigate. ثابت نگه داشتن این لیست از مدل جلوگیری میکند که شناسههای ابزار را حفظ کند و حجم دادههای بازتنظیم (fine-tuning) را کم نگه میدارد.
سه انتخاب مهندسی باعث سبک ماندن سیستم میشود:
- لیست ابزارهای ثابت – مدل یک لیست مشخص از اقدامات را میبیند، بنابراین نیازی به دایره لغات بزرگی از نام ابزارها ندارد.
- RAG به عنوان یک ابزار – تولید تقویتشده با بازیابی (RAG) مانند هر تابع دیگری عمل میکند. عامل برای دریافت متن،
search_knowledgeرا فراخوانی میکند و سپس آن متن را مستقیماً در پاسخ خود قرار میدهد؛ این کار از ایجاد یک خط لوله (pipeline) جداگانه برای بازیابی که باعث افزایش تأخیر و بار حافظه میشود، جلوگیری میکند. - رمزگشایی با محدودیت دستور زبان (Grammar-constrained decoding) – در طول فرآیند تولید، رمزگشا (decoder) از یک دستور زبان ساده پیروی میکند که خروجی را مجبور میکند در یک ساختار معتبر برای فراخوانی ابزار قرار گیرد. این محدودیت باعث حذف توکنهای هدر رفته و کاهش دستورات ناقص میشود.
آموزش از روش تقطیر دادههای مصنوعی (synthetic data distillation) استفاده کرد. نویسنده ۱۸ دستورالعمل تعامل تعریف کرد که هر کدام یک تبادل معمول بین کاربر و دستیار را توصیف میکرد. یک مدل «معلم» بزرگتر، بخش زبان طبیعی را تولید کرد، در حالی که یک اسکریپت قطعی (deterministic)، قالب دقیق فراخوانی ابزار را ایجاد کرد. فرآیند بازتنظیم تقریباً ۳۰ میلیون توکن مصرف کرد و در یک GPU با ۱۶ گیگابایت حافظه جای گرفت.
چرا اجرای روی دستگاه اهمیت دارد
- حریم خصوصی – تمام دستورات کاربر در حافظه مرورگر باقی میمانند. هیچ دادهای (telemetry) از دستگاه خارج نمیشود که این موضوع برای پرسوجوهای حساس بسیار مهم است.
- قابلیت آفلاین – از آنجایی که مدل به صورت محلی ذخیره (cache) میشود، دستیار بدون اتصال اینترنت نیز کار میکند که امکاناتی را برای کارهای میدانی یا سفر فراهم میکند.
- هزینه – ارائه فایلهای ایستای مدل، نیاز به سرورهای استنتاج (inference) مبتنی بر GPU یا هزینههای API برای هر فراخوانی را از بین میبرد.
- دسترسیپذیری – ناوبری صوتی در رابطهای کاربری پیچیده وب در دستگاههای با مشخصات پایین امکانپذیر میشود و دسترسی به اپلیکیشنهای وب را برای کاربرانی که به فناوریهای کمکی متکی هستند، گسترش میدهد.
این مزایا بحث را از «آیا یک مدل غولپیکر میتواند به این پاسخ دهد؟» به «یک مدل چقدر میتواند کوچک باشد و همچنان کمکهای مفیدی ارائه دهد؟» تغییر میدهد.
محدودیتهای احتمالی
مدلی با این اندازه نمیتواند حقایق دانشنامهای را حفظ کند. وقتی کاربر قیمت محصول خاص یا تیتر خبری اخیر را میپرسد، دستیار یا اطلاعات را از طریق search_knowledge بازیابی میکند و یا با ادب از پاسخگویی خودداری میکند. این طراحی از حریم خصوصی محافظت میکند اما سیستم را به کیفیت و تازگی منبع دانش خارجی خود وابسته میسازد.
آنچه باید در آینده دنبال کرد
نسخه نمایشی عمومی در یک آدرس ساده GitHub Pages قرار دارد و کد منبع آن به صورت آزاد در دسترس است.
نتیجهگیری: با آموزش یک LLM با اندازه متوسط برای پیروی از یک دستور زبان ابزار دقیق و با در نظر گرفتن بازیابی (retrieval) به عنوان یک تابع دیگر، توسعهدهندگان میتوانند یک دستیار هوش مصنوعی کاربردی عرضه کنند که کاملاً در مرورگر اجرا میشود؛ و بدون فدا کردن تواناییهای اصلی گفتگو، حریم خصوصی، استفاده آفلاین و هزینه ابری صفر را ارائه میدهد.
