پنج مدل زبانی بزرگ (LLM) جدید با تمرکز بر کدنویسی، اکنون در یک لپ‌تاپ سال ۲۰۲۶ با ۱۶ تا ۳۲ گیگابایت رم جای می‌گیرند و به توسعه‌دهندگان ابزارهای تکمیل خودکار (autocomplete)، عیب‌یابی (debugging) و بازبینی کد (code-review) را به‌صورت آفلاین، بدون تأخیر ابری یا نگرانی از نشت داده‌ها ارائه می‌دهند. این مدل‌ها از یک کدنویس با ۷ میلیارد پارامتر تا یک دستیار سنگین با ۳۲ میلیارد پارامتر را شامل می‌شوند که هر کدام با یک محیط اجرایی (runtime) سبک همراه هستند.

چرا مدل‌های کدنویسی محلی اکنون اهمیت دارند

برای بیشتر کارهای روزمره — نوشتن توابع، بازنویسی (refactoring) قطعه‌کدها، بررسی تست‌های واحد (unit tests) — توسعه‌دهندگان دیگر نیازی به فراخوانی یک API از راه دور ندارند. یک مدل محلی یک‌بار اجرا می‌شود، هزینه‌ای برای پرس‌وجو ندارد و کدهای اختصاصی را در خود دستگاه نگه می‌دارد. چالش اصلی، رم (RAM) است: اندازه مدل به‌علاوه حافظه مورد نیاز برای سیستم‌عامل و KV cache (فضای ذخیره‌سازی موقت برای توجه در سطح توکن) تعیین می‌کند که آیا مدل روی یک لپ‌تاپ خاص اجرا می‌شود یا خیر.

پنج مدلی که واقعاً روی لپ‌تاپ کار می‌کنند

Qwen2.5-Coder 32B Instruct (شامل خانواده‌های 7B و 14B)

  • بهترین برای: کدنویسی روزمره، تکمیل خودکار خط‌به‌خط، تولید تست‌های واحد.
  • پنجره بافت (Context window): ۱۳۱ هزار توکن (کافی برای کل فایل‌ها).
  • رم مورد نیاز: ۱۶ گیگابایت برای نسخه 14B، ۳۲ گیگابایت برای نسخه کامل 32B.
  • اجرا با: Ollama، LM Studio یا llama.cpp.

DeepSeek-R1-Distill-Qwen-14B

  • بهترین برای: یافتن باگ‌های ظریف، بررسی منطق‌های پیچیده.
  • پنجره بافت: ۱۲۸ هزار توکن.
  • رم مورد نیاز: ۱۶ گیگابایت برای مدل 14B؛ نسخه 32B به ۳۲ گیگابایت رم نیاز دارد.
  • اجرا با: Ollama یا LM Studio.

DeepSeek یک لایه ردپای استدلال (reasoning-trace) اضافه می‌کند، بنابراین قبل از پاسخ دادن «فکر می‌کند». این مرحله اضافی سرعت آن را کاهش می‌دهد، اما دقت بیشتر باعث شناسایی خطاهای حالت‌های خاص (edge-case) می‌شود که مدل‌های سریع‌تر از آن‌ها غافل می‌مانند.

Phi-4 14B (Microsoft)

  • بهترین برای: تولید JSON، ساختاردهی اولیه پروژه‌ها (scaffolding)، توضیح قطعه‌کدها.
  • پنجره بافت: ۱۶ هزار توکن.
  • رم مورد نیاز: ۱۶ گیگابایت.
  • اجرا با: Ollama یا vLLM.

Phi-4 که بر روی کتاب‌های درسی مصنوعی آموزش دیده است، دستورالعمل‌ها را با دقت بالا دنبال می‌کند و برای خروجی‌های ساختاریافته که فرمت در آن‌ها اهمیت دارد، قابل اعتماد است.

Bonsai 27B

  • بهترین برای: بهره‌گیری حداکثری از استقرار‌های محلی بسیار کوچک.
  • پنجره بافت: «بلند» (اندازه دقیق اعلام نشده است).
  • رم مورد نیاز: ۸ گیگابایت.
  • اجرا با: ابزارهای Prism ML یا MLX.

فشرده‌سازی فوق‌العاده Bonsai یک مدل 27B را در یک فایل ۳.۹ گیگابایتی جای می‌دهد و اجازه می‌دهد روی لپ‌تاپ‌های معمولی اجرا شود.

GLM-4-9B-Chat

  • بهترین برای: مستندات چندزبانه، کامنت‌های کد به زبان‌های غیرانگلیسی.
  • پنجره بافت: ۱۲۸ هزار توکن.
  • رم مورد نیاز: ۸ گیگابایت.
  • اجرا با: vLLM یا LM Studio.

پشتیبانی قوی از چندین زبان باعث می‌شود GLM-4 زمانی که نیاز دارید مثال‌های کد را از مستندات خارجی بدون تغییر مرورگر بخوانید یا تولید کنید، بسیار کاربردی باشد.

چگونگی ترکیب آن‌ها توسط من

وظیفه مدل
ویرایش‌های سریع، تکمیل خودکار Qwen2.5-Coder 14B
عیب‌یابی عمیق، بررسی منطق DeepSeek-R1-Distill-Qwen-14B
تولید داده‌های ساختاریافته Phi-4 14B
محیط‌های با حافظه کم Bonsai 27B
مستندات غیرانگلیسی GLM-4-9B-Chat

راهنمای رم که نمی‌توان از آن چشم‌پوشی کرد

  • مدل‌های 7B-9B: حداقل ۸ گیگابایت رم.
  • مدل‌های 14B: حداقل ۱۶ گیگابایت رم.
  • مدل‌های 27B-32B: ۳۲ گیگابایت رم یا یک GPU اختصاصی.

این حداقل‌ها با این فرض هستند که سیستم‌عامل و KV cache محیط اجرا، چند گیگابایت از حافظه را اشغال می‌کنند.

شما چه مدل‌های محلی را روی لپ‌تاپ خود اجرا می‌کنید؟