পাঁটি নতুন কোডিং-কেন্দ্রিক LLM এখন ১৬ জিবি-৩২ জিবি র‍্যামযুক্ত একটি ২০২৬ সালের ল্যাপটপে চালানো সম্ভব, যা ডেভেলপারদের ক্লাউড ল্যাটেন্সি বা ডেটা-লিকেজ নিয়ে দুশ্চিন্তা ছাড়াই অফলাইন অটোকমপ্লিট, ডিবাগিং এবং কোড-রিভিউ টুলস ব্যবহারের সুবিধা দিচ্ছে। এই মডেলগুলোর পরিসর ৭ বিলিয়ন (7 B) প্যারামিটার বিশিষ্ট কোডার থেকে শুরু করে ৩২ বিলিয়ন (32 B) প্যারামিটার বিশিষ্ট হেভি-ডিউটি অ্যাসিস্ট্যান্ট পর্যন্ত, যার প্রতিটিই একটি লাইটওয়েট রানটাইমের সাথে যুক্ত।

কেন এখন লোকাল কোডিং মডেলগুলো গুরুত্বপূর্ণ

দৈনন্দিন কাজের বেশিরভাগ ক্ষেত্রে—যেমন ফাংশন লেখা, স্নিপেট রিফ্যাক্টরিং করা বা ইউনিট টেস্ট চেক করা—ডেভেলপারদের আর কোনো রিমোট API কল করার প্রয়োজন নেই। একটি লোকাল মডেল একবার চালু করলে তা ব্যবহারের জন্য কোনো খরচ লাগে না এবং এটি আপনার নিজস্ব কোড আপনার মেশিনের মধ্যেই সুরক্ষিত রাখে। এর বিনিময়ে আপনাকে র‍্যাম (RAM) দিতে হবে: একটি মডেলের আকার, অপারেটিং সিস্টেমের জন্য প্রয়োজনীয় মেমরি এবং KV ক্যাশ (টোকেন-লেভেল অ্যাটেনশনের জন্য অস্থায়ী স্টোরেজ) মিলিয়ে মোট মেমরি নির্ধারণ করে যে এটি আপনার ল্যাপটপে চলবে কি না।

পাঁচটি মডেল যা ল্যাপটপে প্রকৃতপক্ষে কাজ করে

Qwen2.5-Coder 32B Instruct (এর ফ্যামিলিতে 7B এবং 14B অন্তর্ভুক্ত রয়েছে)

  • সেরা ব্যবহারের ক্ষেত্র: দৈনন্দিন কোডিং, লাইন-বাই-লাইন অটোকমপ্লিট, ইউনিট টেস্ট জেনারেট করা।
  • কনটেক্সট উইন্ডো: ১৩১ K টোকেন (পুরো ফাইলটির জন্য যথেষ্ট)।
  • প্রয়োজনীয় র‍্যাম: 14 B ভ্যারিয়েন্টের জন্য ১৬ জিবি, পূর্ণাঙ্গ 32 B-এর জন্য ৩২ জিবি।
  • চালানোর জন্য: Ollama, LM Studio, অথবা llama.cpp।

DeepSeek-R1-Distill-Qwen-14B

  • সেরা ব্যবহারের ক্ষেত্র: সূক্ষ্ম বাগ খুঁজে বের করা, জটিল লজিক রিভিউ করা।
  • কনটেক্সট উইন্ডো: ১২৮ K টোকেন।
  • প্রয়োজনীয় র‍্যাম: 14 B মডেলের জন্য ১৬ জিবি; 32 B ভ্যারিয়েন্টের জন্য ৩২ জিবি প্রয়োজন হবে।
  • চালানোর জন্য: Ollama অথবা LM Studio।

DeepSeek একটি রিজনিং-ট্রেস লেয়ার যুক্ত করে, তাই এটি উত্তর দেওয়ার আগে "চিন্তা" করে। এই অতিরিক্ত ধাপটি এর গতি কিছুটা কমিয়ে দিলেও, এর গভীর বিশ্লেষণ দ্রুতগতির মডেলগুলো এড়িয়ে যাওয়া এজ-কেস (edge-case) ত্রুটিগুলো ধরতে পারে।

Phi-4 14B (Microsoft)

  • সেরা ব্যবহারের ক্ষেত্র: JSON জেনারেট করা, প্রজেক্ট স্কেলিং বা স্কেলিটন তৈরি করা, কোড স্নিপেট ব্যাখ্যা করা।
  • কনটেক্সট উইন্ডো: ১৬ K টোকেন।
  • প্রয়োজনীয় র‍্যাম: ১৬ জিবি।
  • চালানোর জন্য: Ollama অথবা vLLM।

সিন্থেটিক টেক্সটবুক দিয়ে প্রশিক্ষিত Phi-4 নির্দেশাবলী খুব নিখুঁতভাবে অনুসরণ করে, যা ফরম্যাট গুরুত্বপূর্ণ এমন স্ট্রাকচারড আউটপুটের জন্য একে নির্ভরযোগ্য করে তোলে।

Bonsai 27B

  • সেরা ব্যবহারের ক্ষেত্র: খুব সীমিত লোকাল রিসোর্সের সর্বোচ্চ ব্যবহার নিশ্চিত করা।
  • কনটেক্সট উইন্ডো: "Long" (সঠিক আকার প্রকাশ করা হয়নি)।
  • প্রয়োজনীয় র‍্যাম: ৮ জিবি।
  • চালানোর জন্য: Prism ML টুলস অথবা MLX।

Bonsai-এর চরম কম্প্রেশন একটি 27 B মডেলকে মাত্র ৩.৯ জিবি ফাইলের মধ্যে নিয়ে আসে, যা সাধারণ ল্যাপটপেও এটি চালানোর সুবিধা দেয়।

GLM-4-9B-Chat

  • সেরা ব্যবহারের ক্ষেত্র: বহুভাষিক ডকুমেন্টেশন, ইংরেজি বাদে অন্যান্য ভাষার কোড কমেন্ট।
  • কনটেক্সট উইন্ডো: ১২৮ K টোকেন।
  • প্রয়োজনীয় র‍্যাম: ৮ জিবি।
  • চালানোর জন্য: vLLM অথবা LM Studio।

এর শক্তিশালী বহুভাষিক সাপোর্ট GLM-4-কে অত্যন্ত উপযোগী করে তোলে, বিশেষ করে যখন ব্রাউজার পরিবর্তন না করেই বিদেশি ডকুমেন্টেশন থেকে কোড উদাহরণ পড়া বা তৈরি করার প্রয়োজন হয়।

আমি যেভাবে এগুলোকে সমন্বয় করি

কাজ মডেল
দ্রুত এডিট, অটোকমপ্লিট Qwen2.5-Coder 14B
গভীর ডিবাগিং, লজিক রিভিউ DeepSeek-R1-Distill-Qwen-14B
স্ট্রাকচারড ডেটা জেনারেশন Phi-4 14B
কম মেমরি সম্পন্ন পরিবেশ Bonsai 27B
ইংরেজি নয় এমন ডকুমেন্টেশন GLM-4-9B-Chat

র‍্যাম (RAM) সংক্রান্ত নির্দেশিকা যা উপেক্ষা করা যাবে না

  • 7 B-9 B মডেল: কমপক্ষে ৮ জিবি র‍্যাম।
  • 14 B মডেল: কমপক্ষে ১৬ জিবি র‍্যাম।
  • 27 B-32 B মডেল: ৩২ জিবি র‍্যাম অথবা একটি ডেডিকেটেড GPU।

এই সর্বনিম্ন মেমরির হিসাবটি ধরে নেওয়া হয়েছে যে অপারেটিং সিস্টেম এবং রানটাইমের KV ক্যাশ কয়েক গিগাবাইট জায়গা দখল করবে।

আপনি আপনার ল্যাপটপে কোন লোকাল মডেলগুলো ব্যবহার করছেন?