Ollama RC আপডেট: Qwen3.5 এবং স্ট্রিমিং ফিক্স
Ollama v0.32.6-rc0 রিলিজ হয়েছে। এটি Apple GPU ব্যবহারকারীদের জন্য আপডেট নিয়ে এসেছে এবং স্ট্রিমিং সংক্রান্ত সমস্যাগুলো সমাধান করেছে।
Apple ব্যবহারকারীদের জন্য নতুন ফিচারসমূহ: MLX ইঞ্জিন এখন Qwen3.5-এর সাথে speculative decoding-এর জন্য MTP head ব্যবহার করে। এই প্রক্রিয়াটি আগে থেকেই টোকেন প্রেডিক্ট করে। মূল মডেলটি ব্যাচ আকারে সেগুলো যাচাই করে। এটি ডিকোডিংয়ের সময় অপেক্ষার সময় কমিয়ে দেয়।
Ollama জানিয়েছে যে এটি Qwen3.5-কে আরও দ্রুত করে তোলে। তারা নোটগুলোতে নির্দিষ্ট কোনো বেঞ্চমার্ক বা গতির শতাংশ প্রদান করেনি। নিজস্ব পরীক্ষা ছাড়া নির্দিষ্ট কোনো গতি বৃদ্ধির কথা ধরে নেবেন না।
স্ট্রিমিং সামঞ্জস্যতা: এই আপডেটটি /v1/chat/completions endpoint কীভাবে স্ট্রিমিং হ্যান্ডেল করে তা পরিবর্তন করে। যদি আপনার সফটওয়্যার নির্দিষ্ট chunks বা finish_reason ডেটার ওপর নির্ভর করে, তবে আগে এটি পরীক্ষা করে নিন। প্রোডাকশন ওয়ার্কফ্লোর জন্য গতির মতোই অনুমেয় আচরণ (predictable behavior) গুরুত্বপূর্ণ।
গুরুত্বপূর্ণ সতর্কতা:
- এটি একটি release candidate। এটি কোনো স্ট্যাবল ভার্সন নয়।
- পরীক্ষামূলক ইমেজ জেনারেশন সাময়িকভাবে সরিয়ে নেওয়া হয়েছে।
- আপনার যদি ইমেজ জেনারেশন প্রয়োজন হয়, তবে ভার্সন 0.32.5-এ থাকুন।
কীভাবে এগোবেন:
- আপনি যদি Apple GPU ব্যবহার করেন এবং Qwen3.5-এর উন্নত পারফরম্যান্স চান, তবে এখনই এটি পরীক্ষা করে দেখুন।
- আপনার যদি ইমেজ জেনারেশন বা উচ্চ স্থিতিশীলতা প্রয়োজন হয়, তবে একটি স্ট্যাবল রিলিজের জন্য অপেক্ষা করুন।
- prefill এবং decode স্পিড আলাদাভাবে পরিমাপ করুন। MTP ডিকোডিংয়ে সাহায্য করে কিন্তু প্রতিটি কাজের জন্য মোট ল্যাটেন্সি (latency) পরিবর্তন নাও করতে পারে।
ঐচ্ছিক লার্নিং কমিউনিটি: https://t.me/GyaanSetuAi
