আপনার মডেলের আগে আপনার হারনেস আপনাকে মিথ্যা বলবে

আপনার মূল্যায়ন স্কোরবোর্ড বলেছিল যে উভয় ইঞ্জিনই ব্যর্থ হয়েছে।

Llama3.2 ৬টি কেসের মধ্যে ৫টিতে ব্যর্থ হয়েছে। Anthropic Sonnet ৬টি কেসের মধ্যে ৬টিতেই ব্যর্থ হয়েছে।

লেবেলটি ছিল "malformed"। কিন্তু কারণগুলো ছিল ভিন্ন।

একটি ব্যর্থতা ছিল API এরর কারণ ক্রেডিট শেষ হয়ে গিয়েছিল। একটি ব্যর্থতা ছিল CLI কমান্ড থেকে আসা টার্মিনাল কন্ট্রোল বাইটস যা টেক্সটকে নষ্ট করে ফেলেছিল। একটি ব্যর্থতা ছিল সঠিক JSON যা markdown fences-এর ভেতরে ছিল এবং পার্সার তা পড়তে পারছিল না।

আমি যদি সেই প্রথম সারাংশটি প্রকাশ করতাম, তবে আমি মিথ্যা বলতাম। আমি আমার নিজের কোডের ব্যর্থতার জন্য মডেলগুলোকে দোষারোপ করতাম।

সারাংশের ওপর নির্ভর না করে র (raw) রেকর্ডগুলো দেখে আমি এই বাগগুলো খুঁজে পেয়েছি।

প্রথম বাগটি ঘটেছিল কারণ আমি Ollama কল করার জন্য একটি CLI subprocess ব্যবহার করেছিলাম। কমান্ডটি স্পিনার এবং কার্সার মুভমেন্টের মতো টার্মিনাল অ্যানিমেশন তৈরি করেছিল। এই ANSI কন্ট্রোল বাইটসগুলো আমার ডেটাতে ঢুকে পড়েছিল। পার্সার অদৃশ্য ক্যারেক্টারগুলো দেখে ক্র্যাশ করেছিল।

সমাধান: CLI subprocess থেকে সরাসরি HTTP API-তে পরিবর্তন করুন।

দ্বিতীয় বাগটি ঘটেছিল কারণ LLM-গুলো প্রায়ই JSON-কে markdown fences-এর ভেতরে রাখে। আমার পার্সার র (raw) স্ট্রিং-এর ওপর json.loads() ব্যবহার করেছিল। এটি ব্যাকটিক (backticks) দেখে ব্যর্থ হয়েছিল।

সমাধান: পার্স করার আগে কোড ফেন্স (code fences) সরিয়ে ফেলার জন্য একটি ফাংশন যোগ করুন।

একবার আমি পাইপলাইনটি ঠিক করে ফেলার পর আসল ফলাফলগুলো সামনে এল।

মডেলগুলো "মৃত" ছিল না। হারনেস দ্বারা সেগুলো কেবল বিকৃত হচ্ছিল। সমাধানের পর, দুটি মডেলের গুণমানের ব্যবধান দৃশ্যমান এবং পরিমাপযোগ্য হয়ে ওঠে।

আপনার AI মূল্যায়ন পাইপলাইনের জন্য শিক্ষা:

  • র (raw) আউটপুট সংরক্ষণ করুন। সারাংশ যদি "malformed" বলে, তবে র আউটপুটই হবে আপনার একমাত্র সত্যের উৎস।
  • ব্যর্থতার কারণ রেকর্ড করুন। শুধু "malformed" বলবেন না। "API error" বা "parse error" বলুন।
  • আপনার টেস্টিং স্ট্যান্ডার্ড বা মানদণ্ড স্থির রাখুন। ফলাফলকে আরও ভালো দেখানোর জন্য আপনার নিয়ম পরিবর্তন করবেন না।
  • হারনেসকে পরীক্ষাধীন সিস্টেমের একটি অংশ হিসেবে বিবেচনা করুন।

শুধুমাত্র মডেলটিই বিচারের সম্মুখীন নয়। আপনার কোডও।

Source: https://dev.to/kenielzep97/your-harness-will-lie-to-you-before-your-model-does-662

Optional learning community: https://t.me/GyaanSetuAi