Anthropic উন্মোচন করল Claude Opus 5: অর্ধেক খরচে সেরা পারফরম্যান্স
Anthropic আনুষ্ঠানিকভাবে Claude Opus 5 লঞ্চ করেছে, যা একটি নতুন ফ্ল্যাগশিপ মডেল। এটি প্রিমিয়াম Claude Fable 5-এর প্রায় সমমানের পারফরম্যান্স অনেক কম মূল্যে প্রদান করে হাই-এন্ড LLM মার্কেটে বিপ্লব ঘটানোর জন্য ডিজাইন করা হয়েছে। এই কৌশলগত পদক্ষেপের লক্ষ্য হলো GPT-5.6 Sol-এর মতো প্রতিযোগীদের থেকে আসা প্রাইসিংয়ের চাপ মোকাবিলা করা এবং একই সাথে ডেভেলপারদের কোডিং ও জটিল জ্ঞানমূলক কাজের জন্য আরও একটি দক্ষ টুল প্রদান করা।
প্রাইস-পারফরম্যান্সের সীমানায় পরিবর্তন
Claude Opus 5-এর সবচেয়ে উল্লেখযোগ্য বৈশিষ্ট্য হলো এর আক্রমণাত্মক প্রাইসিং স্ট্রাকচার। যেখানে টপ-টিয়ার Claude Fable 5-এর খরচ প্রতি মিলিয়ন ইনপুট টোকেনের জন্য $10 এবং প্রতি মিলিয়ন আউটপুট টোকেনের জন্য $50, সেখানে Opus 5 এই রেট অর্ধেক করে দিয়েছে; এর মূল্য প্রতি মিলিয়ন ইনপুট টোকেনের জন্য $5 এবং প্রতি মিলিয়ন আউটপুট টোকেনের জন্য $25।
ল্যাটেন্সি (latency) সংক্রান্ত প্রয়োজনীয়তা মেটাতে Anthropic একটি "Fast Mode" চালু করেছে, যা প্রসেসিং স্পিড ২.৫ গুণ বাড়িয়ে দেয়, যদিও এর জন্য টোকেন প্রাইস দ্বিগুণ করতে হয়। এই স্তরভিত্তিক প্রাইসিং এবং ১ মিলিয়ন টোকেনের বিশাল কনটেক্সট উইন্ডো Opus 5-কে Claude Max-এর জন্য নতুন ডিফল্ট মডেল এবং Claude Pro ব্যবহারকারীদের জন্য সবচেয়ে সক্ষম বিকল্প হিসেবে প্রতিষ্ঠিত করেছে।
কোডিং এবং রিজনিংয়ে বেঞ্চমার্কের শ্রেষ্ঠত্ব
Opus 5 কেবল একটি সাশ্রয়ী বিকল্প নয়; এটি নির্দিষ্ট ক্ষেত্রে পারফরম্যান্সের দিক থেকে অত্যন্ত শক্তিশালী। Frontier-Bench v0.1-এর মাধ্যমে এজেন্টিক টার্মিনাল কোডিংয়ে Opus 5 ৪৩.৩% স্কোর অর্জন করেছে, যা Fable 5 (৩৩.৭%) এবং GPT-5.6 Sol (৩৪.৪%) উভয়কেই উল্লেখযোগ্যভাবে ছাড়িয়ে গেছে। এটি নলেজ ওয়ার্ক বা জ্ঞানমূলক কাজেও আধিপত্য দেখিয়েছে এবং ১,৮৬১ Elo স্কোর নিয়ে GDPval-AA v2 বেঞ্চমার্কে শীর্ষে রয়েছে।
সম্ভবত সবচেয়ে চমকপ্রদ পরিসংখ্যানটি এসেছে ARC-AGI-3 বেঞ্চমার্ক থেকে, যা নতুন বা অভিনব সমস্যা সমাধানের ক্ষমতা পরিমাপ করে। Opus 5 ৩০.২% স্কোর করেছে, যা GPT-5.6 Sol-এর অর্জন করা ৭.৮%-এর তুলনায় প্রায় চারগুণ বেশি। এটি নির্দেশ করে যে মডেলটির ট্রেনিং ডেটার প্যাটার্নের বাইরে থাকা কাজগুলো সামলানোর ক্ষেত্রে এক বিশাল অগ্রগতি হয়েছে।
ইন্টেলিজেন্ট এফোর্ট স্কেলিং এবং দক্ষতা
Anthropic একটি উন্নত "effort" সিস্টেম চালু করেছে, যা ব্যবহারকারীদের পাঁচটি সেটিং-এর মধ্যে পরিবর্তন করার সুযোগ দেয়: low, medium, high, xhigh, এবং max। এটি টোকেন খরচ এবং রিজনিংয়ের গভীরতার মধ্যে একটি সূক্ষ্ম ভারসাম্য বজায় রাখতে সাহায্য করে।
খরচ কমাতে সাধারণ কাজের জন্য Anthropic "low" এবং "medium" সেটিং ব্যবহারের পরামর্শ দিলেও, জটিল এজেন্টিক কোডিংয়ের জন্য তারা "xhigh" ব্যবহারের পরামর্শ দেয়। মজার বিষয় হলো, কোম্পানিটি লক্ষ্য করেছে যে "max" সেটিংয়ে কার্যকারিতা কমে যাচ্ছে; Frontier-Bench v0.1 এবং Artificial Analysis Coding Agent Index—উভয় ক্ষেত্রেই দেখা গেছে যে বেশি খরচ সত্ত্বেও সর্বোচ্চ এফোর্ট বা "max" সেটিংয়ে Opus 5-এর পারফরম্যান্স কিছুটা কমে গেছে। এটি ইঙ্গিত দেয় যে দক্ষতার দিক থেকে বর্তমানে "xhigh" সেটিংটিই সবচেয়ে উপযোগী।
উন্নত নিরাপত্তা এবং স্বায়ত্তশাসন
ব্যবহারকারীদের ফিডব্যাকের সরাসরি প্রেক্ষিতে Anthropic Opus 5-এর জন্য সেফটি ক্লাসিফায়ারগুলো আরও উন্নত করেছে। এই মডেলের সাইবার ফিল্টারগুলো Fable 5-এর তুলনায় প্রায় ৮৫% কম ট্রিগার হয়, যা বৈধ গবেষণাকে অতিরিক্ত কঠোরভাবে ব্লক করার বিষয়ে পূর্বের সমালোচনাগুলোর সমাধান দেয়। যদিও এটি এখনও exploit generation এবং বাইনারি-ভিত্তিক স্ক্যানিং প্রতিরোধ করে, তবে সোর্স কোড ভালনারেবিলিটি গবেষণার ক্ষেত্রে এটি অনেক বেশি নমনীয়।
তদুপরি, Opus 5 উন্নত self-correction ক্ষমতা প্রদর্শন করেছে। বাস্তবধর্মী পরীক্ষায়, মডেলটি জ্যামিতি ব্যাখ্যা করার জন্য নিজস্ব কম্পিউটার ভিশন পাইপলাইন লিখে FreeCAD-এ সফলভাবে একটি 3D মডেল তৈরি করেছে—এমন একটি কাজ যা অন্যান্য সব প্রতিযোগী মডেলকে হিমশিম খাইয়েছিল।
মূল বিষয়সমূহ
- বিপুল খরচ হ্রাস: Opus 5 প্রদান করছে Claude Fable 5-এর টোকেন খরচের মাত্র ৫০%-এ ফ্ল্যাগশিপ-লেভেল পারফরম্যান্স।
- রিজনিংয়ে যুগান্তকারী সাফল্য: অভিনব সমস্যা সমাধানের জন্য ARC-AGI-3 বেঞ্চমার্কে মডেলটি প্রতিযোগীদের তুলনায় ৪ গুণ বেশি এগিয়ে রয়েছে।
- ডেভেলপারদের কাজের গতি বৃদ্ধি: উন্নত সেফটি ক্লাসিফায়ার এবং বিশেষায়িত "effort" সেটিংয়ের মাধ্যমে Opus 5 এজেন্টিক কোডিং এবং গবেষণার জন্য আরও সাবলীল অভিজ্ঞতা প্রদান করে।
