Anthropic-এর নতুন বিটা হেডার Claude 3.7 Sonnet-এর জন্য টুল কলের (tool calls) টোকেন খরচ প্রায় ১৪ শতাংশ কমিয়ে দেয়, যা AI এজেন্টদের মাসিক বিল কিছুটা কমাতে এবং ল্যাটেন্সিতে (latency) সামান্য সুবিধা দিতে সাহায্য করবে।
কেন টুল ব্যবহার টোকেন খরচ বাড়িয়ে দেয়
Claude-এর সাথে একটি এজেন্টের প্রতিটি ধাপ তিনটি টোকেন-চালিত প্রক্রিয়ার মাধ্যমে সম্পন্ন হয়:
- Tool definitions – প্রম্পটের অংশ হিসেবে আপনি যে নাম এবং JSON স্কিমাগুলো পাঠান।
- Tool calls – মডেল যখন কোনো টুল ব্যবহার করার সিদ্ধান্ত নেয়, তখন এটি যে স্ট্রাকচার্ড আউটপুট তৈরি করে।
- Tool results – আপনার কোড মডেলকে যে ডেটা ফেরত পাঠায়।
প্রথম এবং তৃতীয় ধাপগুলো হলো ইনপুট টোকেন; দ্বিতীয় ধাপটি হলো আউটপুট টোকেন। যেহেতু Claude ইনপুটের তুলনায় আউটপুটের জন্য বেশি চার্জ করে, তাই মোট টোকেন সংখ্যা একই থাকলেও আউটপুট টোকেন কমানো খরচ কমিয়ে দিতে পারে।
বিটা হেডার (The beta header)
Anthropic token-efficient tool use নামে একটি বিটা ফিচারের ঘোষণা দিয়েছে। HTTP হেডার
anthropic-beta: token-efficient-tools-2025-02-19
যোগ করলে এই অপ্টিমাইজেশনটি সক্রিয় হয়, তবে এটি শুধুমাত্র তখনই কাজ করবে যখন রিকোয়েস্টটি Claude 3.7 Sonnet-কে টার্গেট করবে। যদি হেডারটি অন্য কোনো মডেলে পাঠানো হয়, তবে রিকোয়েস্টটি অপরিবর্তিত অবস্থায় চলতে থাকবে; কোনো ত্রুটি ছাড়াই হেডারটি উপেক্ষা করা হবে।
এই অপ্টিমাইজেশনটি মডেলের টুল-কল আউটপুট কম্প্রেস করার মাধ্যমে কাজ করে, যা ওই ধাপের আউটপুট টোকেন সংখ্যা প্রায় ১৪ শতাংশ কমিয়ে দেয়।
আপনি আসলে কতটা সাশ্রয় করবেন
আউটপুট টোকেন ইনপুট টোকেনের চেয়ে দামী, তাই সেই অংশের ১৪ শতাংশ হ্রাস মোট বিলের আনুপাতিক হারে কমবে না। একটি সাধারণ চার-ধাপের এজেন্ট লুপে, টুল ডেফিনিশনগুলো প্রায়শই ইনপুট খরচের বড় অংশ দখল করে থাকে, যা কখনও কখনও ব্যবহৃত টোকেনের অর্ধেকের বেশি হতে পারে। সেই পরিস্থিতিতে, আউটপুট টোকেনে ১৪ শতাংশ সাশ্রয় সাধারণত মোট খরচে মাত্র প্রায় ৩ শতাংশ হ্রাস আনে।
তাই সাশ্রয়ের এই মূল সংখ্যাটি সামান্য মনে হতে পারে, তবে এই পরিবর্তনটি কোনো অতিরিক্ত খরচ ছাড়াই আসে এবং ল্যাটেন্সিতে সামান্য উন্নতি ঘটায়: কম আউটপুট টোকেন মানে মডেলটি আরও দ্রুত জেনারেশন সম্পন্ন করতে পারে।
বড় ধরনের সাশ্রয়ের জন্য প্রয়োজন ভিন্ন কৌশল
যদি লক্ষ্য হয় খরচ উল্লেখযোগ্যভাবে কমানো, তবে শুধুমাত্র এই হেডারটি যথেষ্ট নয়। তিনটি ব্যবহারিক পদ্ধতি বড় ধরনের সাশ্রয় করতে পারে:
- Prompt caching – টুল ডেফিনিশনগুলো একবার সংরক্ষণ করুন এবং পরবর্তী কলগুলোতে ক্যাশ করা ভার্সনটি পুনরায় ব্যবহার করুন। ক্যাশ করা ডেটা পড়ার জন্য নতুন ইনপুট টোকেনের তুলনায় কম রেটে চার্জ করা হয়।
- Trim the tool set – শুধুমাত্র বর্তমান কাজের জন্য প্রয়োজনীয় টুলগুলো অন্তর্ভুক্ত করুন। প্রতিটি অতিরিক্ত টুল প্রতিটি রিকোয়েস্টে তার ডেফিনিশন যোগ করে, যা ইনপুট খরচ বাড়িয়ে দেয়।
- Slim down tool results – মডেলের আসলে যা প্রয়োজন শুধুমাত্র সেই ফিল্ডগুলোই ফেরত পাঠান। বড় API রেসপন্স যা কথোপকথনে পুনরায় পাঠানো হয়, তা ইনপুট টোকেন এবং কথোপকথনের ইতিহাস (conversation history) উভয়ই বাড়িয়ে দেয়।
এই পদ্ধতিগুলো প্রয়োগ করলে মোট খরচ থেকে উল্লেখযোগ্য পরিমাণ সাশ্রয় করা সম্ভব, যা শুধুমাত্র বিটা ফিচারের মাধ্যমে পাওয়া ৩ শতাংশ সাশ্রয়ের চেয়ে অনেক বেশি।
যা খেয়াল রাখা উচিত
Anthropic এখনও জানায়নি যে এই token-efficient মোডটি কখন—বা আদৌ—বিটা থেকে ডিফল্ট ফিচারে রূপান্তরিত হবে। ডেভেলপারদের উচিত ভবিষ্যতের ঘোষণাগুলোর দিকে নজর রাখা, যা হয়তো Claude 3.7 Sonnet-এর বাইরেও সাপোর্ট বাড়াতে পারে বা আরও উন্নত টোকেন-কম্প্রেশন কৌশল নিয়ে আসতে পারে। ব্যবহারের ধরন পরিবর্তনের সাথে সাথে রিয়েল-ওয়ার্ল্ড ইমপ্যাক্ট পরিমাপ করতে প্রতিটি রিকোয়েস্টের টোকেন ব্রেকডাউন পর্যবেক্ষণ করাও সহায়ক হবে।
সারকথা
এই বিটা হেডারটি একটি বিনামূল্যে এবং সহজ পরিবর্তন যা টুল-কল আউটপুট টোকেন প্রায় ১৪ শতাংশ কমিয়ে দেয়, ফলে বিল কিছুটা কমে এবং গতির সামান্য উন্নতি ঘটে। যারা ইতিমধ্যে উচ্চ এজেন্ট খরচের সাথে লড়াই করছেন, তাদের জন্য এই হেডারটি একটি সহায়ক সংযোজন, তবে প্রকৃত সাশ্রয় আসবে প্রম্পট ক্যাশিং, টুলের ব্যবহার সীমিত করা এবং আরও সংক্ষিপ্ত ফলাফল প্রদানের মাধ্যমে।
উৎস: https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l
