আমি একটি ওয়েবসাইট তৈরি করেছি যা এআই (AI) অ্যাসিস্ট্যান্টদের দ্বারা উদ্ধৃত হতে চায় এবং অনুমানের ওপর নির্ভর না করে, আমি বহুল-প্রস্তাবিত তিনটি সিগন্যাল বাস্তবে প্রয়োগ করেছি: একটি robots.txt এন্ট্রি যা GPT-স্টাইল ক্রলারদের প্রবেশের অনুমতি দেয়, একটি llms.txt ফাইল যা প্রতিটি পেজের তালিকা দেয়, এবং একটি JSON-LD স্কিমা যা বিষয়বস্তু বর্ণনা করে। প্রতিটি পরীক্ষা করার পর, আমি দেখেছি যে কেবল একটি কোনো সতর্কতা ছাড়াই ব্যর্থ হতে পারে, আর বাকিগুলো তেমন কাজ করে না যা বেশিরভাগ মানুষ দাবি করেন।
কেন এই তিনটি সিগন্যাল গুরুত্বপূর্ণ
ওয়েবমাস্টারদের বলা হয়েছে যে এআই-কেন্দ্রিক ক্রলারদের জন্য স্পষ্ট অনুমতির প্রয়োজন, একটি সাধারণ টেক্সট "llms.txt" ইনডেক্স লার্জ ল্যাঙ্গুয়েজ মডেলগুলোকে (LLMs) প্রাসঙ্গিক অংশ খুঁজে পেতে সাহায্য করে, এবং JSON-LD স্ট্রাকচার্ড ডেটা উদ্ধৃত হওয়ার সম্ভাবনা বাড়ায়। এর প্রতিশ্রুতিটি সহজ: এই ফাইলগুলো যোগ করুন, এবং আপনার সাইট এআই-জেনারেটেড উত্তরে দেখা দিতে শুরু করবে, যা ট্রাফিক এবং ব্র্যান্ড ভিজিবিলিটি বাড়াবে।
১. robots.txt-এ এআই ক্রলারদের অনুমতি দেওয়া
robots.txt-এর যে লাইনে GPTBot (বা অন্য কোনো এআই বট) এর কথা উল্লেখ করা হয়, তা কেবল একটি অনুরোধ মাত্র। যদি কোনো কন্টেন্ট ডেলিভারি নেটওয়ার্ক (CDN) বা ফায়ারওয়াল বটটিকে ব্লক করে দেয়, তবে অনুরোধটি সাইটে পৌঁছায় না এবং ক্রলার ফাইলটি একেবারেই পড়তে পারে না। বটটি আপনার সাইটে প্রবেশ করতে পারছে কি না তা জানার একমাত্র নির্ভরযোগ্য উপায় হলো প্রতিটি প্রধান বটের জন্য HTTP স্ট্যাটাস কোড পরীক্ষা করা। একটি 403 (forbidden) বা 503 (service unavailable) রেসপন্স মানে হলো বাকি সব ব্যবস্থা অর্থহীন—বট না থাকলে ইনডেক্সিং বা উদ্ধৃতিও হবে না।
২. llms.txt ফাইল
একটি llms.txt ফাইল হলো মূলত ইউআরএল (URL)-এর একটি মার্কডাউন তালিকা, যার উদ্দেশ্য হলো LLM-গুলোকে একটি সাইটের পরিষ্কার ম্যাপ দেওয়া যাতে তাদের শুধুমাত্র HTML থেকে নেভিগেশন অনুমান করতে না হয়। বাস্তবে, গুগলের ডকুমেন্টেশন বলছে যে এটি ফাইলটিকে উপেক্ষা করে, এবং কোনো বড় সার্চ ইঞ্জিন উদ্ধৃতি প্রদানের উদ্দেশ্যে এটি ব্যবহারের প্রতিশ্রুতি দেয়নি। এটি রাখা প্রায় বিনা খরচে করা যায় এবং কাস্টম এআই এজেন্টদের জন্য এটি সুবিধাজনক হতে পারে, তবে এটিকে এআই উদ্ধৃতি পাওয়ার সহজ উপায় হিসেবে প্রচার করা উচিত নয়।
৩. JSON-LD স্কিমা
JSON-LD সরাসরি একটি পেজে স্ট্রাকচার্ড ডেটা—লেখকের নাম, প্রকাশের তারিখ, প্রোডাক্ট আইডি—এমবেড করে। অনেক মার্কেটার মনে করেন যে স্কিমা যোগ করলে তাদের পেজগুলো এআই উত্তরে আরও ঘনঘন দেখা যাবে, কিন্তু ১,৮৮৫টি পেজের একটি গবেষণায় দেখা গেছে যে শুধুমাত্র স্কিমা মার্কআপের মাধ্যমে উদ্ধৃতির ক্ষেত্রে কোনো উল্লেখযোগ্য উন্নতি হয়নি। JSON-LD-এর আসল গুরুত্ব রয়েছে এনটিটি রেজোলিউশন (entity resolution)-এ: এটি একটি মেশিনকে বলে দেয় যে একটি পেজের "Jane Doe" এবং অন্য পেজের "Jane Doe" একই ব্যক্তি, যা একই নামের মানুষ বা পণ্যের মধ্যে বিভ্রান্তি রোধ করে।
আসল বাধা: ইনডেক্সিং
এই তিনটি সিগন্যালই হলো প্রাথমিক পরিকাঠামো; এগুলো তখনই কাজ করে যদি পেজটি প্রথমেই ইনডেক্স করা থাকে। একটি পেজ যদি ইনডেক্সে কখনও না আসে, তবে আপনি যত বেশি ক্রলার অনুমতি বা স্কিমা ট্যাগই যোগ করুন না কেন, সেটি খুঁজে পাওয়া সম্ভব নয়। ইনডেক্সিংয়ের স্বাস্থ্যের সবচেয়ে নির্ভরযোগ্য সূচক হলো Google Search Console-এর কভারেজ রিপোর্ট (অথবা অন্যান্য ইঞ্জিনের সমতুল্য টুল)। যদি একটি পেজ "not indexed" হিসেবে দেখায়, তবে এআই-নির্দিষ্ট সিগন্যাল নিয়ে চিন্তিত হওয়ার আগে আপনাকে সেটি ঠিক করতে হবে।
একটি ব্যবহারিক চেকলিস্ট
১. ক্রলার অ্যাক্সেস যাচাই করুন – GPTBot, ClaudeBot, বা আপনার প্রয়োজনীয় অন্য যেকোনো এআই ক্রলারের জন্য HTTP রেসপন্স পরীক্ষা করুন। এই ধাপটি নিঃশব্দে ব্যর্থ হতে পারে; একটি ব্লক আপনার অ্যানালিটিক্সে কোনো সতর্কতা তৈরি করবে না। ২. ইনডেক্স কভারেজ নিশ্চিত করুন – কোন পেজগুলো ইনডেক্স করা হয়েছে, কোনগুলো বাদ দেওয়া হয়েছে এবং কেন, তা দেখতে Search Console ব্যবহার করুন। প্রথমে যেকোনো "crawl errors" বা "noindex" নির্দেশাবলী সমাধান করুন। ৩. পরিকাঠামো যোগ করুন – অ্যাক্সেস এবং ইনডেক্সিং নিশ্চিত হয়ে গেলে, llms.txt এবং JSON-LD যুক্ত করুন। এগুলোকে উদ্ধৃতির গ্যারান্টি হিসেবে না দেখে বরং কম রক্ষণাবেক্ষণের সহায়ক হিসেবে বিবেচনা করুন।
পাল্টা যুক্তি
কিছু ভেন্ডর এখনও llms.txt জেনারেটর এবং স্কিমা প্লাগইনগুলোকে এআই-এর জন্য SEO বুস্টার হিসেবে বাজারজাত করছে। আমার সংগৃহীত তথ্য এবং প্রধান সার্চ ইঞ্জিনগুলোর আনুষ্ঠানিক অবস্থান নির্দেশ করে যে এই দাবিগুলো অতিরঞ্জিত। এই টুলগুলো ক্ষতিকারক নয়, তবে এগুলোকে এআই-সাইটেশন কৌশলের মূল কেন্দ্রবিন্দু হওয়া উচিত নয়।
পরবর্তীতে যা খেয়াল রাখতে হবে
ক্রলার লগ পর্যবেক্ষণ করুন, Search Console অ্যালার্টের দিকে নজর রাখুন এবং পাইপলাইন সচল রাখতে পর্যায়ক্রমে ভ্যালিডেশন টুল দিয়ে আপনার JSON-LD পরীক্ষা করুন।
মূল কথা: আপনি যদি চান আপনার সাইট এআই দ্বারা উদ্ধৃত হোক, তবে llms.txt এবং স্কিমাকে জাদুর টিকিট হিসেবে দেখা বন্ধ করুন। নিশ্চিত করুন যে বটগুলো প্রকৃতপক্ষে আপনার সাইটে পৌঁছাতে পারছে এবং আপনার পেজগুলো ইনডেক্স করা আছে; কেবল তখনই অতিরিক্ত ফাইলগুলো তাদের সামান্য সহায়ক ভূমিকা পালন করতে পারবে।
উৎস: dev.to-তে মূল পোস্টটি
