Hugging Face-এর সেরা AI পেপারসমূহ
AI দ্রুতগতিতে এগিয়ে চলেছে। বর্তমান প্রবণতাগুলো মূলত long-term agents, LLM-এর জন্য reinforcement learning এবং generative model-এর ওপর আরও উন্নত নিয়ন্ত্রণের দিকে মনোনিবেশ করছে।
এখানে Hugging Face থেকে ১০টি উল্লেখযোগ্য পেপার দেওয়া হলো:
- Program-as-Weights (2607.02512)
- সমস্যা: টাস্কগুলো হার্ড-কোড করা কঠিন, কিন্তু বিশাল মডেল চালানো অত্যন্ত ব্যয়বহুল।
- ধারণা: প্রাকৃতিক ভাষার বর্ণনাকে ছোট নিউরাল আর্টিফ্যাক্টে (neural artifacts) রূপান্তর করা।
- নতুন পদ্ধতি: একটি 4B কম্পাইলার ব্যবহার করে একটি ক্ষুদ্র weight প্যাকেজ তৈরি করা যা একটি 0.6B মডেল চালাতে পারে।
- ব্যবহারের ক্ষেত্র: অন-ডিভাইস AI এবং দ্রুত লোকাল টুলস।
- GitHub: https://github.com/programasweights/programasweights-python
- Training vs. Inference Policy (2606.29526)
- সমস্যা: মডেলগুলো প্রায়শই প্রশিক্ষণের (training) সময় এবং বাস্তব ব্যবহারের সময় ভিন্ন ভিন্ন পারফরম্যান্স দেখায়।
- ধারণা: প্রকৃত ইনফারেন্সের (inference) সময় ব্যবহৃত পলিসির উন্নতির ওপর গুরুত্ব দেওয়া।
- নতুন পদ্ধতি: প্রশিক্ষণের লক্ষ্যগুলোকে বাস্তব জগতের সিদ্ধান্ত গ্রহণের সাথে সামঞ্জস্যপূর্ণ করা।
- ব্যবহারের ক্ষেত্র: স্থিতিশীল LLM রিজনিং এবং RLHF পাইপলাইন।
- Project: https://anitaleungxx.github.io/MIPU/
- AgenticSTS (2607.02255)
- সমস্যা: long-term agents ব্যর্থ হয় কারণ তাদের মেমরি অগোছালো থাকে।
- ধারণা: context window পূর্ণ করার পরিবর্তে মেমরির অংশগুলোকে সাজাতে typed retrieval ব্যবহার করা।
- নতুন পদ্ধতি: স্বল্পমেয়াদী এবং কৌশলগত তথ্যের জন্য নিয়ন্ত্রিত মেমরি লেয়ার তৈরি করা।
- ব্যবহারের ক্ষেত্র: long-term AI অ্যাসিস্ট্যান্ট এবং জটিল এন্টারপ্রাইজ ওয়ার্কফ্লো।
- GitHub: https://github.com/AlayaLab/AgenticSTS
- EvoPolicyGym (2607.02440)
- সমস্যা: একটি এজেন্ট তার নিজস্ব নিয়মাবলী উন্নত করতে পারে কি না, তা পরিমাপ করার উপায় আমাদের নেই।
- ধারণা: এমন একটি পরিবেশ যেখানে এজেন্টদের তাদের নিজস্ব পলিসি এডিট করতে হবে।
- নতুন পদ্ধতি: শুধুমাত্র চূড়ান্ত ফলাফল নয়, বরং স্বয়ংক্রিয় উন্নতির (self-improvement) প্রক্রিয়াটি মূল্যায়ন করা।
- ব্যবহারের ক্ষেত্র: অটো-এজেন্ট এবং রোবোটিক্স।
- FlashMorph (2606.30562)
- সমস্যা: দীর্ঘ টেক্সটের ক্ষেত্রে Transformers-এ ফুল অ্যাটেনশন (full attention) অত্যন্ত ব্যয়বহুল।
- ধারণা: ফুল অ্যাটেনশনের সাথে সাশ্রয়ী লিনিয়ার অ্যাটেনশন (linear attention) মিশ্রিত করা।
- নতুন পদ্ধতি: সেরা হাইব্রিড সেটআপ খুঁজে পেতে একটি লেয়ার-ভিত্তিক গেট ব্যবহার করা।
- ব্যবহারের ক্ষেত্র: দীর্ঘ ডকুমেন্ট প্রসেসিং এবং RAG সিস্টেম।
- GitHub: https://github.com/LanDisen/FlashMorph
- MrFlow (2607.01642)
- সমস্যা: উচ্চ রেজোলিউশনে ডিফিউশন মডেলগুলো ধীরগতির হয়।
- ধারণা: অতিরিক্ত প্রশিক্ষণ ছাড়াই জেনারেশন প্রক্রিয়া দ্রুত করা।
- নতুন পদ্ধতি: প্রথমে লো-রেজোলিউশনে জেনারেট করা এবং তারপর সুপার-রেজোলিউশন ব্যবহার করা।
- ব্যবহারের ক্ষেত্র: দ্রুত টেক্সট-টু-ইমেজ টুলস।
- GitHub: https://github.com/Xingyu-Zheng/MrFlow
- AgenticDataBench (2607.01647)
- সমস্যা: বর্তমান বেঞ্চমার্কগুলো প্রকৃত ডেটা সায়েন্স কাজের প্রতিফলন ঘটায় না।
- ধারণা: বিভিন্ন ডোমেইনে ডেটা এজেন্টদের জন্য একটি ব্যাপক পরীক্ষা।
- নতুন পদ্ধতি: স্কিমা বোঝা (schema understanding) এবং এরর অ্যানালাইসিসের মতো নির্দিষ্ট দক্ষতা পরিমাপ করা।
- ব্যবহারের ক্ষেত্র: AI ডেটা অ্যানালিস্টদের মূল্যায়ন করা।
- GitHub: https://github.com/AgenticDataBench/AgenticDataBench
- WorldDirector (2607.02517)
- সমস্যা: ভিডিও জেনারেশনে দীর্ঘমেয়াদী ধারাবাহিকতার অভাব রয়েছে।
- ধারণা: মোশন প্ল্যানিং এবং ভিজ্যুয়াল রেন্ডারিংকে আলাদা করা।
- নতুন পদ্ধতি: 3D অবজেক্ট পাথ এবং ক্যামেরার মুভমেন্ট পরিচালনা করতে একটি LLM ব্যবহার করা।
- ব্যবহারের ক্ষেত্র: AI মুভি এবং গেম কন্টেন্ট।
- VLA-Corrector (2607.01804)
- সমস্যা: দ্রুত সিদ্ধান্ত নেওয়া রোবটরা লক্ষ্যচ্যুত হতে পারে।
- ধারণা: রিয়েল টাইমে ত্রুটি শনাক্ত করতে একটি ভিশন মনিটর যুক্ত করা।
- নতুন পদ্ধতি: শুধুমাত্র বিচ্যুতি ঘটলে পুনরায় পরিকল্পনা (replanning) শুরু করা।
- ব্যবহারের ক্ষেত্র: জটিল রোবোটিক পিক-অ্যান্ড-প্লেস টাস্ক।
- GitHub: https://github.com/ZJU-OmniAI/vla-corrector
- MRPO (2606.31825)
- সমস্যা: মেডিকেল AI-তে একটি ছোট ভুল পুরো রিজনিং চেইন নষ্ট করে দিতে পারে।
- ধারণা: শুধুমাত্র চূড়ান্ত উত্তরের জন্য নয়, বরং প্রতিটি সঠিক ধাপের জন্য মডেলটিকে পুরস্কৃত করা।
- নতুন পদ্ধতি: মেডিকেল রিজনিংয়ের জন্য স্টেপ-ওয়াইজ প্রসেস রিওয়ার্ড ব্যবহার করা।
- ব্যবহারের ক্ষেত্র: ক্লিনিক্যাল VQA এবং মেডিকেল ইমেজিং সাপোর্ট।
- GitHub: https://github.com/dmis-lab/MRPO
প্রবণতার সারসংক্ষেপ:
- উন্নত এজেন্ট: স্ট্রাকচার্ড মেমরি এবং স্বয়ংক্রিয় উন্নতির দিকে অগ্রসর হচ্ছে।
- উন্নত দক্ষতা: হাইব্রিড অ্যাটেনশন এবং মাল্টি-রেজোলিউশন ফ্লোর মাধ্যমে খরচ কমানো।
- উন্নত নির্ভরযোগ্যতা: ইনফারেন্সের সাথে প্রশিক্ষণের সামঞ্জস্য বিধান এবং সঠিক লজিক ধাপগুলোকে পুরস্কৃত করা।
Source: https://dev.to/y_hnhnhan_2f26de65ffcc4/top-ai-papers-on-hugging-face-2026-07-06-225o
Optional learning community: https://t.me/GyaanSetuAi
