Hugging Face पर शीर्ष AI पेपर्स

AI तेज़ी से आगे बढ़ रहा है। वर्तमान रुझान लॉन्ग-टर्म एजेंट्स (long-term agents), LLMs के लिए रीइन्फोर्समेंट लर्निंग (reinforcement learning) और जनरेटिव मॉडल्स पर बेहतर नियंत्रण पर केंद्रित हैं।

यहाँ Hugging Face के 10 प्रमुख पेपर्स दिए गए हैं:

  1. Program-as-Weights (2607.02512)
  • समस्या: कार्यों को हार्ड-कोड करना कठिन है, लेकिन विशाल मॉडल्स को चलाना महंगा है।
  • विचार: प्राकृतिक भाषा के विवरणों को छोटे न्यूरल आर्टिफैक्ट्स (neural artifacts) में बदलना।
  • नया दृष्टिकोण: एक 4B कंपाइलर का उपयोग करके एक छोटा वेट पैकेज (weight package) बनाना जिसे 0.6B मॉडल चला सके।
  • उपयोग: ऑन-डिवाइस AI और तेज़ लोकल टूल्स।
  • GitHub: https://github.com/programasweights/programasweights-python
  1. Training vs. Inference Policy (2606.29526)
  • समस्या: मॉडल अक्सर वास्तविक उपयोग के दौरान प्रशिक्षण (training) की तुलना में अलग प्रदर्शन करते हैं।
  • विचार: वास्तविक इन्फरेंस (inference) के दौरान उपयोग की जाने वाली पॉलिसी में सुधार करने पर ध्यान केंद्रित करना।
  • नया दृष्टिकोण: प्रशिक्षण लक्ष्यों को वास्तविक दुनिया के निर्णय लेने की प्रक्रिया के साथ संरेखित करना।
  • उपयोग: स्थिर LLM रीजनिंग और RLHF पाइपलाइन्स।
  • प्रोजेक्ट: https://anitaleungxx.github.io/MIPU/
  1. AgenticSTS (2607.02255)
  • समस्या: लॉन्ग-टर्म एजेंट्स विफल हो जाते हैं क्योंकि उनकी मेमोरी अव्यवस्थित होती है।
  • विचार: कॉन्टेक्स्ट विंडो (context window) को भरने के बजाय मेमोरी के टुकड़ों को व्यवस्थित करने के लिए टाइप किए गए रिट्रीवल (typed retrieval) का उपयोग करना।
  • नया दृष्टिकोण: अल्पकालिक और रणनीतिक जानकारी के लिए नियंत्रित मेमोरी लेयर्स बनाना।
  • उपयोग: लॉन्ग-टर्म AI असिस्टेंट और जटिल एंटरप्राइज वर्कफ़्लो।
  • GitHub: https://github.com/AlayaLab/AgenticSTS
  1. EvoPolicyGym (2607.02440)
  • समस्या: हमारे पास यह मापने के तरीके नहीं हैं कि क्या कोई एजेंट अपने स्वयं के नियमों में सुधार कर सकता है।
  • विचार: एक ऐसा वातावरण जहाँ एजेंटों को अपनी स्वयं की नीतियों को संपादित करना होगा।
  • नया दृष्टिकोण: केवल अंतिम परिणाम ही नहीं, बल्कि आत्म-सुधार (self-improvement) की प्रक्रिया का मूल्यांकन करना।
  • उपयोग: ऑटो-एजेंट्स और रोबोटिक्स।
  1. FlashMorph (2606.30562)
  • समस्या: लंबे टेक्स्ट के लिए ट्रांसफॉर्मर्स (Transformers) में फुल अटेंशन (full attention) बहुत महंगा है।
  • विचार: फुल अटेंशन को सस्ते लीनियर अटेंशन (linear attention) के साथ मिलाना।
  • नया दृष्टिकोण: सबसे अच्छा हाइब्रिड सेटअप खोजने के लिए लेयर-आधारित गेट का उपयोग करना।
  • उपयोग: लंबे दस्तावेज़ों का प्रसंस्करण और RAG सिस्टम।
  • GitHub: https://github.com/LanDisen/FlashMorph
  1. MrFlow (2607.01642)
  • समस्या: डिफ्यूजन मॉडल्स (Diffusion models) हाई रेजोल्यूशन पर धीमे होते हैं।
  • विचार: अतिरिक्त प्रशिक्षण के बिना जनरेशन की गति बढ़ाना।
  • नया दृष्टिकोण: पहले कम रेजोल्यूशन पर जनरेट करें, फिर सुपर-रेजोल्यूशन का उपयोग करें।
  • उपयोग: तेज़ टेक्स्ट-टू-इमेज टूल्स।
  • GitHub: https://github.com/Xingyu-Zheng/MrFlow
  1. AgenticDataBench (2607.01647)
  • समस्या: वर्तमान बेंचमार्क वास्तविक डेटा साइंस कार्य को नहीं दर्शाते हैं।
  • विचार: कई डोमेन में डेटा एजेंट्स के लिए एक व्यापक परीक्षण।
  • नया दृष्टिकोण: स्कीमा की समझ और त्रुटि विश्लेषण (error analysis) जैसे विशिष्ट कौशल को मापना।
  • उपयोग: AI डेटा एनालिस्ट का मूल्यांकन करना।
  • GitHub: https://github.com/AgenticDataBench/AgenticDataBench
  1. WorldDirector (2607.02517)
  • समस्या: वीडियो जनरेशन में लॉन्ग-टर्म निरंतरता (consistency) की कमी होती है।
  • विचार: मोशन प्लानिंग को विजुअल रेंडरिंग से अलग करना।
  • नया दृष्टिकोण: 3D ऑब्जेक्ट पाथ और कैमरा मूवमेंट को प्रबंधित करने के लिए LLM का उपयोग करना।
  • उपयोग: AI फिल्में और गेम कंटेंट।
  1. VLA-Corrector (2607.01804)
  • समस्या: त्वरित निर्णय लेने वाले रोबोट अपने ट्रैक से भटक सकते हैं।
  • विचार: वास्तविक समय में त्रुटियों का पता लगाने के लिए एक विजन मॉनिटर जोड़ना।
  • नया दृष्टिकोण: विचलन (deviation) होने पर ही रीप्लानिंग को ट्रिगर करना।
  • उपयोग: जटिल रोबोटिक पिक-एंड-प्लेस कार्य।
  • GitHub: https://github.com/ZJU-OmniAI/vla-corrector
  1. MRPO (2606.31825)
  • समस्या: मेडिकल AI में, एक छोटी सी गलती पूरी रीजनिंग चेन को खराब कर देती है।
  • विचार: केवल अंतिम उत्तर के लिए नहीं, बल्कि प्रत्येक सही कदम के लिए मॉडल को पुरस्कृत करना।
  • नया दृष्टिकोण: मेडिकल रीजनिंग के लिए स्टेप-वाइज प्रोसेस रिवॉर्ड्स का उपयोग करना।
  • उपयोग: क्लिनिकल VQA और मेडिकल इमेजिंग सपोर्ट।
  • GitHub: https://github.com/dmis-lab/MRPO

रुझानों का सारांश:

  • बेहतर एजेंट्स: स्ट्रक्चर्ड मेमोरी और आत्म-सुधार की ओर बढ़ रहे हैं।
  • बेहतर दक्षता: हाइब्रिड अटेंशन और मल्टी-रेजोल्यूशन फ्लो के माध्यम से लागत कम करना।
  • बेहतर विश्वसनीयता: प्रशिक्षण को इन्फरेंस के साथ संरेखित करना और सही लॉजिक स्टेप्स को पुरस्कृत करना।

स्रोत: https://dev.to/y_hnhnhan_2f26de65ffcc4/top-ai-papers-on-hugging-face-2026-07-06-225o

वैकल्पिक लर्निंग कम्युनिटी: https://t.me/GyaanSetuAi