Hugging Face پر بہترین AI پیپرز
AI تیزی سے آگے بڑھ رہا ہے۔ موجودہ رجحانات طویل مدتی ایجنٹس (long-term agents)، LLMs کے لیے ری انفورسمنٹ لرننگ (reinforcement learning)، اور جنریٹیو ماڈلز پر بہتر کنٹرول پر مرکوز ہیں۔
یہاں Hugging Face کے 10 نمایاں پیپرز (papers) درج ہیں:
- Program-as-Weights (2607.02512)
- مسئلہ: ٹاسک کو ہارڈ کوڈ کرنا مشکل ہے، لیکن بڑے ماڈلز چلانا مہنگا ہے۔
- آئیڈیا: قدرتی زبان (natural language) کی تفصیلات کو چھوٹے نیورل آرٹفیکٹس (neural artifacts) میں تبدیل کرنا۔
- نیا طریقہ: ایک 4B کمپائلر کا استعمال کرتے ہوئے ایک چھوٹا ویٹ پیکیج (weight package) بنانا جسے 0.6B ماڈل چلا سکے۔
- استعمال کا طریقہ: آن ڈیوائس AI اور تیز رفتار مقامی ٹولز۔
- GitHub: https://github.com/programasweights/programasweights-python
- Training vs. Inference Policy (2606.29526)
- مسئلہ: ماڈلز اکثر ٹریننگ کے دوران اصل استعمال کے مقابلے میں مختلف کارکردگی دکھاتے ہیں۔
- آئیڈیا: اصل انفرنس (inference) کے دوران استعمال ہونے والی پالیسی کو بہتر بنانے پر توجہ دینا۔
- نیا طریقہ: ٹریننگ کے اہداف کو حقیقی دنیا کے فیصلہ سازی کے عمل کے مطابق بنانا۔
- استعمال کا طریقہ: مستحکم LLM ریژوننگ (reasoning) اور RLHF پائپ لائنز۔
- Project: https://anitaleungxx.github.io/MIPU/
- AgenticSTS (2607.02255)
- مسئلہ: طویل مدتی ایجنٹس اس لیے ناکام ہو جاتے ہیں کیونکہ ان کی میموری بکھری ہوئی ہوتی ہے۔
- آئیڈیا: کانٹیکسٹ ونڈو (context window) کو بھرنے کے بجائے میموری کے ٹکڑوں کو ترتیب دینے کے لیے ٹائپڈ ریٹریول (typed retrieval) کا استعمال کرنا۔
- نیا طریقہ: مختصر مدت اور اسٹریٹجک معلومات کے لیے کنٹرولڈ میموری لیئرز بنانا۔
- استعمال کا طریقہ: طویل مدتی AI اسسٹنٹس اور پیچیدہ انٹرپرائز ورک فلو۔
- GitHub: https://github.com/AlayaLab/AgenticSTS
- EvoPolicyGym (2607.02440)
- مسئلہ: ہمارے پاس یہ ناپنے کے طریقے نہیں ہیں کہ آیا کوئی ایجنٹ اپنے قوانین کو خود بہتر بنا سکتا ہے یا نہیں۔
- آئیڈیا: ایک ایسا ماحول جہاں ایجنٹس کو اپنی پالیسیاں خود ایڈٹ کرنی پڑیں۔
- نیا طریقہ: صرف حتمی نتیجے کے بجائے خود کو بہتر بنانے کے عمل کا جائزہ لینا۔
- استعمال کا طریقہ: آٹو ایجنٹس اور روبوٹکس۔
- FlashMorph (2606.30562)
- مسئلہ: طویل متن کے لیے Transformers میں فل اٹینشن (full attention) بہت مہنگی پڑتی ہے۔
- آئیڈیا: فل اٹینشن کو سستی لینیئر اٹینشن (linear attention) کے ساتھ ملانا۔
- نیا طریقہ: بہترین ہائبرڈ سیٹ اپ تلاش کرنے کے لیے لیئر پر مبنی گیٹ (gate) کا استعمال کرنا۔
- استعمال کا طریقہ: طویل دستاویزات کی پروسیسنگ اور RAG سسٹمز۔
- GitHub: https://github.com/LanDisen/FlashMorph
- MrFlow (2607.01642)
- مسئلہ: ڈیفیوژن ماڈلز (Diffusion models) ہائی ریزولوشن پر سست ہوتے ہیں۔
- آئیڈیا: اضافی ٹریننگ کے بغیر جنریشن کی رفتار بڑھانا۔
- نیا طریقہ: پہلے کم ریزولوشن پر جنریٹ کریں، پھر سپر ریزولوشن (super-resolution) کا استعمال کریں۔
- استعمال کا طریقہ: تیز رفتار ٹیکسٹ ٹو امیج ٹولز۔
- GitHub: https://github.com/Xingyu-Zheng/MrFlow
- AgenticDataBench (2607.01647)
- مسئلہ: موجودہ بینچ مارکس حقیقی ڈیٹا سائنس کے کام کی عکاسی نہیں کرتے۔
- آئیڈیا: بہت سے شعبوں میں ڈیٹا ایجنٹس کے لیے ایک جامع ٹیسٹ۔
- نیا طریقہ: مخصوص مہارتوں جیسے اسکیمہ کی سمجھ (schema understanding) اور غلطیوں کے تجزیے (error analysis) کو ناپنا۔
- استعمال کا طریقہ: AI ڈیٹا اینالسٹس کی جانچ کرنا۔
- GitHub: https://github.com/AgenticDataBench/AgenticDataBench
- WorldDirector (2607.02517)
- مسئلہ: ویڈیو جنریشن میں طویل مدتی تسلسل (consistency) کی کمی ہوتی ہے۔
- آئیڈیا: موشن پلاننگ کو ویژول رینڈرنگ سے الگ کرنا۔
- نیا طریقہ: 3D اشیاء کے راستوں اور کیمرہ موومنٹ کو مینیج کرنے کے لیے LLM کا استعمال کرنا۔
- استعمال کا طریقہ: AI فلمیں اور گیم مواد۔
- VLA-Corrector (2607.01804)
- مسئلہ: تیزی سے فیصلے کرنے والے روبوٹس اپنے راستے سے بھٹک سکتے ہیں۔
- آئیڈیا: ریئل ٹائم میں غلطیوں کا پتہ لگانے کے لیے ایک ویژن مانیٹر شامل کرنا۔
- نیا طریقہ: ری پلاننگ (replanning) صرف اس وقت شروع کرنا جب کوئی انحراف (deviation) ہو۔
- استعمال کا طریقہ: روبوٹک پک اینڈ پلیس کے پیچیدہ ٹاسک۔
- GitHub: https://github.com/ZJU-OmniAI/vla-corrector
- MRPO (2606.31825)
- مسئلہ: میڈیکل AI میں، ایک چھوٹی سی غلطی پوری ریژوننگ چین (reasoning chain) کو خراب کر دیتی ہے۔
- آئیڈیا: ماڈل کو صرف حتمی جواب کے لیے نہیں بلکہ ہر درست قدم کے لیے انعام دینا۔
- نیا طریقہ: میڈیکل ریژوننگ کے لیے مرحلہ وار پروسیس ریوارڈز کا استعمال کرنا۔
- استعمال کا طریقہ: کلینیکل VQA اور میڈیکل امیجنگ سپورٹ۔
- GitHub: https://github.com/dmis-lab/MRPO
رجحانات کا خلاصہ:
- بہتر ایجنٹس: منظم میموری اور خود کو بہتر بنانے کی طرف پیش قدمی۔
- بہتر کارکردگی: ہائبرڈ اٹینشن اور ملٹی ریزولوشن فلو کے ذریعے اخراجات میں کمی۔
- بہتر قابل اعتمادیت: ٹریننگ کو انفرنس کے مطابق بنانا اور درست منطقی اقدامات کو انعام دینا۔
ذریعہ: https://dev.to/y_hnhnhan_2f26de65ffcc4/top-ai-papers-on-hugging-face-2026-07-06-225o
اختیاری لرننگ کمیونٹی: https://t.me/GyaanSetuAi
