Hugging Face پر بہترین AI پیپرز

AI تیزی سے آگے بڑھ رہا ہے۔ موجودہ رجحانات طویل مدتی ایجنٹس (long-term agents)، LLMs کے لیے ری انفورسمنٹ لرننگ (reinforcement learning)، اور جنریٹیو ماڈلز پر بہتر کنٹرول پر مرکوز ہیں۔

یہاں Hugging Face کے 10 نمایاں پیپرز (papers) درج ہیں:

  1. Program-as-Weights (2607.02512)
  • مسئلہ: ٹاسک کو ہارڈ کوڈ کرنا مشکل ہے، لیکن بڑے ماڈلز چلانا مہنگا ہے۔
  • آئیڈیا: قدرتی زبان (natural language) کی تفصیلات کو چھوٹے نیورل آرٹفیکٹس (neural artifacts) میں تبدیل کرنا۔
  • نیا طریقہ: ایک 4B کمپائلر کا استعمال کرتے ہوئے ایک چھوٹا ویٹ پیکیج (weight package) بنانا جسے 0.6B ماڈل چلا سکے۔
  • استعمال کا طریقہ: آن ڈیوائس AI اور تیز رفتار مقامی ٹولز۔
  • GitHub: https://github.com/programasweights/programasweights-python
  1. Training vs. Inference Policy (2606.29526)
  • مسئلہ: ماڈلز اکثر ٹریننگ کے دوران اصل استعمال کے مقابلے میں مختلف کارکردگی دکھاتے ہیں۔
  • آئیڈیا: اصل انفرنس (inference) کے دوران استعمال ہونے والی پالیسی کو بہتر بنانے پر توجہ دینا۔
  • نیا طریقہ: ٹریننگ کے اہداف کو حقیقی دنیا کے فیصلہ سازی کے عمل کے مطابق بنانا۔
  • استعمال کا طریقہ: مستحکم LLM ریژوننگ (reasoning) اور RLHF پائپ لائنز۔
  • Project: https://anitaleungxx.github.io/MIPU/
  1. AgenticSTS (2607.02255)
  • مسئلہ: طویل مدتی ایجنٹس اس لیے ناکام ہو جاتے ہیں کیونکہ ان کی میموری بکھری ہوئی ہوتی ہے۔
  • آئیڈیا: کانٹیکسٹ ونڈو (context window) کو بھرنے کے بجائے میموری کے ٹکڑوں کو ترتیب دینے کے لیے ٹائپڈ ریٹریول (typed retrieval) کا استعمال کرنا۔
  • نیا طریقہ: مختصر مدت اور اسٹریٹجک معلومات کے لیے کنٹرولڈ میموری لیئرز بنانا۔
  • استعمال کا طریقہ: طویل مدتی AI اسسٹنٹس اور پیچیدہ انٹرپرائز ورک فلو۔
  • GitHub: https://github.com/AlayaLab/AgenticSTS
  1. EvoPolicyGym (2607.02440)
  • مسئلہ: ہمارے پاس یہ ناپنے کے طریقے نہیں ہیں کہ آیا کوئی ایجنٹ اپنے قوانین کو خود بہتر بنا سکتا ہے یا نہیں۔
  • آئیڈیا: ایک ایسا ماحول جہاں ایجنٹس کو اپنی پالیسیاں خود ایڈٹ کرنی پڑیں۔
  • نیا طریقہ: صرف حتمی نتیجے کے بجائے خود کو بہتر بنانے کے عمل کا جائزہ لینا۔
  • استعمال کا طریقہ: آٹو ایجنٹس اور روبوٹکس۔
  1. FlashMorph (2606.30562)
  • مسئلہ: طویل متن کے لیے Transformers میں فل اٹینشن (full attention) بہت مہنگی پڑتی ہے۔
  • آئیڈیا: فل اٹینشن کو سستی لینیئر اٹینشن (linear attention) کے ساتھ ملانا۔
  • نیا طریقہ: بہترین ہائبرڈ سیٹ اپ تلاش کرنے کے لیے لیئر پر مبنی گیٹ (gate) کا استعمال کرنا۔
  • استعمال کا طریقہ: طویل دستاویزات کی پروسیسنگ اور RAG سسٹمز۔
  • GitHub: https://github.com/LanDisen/FlashMorph
  1. MrFlow (2607.01642)
  • مسئلہ: ڈیفیوژن ماڈلز (Diffusion models) ہائی ریزولوشن پر سست ہوتے ہیں۔
  • آئیڈیا: اضافی ٹریننگ کے بغیر جنریشن کی رفتار بڑھانا۔
  • نیا طریقہ: پہلے کم ریزولوشن پر جنریٹ کریں، پھر سپر ریزولوشن (super-resolution) کا استعمال کریں۔
  • استعمال کا طریقہ: تیز رفتار ٹیکسٹ ٹو امیج ٹولز۔
  • GitHub: https://github.com/Xingyu-Zheng/MrFlow
  1. AgenticDataBench (2607.01647)
  • مسئلہ: موجودہ بینچ مارکس حقیقی ڈیٹا سائنس کے کام کی عکاسی نہیں کرتے۔
  • آئیڈیا: بہت سے شعبوں میں ڈیٹا ایجنٹس کے لیے ایک جامع ٹیسٹ۔
  • نیا طریقہ: مخصوص مہارتوں جیسے اسکیمہ کی سمجھ (schema understanding) اور غلطیوں کے تجزیے (error analysis) کو ناپنا۔
  • استعمال کا طریقہ: AI ڈیٹا اینالسٹس کی جانچ کرنا۔
  • GitHub: https://github.com/AgenticDataBench/AgenticDataBench
  1. WorldDirector (2607.02517)
  • مسئلہ: ویڈیو جنریشن میں طویل مدتی تسلسل (consistency) کی کمی ہوتی ہے۔
  • آئیڈیا: موشن پلاننگ کو ویژول رینڈرنگ سے الگ کرنا۔
  • نیا طریقہ: 3D اشیاء کے راستوں اور کیمرہ موومنٹ کو مینیج کرنے کے لیے LLM کا استعمال کرنا۔
  • استعمال کا طریقہ: AI فلمیں اور گیم مواد۔
  1. VLA-Corrector (2607.01804)
  • مسئلہ: تیزی سے فیصلے کرنے والے روبوٹس اپنے راستے سے بھٹک سکتے ہیں۔
  • آئیڈیا: ریئل ٹائم میں غلطیوں کا پتہ لگانے کے لیے ایک ویژن مانیٹر شامل کرنا۔
  • نیا طریقہ: ری پلاننگ (replanning) صرف اس وقت شروع کرنا جب کوئی انحراف (deviation) ہو۔
  • استعمال کا طریقہ: روبوٹک پک اینڈ پلیس کے پیچیدہ ٹاسک۔
  • GitHub: https://github.com/ZJU-OmniAI/vla-corrector
  1. MRPO (2606.31825)
  • مسئلہ: میڈیکل AI میں، ایک چھوٹی سی غلطی پوری ریژوننگ چین (reasoning chain) کو خراب کر دیتی ہے۔
  • آئیڈیا: ماڈل کو صرف حتمی جواب کے لیے نہیں بلکہ ہر درست قدم کے لیے انعام دینا۔
  • نیا طریقہ: میڈیکل ریژوننگ کے لیے مرحلہ وار پروسیس ریوارڈز کا استعمال کرنا۔
  • استعمال کا طریقہ: کلینیکل VQA اور میڈیکل امیجنگ سپورٹ۔
  • GitHub: https://github.com/dmis-lab/MRPO

رجحانات کا خلاصہ:

  • بہتر ایجنٹس: منظم میموری اور خود کو بہتر بنانے کی طرف پیش قدمی۔
  • بہتر کارکردگی: ہائبرڈ اٹینشن اور ملٹی ریزولوشن فلو کے ذریعے اخراجات میں کمی۔
  • بہتر قابل اعتمادیت: ٹریننگ کو انفرنس کے مطابق بنانا اور درست منطقی اقدامات کو انعام دینا۔

ذریعہ: https://dev.to/y_hnhnhan_2f26de65ffcc4/top-ai-papers-on-hugging-face-2026-07-06-225o

اختیاری لرننگ کمیونٹی: https://t.me/GyaanSetuAi