Hugging Face 'ਤੇ ਚੋਟੀ ਦੇ AI ਪੇਪਰ (Papers)
AI ਤੇਜ਼ੀ ਨਾਲ ਅੱਗੇ ਵਧ ਰਿਹਾ ਹੈ। ਮੌਜੂਦਾ ਰੁਝਾਨ ਲੰਬੇ ਸਮੇਂ ਦੇ agents, LLMs ਲਈ reinforcement learning, ਅਤੇ generative models 'ਤੇ ਬਿਹਤਰ ਕੰਟਰੋਲ 'ਤੇ ਕੇਂਦਰਿਤ ਹਨ।
ਇੱਥੇ Hugging Face ਤੋਂ 10 ਖਾਸ ਪੇਪਰ ਹਨ:
- Program-as-Weights (2607.02512)
- ਸਮੱਸਿਆ: ਟਾਸਕਾਂ ਨੂੰ hard-code ਕਰਨਾ ਮੁਸ਼ਕਲ ਹੈ, ਪਰ ਵਿਸ਼ਾਲ ਮਾਡਲਾਂ ਨੂੰ ਚਲਾਉਣਾ ਮਹਿੰਗਾ ਹੈ।
- ਵਿਚਾਰ: ਕੁਦਰਤੀ ਭਾਸ਼ਾ ਦੇ ਵੇਰਵਿਆਂ ਨੂੰ ਛੋਟੇ neural artifacts ਵਿੱਚ ਬਦਲਣਾ।
- ਨਵਾਂ ਤਰੀਕਾ: ਇੱਕ 4B compiler ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਇੱਕ ਛੋਟਾ weight package ਬਣਾਉਣਾ ਜਿਸ ਨੂੰ 0.6B ਮਾਡਲ ਚਲਾ ਸਕਦਾ ਹੈ।
- ਵਰਤੋਂ ਦਾ ਮਾਮਲਾ: On-device AI ਅਤੇ ਤੇਜ਼ ਸਥਾਨਕ (local) ਟੂਲਸ।
- GitHub: https://github.com/programasweights/programasweights-python
- Training vs. Inference Policy (2606.29526)
- ਸਮੱਸਿਆ: ਮਾਡਲ ਅਕਸਰ ਅਸਲ ਵਰਤੋਂ ਦੌਰਾਨ ਟ੍ਰੇਨਿੰਗ ਦੇ ਮੁਕਾਬਲੇ ਵੱਖਰੇ ਤਰੀਕੇ ਨਾਲ ਕੰਮ ਕਰਦੇ ਹਨ।
- ਵਿਚਾਰ: ਅਸਲ inference ਦੌਰਾਨ ਵਰਤੀ ਜਾਣ ਵਾਲੀ policy ਨੂੰ ਸੁਧਾਰਨ 'ਤੇ ਧਿਆਨ ਦੇਣਾ।
- ਨਵਾਂ ਤਰੀਕਾ: ਟ੍ਰੇਨਿੰਗ ਦੇ ਟੀਚਿਆਂ ਨੂੰ ਅਸਲ ਦੁਨੀਆ ਦੇ ਫੈਸਲੇ ਲੈਣ ਦੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ ਜੋੜਨਾ।
- ਵਰਤੋਂ ਦਾ ਮਾਮਲਾ: ਸਥਿਰ LLM reasoning ਅਤੇ RLHF pipelines।
- Project: https://anitaleungxx.github.io/MIPU/
- AgenticSTS (2607.02255)
- ਸਮੱਸਿਆ: ਲੰਬੇ ਸਮੇਂ ਦੇ agents ਇਸ ਲਈ ਅਸਫਲ ਹੁੰਦੇ ਹਨ ਕਿਉਂਕਿ ਉਹਨਾਂ ਦੀ ਮੈਮੋਰੀ ਅਸੰਗਠਿਤ ਹੁੰਦੀ ਹੈ।
- ਵਿਚਾਰ: context window ਨੂੰ ਭਰਨ ਦੀ ਬਜਾਏ ਮੈਮੋਰੀ ਦੇ ਹਿੱਸਿਆਂ ਨੂੰ ਸੰਗਠਿਤ ਕਰਨ ਲਈ typed retrieval ਦੀ ਵਰਤੋਂ ਕਰਨਾ।
- ਨਵਾਂ ਤਰੀਕਾ: ਥੋੜ੍ਹੇ ਸਮੇਂ ਅਤੇ ਰਣਨੀਤਕ ਜਾਣਕਾਰੀ ਲਈ ਨਿਯੰਤਰਿਤ ਮੈਮੋਰੀ ਲੇਅਰਾਂ ਬਣਾਉਣਾ।
- ਵਰਤੋਂ ਦਾ ਮਾਮਲਾ: ਲੰਬੇ ਸਮੇਂ ਦੇ AI assistants ਅਤੇ ਗੁੰਝਲਦਾਰ enterprise workflows।
- GitHub: https://github.com/AlayaLab/AgenticSTS
- EvoPolicyGym (2607.02440)
- ਸਮੱਸਿਆ: ਸਾਡੇ ਕੋਲ ਇਹ ਮਾਪਣ ਦੇ ਤਰੀਕੇ ਨਹੀਂ ਹਨ ਕਿ ਕੀ ਕੋਈ agent ਆਪਣੇ ਨਿਯਮਾਂ ਨੂੰ ਖੁਦ ਸੁਧਾਰ ਸਕਦਾ ਹੈ।
- ਵਿਚਾਰ: ਇੱਕ ਅਜਿਹਾ ਵਾਤਾਵਰਣ ਜਿੱਥੇ agents ਨੂੰ ਆਪਣੀਆਂ policies ਨੂੰ ਖੁਦ ਐਡਿਟ ਕਰਨਾ ਪਵੇ।
- ਨਵਾਂ ਤਰੀਕਾ: ਸਿਰਫ ਅੰਤਿਮ ਨਤੀਜੇ ਨੂੰ ਹੀ ਨਹੀਂ, ਸਗੋਂ ਸਵੈ-ਸੁਧਾਰ (self-improvement) ਦੀ ਪ੍ਰਕਿਰਿਆ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨਾ।
- ਵਰਤੋਂ ਦਾ ਮਾਮਲਾ: Auto-agents ਅਤੇ robotics।
- FlashMorph (2606.30562)
- ਸਮੱਸਿਆ: ਲੰਬੇ ਟੈਕਸਟ ਲਈ Transformers ਵਿੱਚ full attention ਬਹੁਤ ਮਹਿੰਗਾ ਹੈ।
- ਵਿਚਾਰ: full attention ਨੂੰ ਸਸਤੀ linear attention ਨਾਲ ਮਿਲਾਉਣਾ।
- ਨਵਾਂ ਤਰੀਕਾ: ਸਭ ਤੋਂ ਵਧੀਆ ਹਾਈਬ੍ਰਿਡ ਸੈੱਟਅੱਪ ਲੱਭਣ ਲਈ layer-based gate ਦੀ ਵਰਤੋਂ ਕਰਨਾ।
- ਵਰਤੋਂ ਦਾ ਮਾਮਲਾ: ਲੰਬੇ ਦਸਤਾਵੇਜ਼ਾਂ ਦੀ ਪ੍ਰੋਸੈਸਿੰਗ ਅਤੇ RAG systems।
- GitHub: https://github.com/LanDisen/FlashMorph
- MrFlow (2607.01642)
- ਸਮੱਸਿਆ: Diffusion models ਉੱਚ ਰੈਜ਼ੋਲੂਸ਼ਨ (high resolutions) 'ਤੇ ਹੌਲੀ ਹੁੰਦੇ ਹਨ।
- ਵਿਚਾਰ: ਵਾਧੂ ਟ੍ਰੇਨਿੰਗ ਤੋਂ ਬਿਨਾਂ ਜਨਰੇਸ਼ਨ ਦੀ ਰਫ਼ਤਾਰ ਵਧਾਉਣਾ।
- ਨਵਾਂ ਤਰੀਕਾ: ਪਹਿਲਾਂ ਘੱਟ ਰੈਜ਼ੋਲੂਸ਼ਨ 'ਤੇ ਜਨਰੇਟ ਕਰੋ, ਫਿਰ super-resolution ਦੀ ਵਰਤੋਂ ਕਰੋ।
- ਵਰਤੋਂ ਦਾ ਮਾਮਲਾ: ਤੇਜ਼ text-to-image ਟੂਲਸ।
- GitHub: https://github.com/Xingyu-Zheng/MrFlow
- AgenticDataBench (2607.01647)
- ਸਮੱਸਿਆ: ਮੌਜੂਦਾ benchmarks ਅਸਲ ਡਾਟਾ ਸਾਇੰਸ ਦੇ ਕੰਮ ਨੂੰ ਨਹੀਂ ਦਰਸਾਉਂਦੇ।
- ਵਿਚਾਰ: ਕਈ ਖੇਤਰਾਂ ਵਿੱਚ data agents ਲਈ ਇੱਕ ਵਿਆਪਕ ਟੈਸਟ।
- ਨਵਾਂ ਤਰੀਕਾ: schema understanding ਅਤੇ error analysis ਵਰਗੇ ਵਿਸ਼ੇਸ਼ ਹੁਨਰਾਂ ਨੂੰ ਮਾਪਣਾ।
- ਵਰਤੋਂ ਦਾ ਮਾਮਲਾ: AI data analysts ਦਾ ਮੁਲਾਂਕਣ ਕਰਨਾ।
- GitHub: https://github.com/AgenticDataBench/AgenticDataBench
- WorldDirector (2607.02517)
- ਸਮੱਸਿਆ: ਵੀਡੀਓ ਜਨਰੇਸ਼ਨ ਵਿੱਚ ਲੰਬੇ ਸਮੇਂ ਦੀ ਇਕਸਾਰਤਾ (consistency) ਦੀ ਕਮੀ ਹੈ।
- ਵਿਚਾਰ: motion planning ਨੂੰ visual rendering ਤੋਂ ਵੱਖ ਕਰਨਾ।
- ਨਵਾਂ ਤਰੀਕਾ: 3D objects ਦੇ ਰਸਤਿਆਂ ਅਤੇ ਕੈਮਰੇ ਦੀ ਹਰਕਤ ਨੂੰ ਪ੍ਰਬੰਧਿਤ ਕਰਨ ਲਈ ਇੱਕ LLM ਦੀ ਵਰਤੋਂ ਕਰਨਾ।
- ਵਰਤੋਂ ਦਾ ਮਾਮਲਾ: AI ਫਿਲਮਾਂ ਅਤੇ ਗੇਮ ਕੰਟੈਂਟ।
- VLA-Corrector (2607.01804)
- ਸਮੱਸਿਆ: ਤੇਜ਼ ਫੈਸਲੇ ਲੈਣ ਵਾਲੇ ਰੋਬੋਟ ਰਸਤੇ ਤੋਂ ਭਟਕ ਸਕਦੇ ਹਨ।
- ਵਿਚਾਰ: ਰੀਅਲ-ਟਾਈਮ ਵਿੱਚ ਗਲਤੀਆਂ ਦਾ ਪਤਾ ਲਗਾਉਣ ਲਈ ਇੱਕ vision monitor ਜੋੜਨਾ।
- ਨਵਾਂ ਤਰੀਕਾ: ਸਿਰਫ ਉਦੋਂ ਹੀ replanning ਸ਼ੁਰੂ ਕਰਨਾ ਜਦੋਂ ਕੋਈ ਭਟਕਾਅ (deviation) ਹੁੰਦਾ ਹੈ।
- ਵਰਤੋਂ ਦਾ ਮਾਮਲਾ: ਗੁੰਝਲਦਾਰ ਰੋਬੋਟਿਕ pick-and-place ਟਾਸਕ।
- GitHub: https://github.com/ZJU-OmniAI/vla-corrector
- MRPO (2606.31825)
- ਸਮੱਸਿਆ: ਮੈਡੀਕਲ AI ਵਿੱਚ, ਇੱਕ ਛੋਟੀ ਜਿਹੀ ਗਲਤੀ ਪੂਰੀ reasoning chain ਨੂੰ ਖਰਾਬ ਕਰ ਦਿੰਦੀ ਹੈ।
- ਵਿਚਾਰ: ਸਿਰਫ ਅੰਤਿਮ ਉੱਤਰ ਲਈ ਨਹੀਂ, ਸਗੋਂ ਹਰ ਸਹੀ ਕਦਮ ਲਈ ਮਾਡਲ ਨੂੰ ਰਿਵਾਰਡ (reward) ਦੇਣਾ।
- ਨਵਾਂ ਤਰੀਕਾ: ਮੈਡੀਕਲ reasoning ਲਈ step-wise process rewards ਦੀ ਵਰਤੋਂ ਕਰਨਾ।
- ਵਰਤੋਂ ਦਾ ਮਾਮਲਾ: Clinical VQA ਅਤੇ ਮੈਡੀਕਲ ਇਮੇਜਿੰਗ ਸਹਾਇਤਾ।
- GitHub: https://github.com/dmis-lab/MRPO
Summary of Trends:
- ਬਿਹਤਰ Agents: ਸੰਗਠਿਤ ਮੈਮੋਰੀ ਅਤੇ ਸਵੈ-ਸੁਧਾਰ ਵੱਲ ਵਧਣਾ।
- ਬਿਹਤਰ ਕੁਸ਼ਲਤਾ (Efficiency): ਹਾਈਬ੍ਰਿਡ attention ਅਤੇ multi-resolution flows ਰਾਹੀਂ ਲਾਗਤ ਘਟਾਉਣਾ।
- ਬਿਹਤਰ ਭਰੋਸੇਯੋਗਤਾ: ਟ੍ਰੇਨਿੰਗ ਨੂੰ inference ਨਾਲ ਜੋੜਨਾ ਅਤੇ ਸਹੀ ਤਰਕ ਕਦਮਾਂ (logic steps) ਨੂੰ ਰਿਵਾਰਡ ਦੇਣਾ।
Source: https://dev.to/y_hnhnhan_2f26de65ffcc4/top-ai-papers-on-hugging-face-2026-07-06-225o
Optional learning community: https://t.me/GyaanSetuAi
