Najlepsze prace badawcze AI na Hugging Face

AI rozwija się błyskawicznie. Obecne trendy koncentrują się na agentach długoterminowych, uczeniu ze wzmocnieniem (reinforcement learning) dla modeli LLM oraz lepszej kontroli nad modelami generatywnymi.

Oto 10 wyróżniających się prac z Hugging Face:

  1. Program-as-Weights (2607.02512)
  • Problem: Sztywne kodowanie zadań jest trudne, ale uruchamianie ogromnych modeli jest kosztowne.
  • Pomysł: Przekształcanie opisów w języku naturalnym w małe artefakty neuronowe.
  • Nowe podejście: Wykorzystanie kompilatora 4B do stworzenia miniaturowego pakietu wag, który jest uruchamiany przez model 0.6B.
  • Zastosowanie: AI na urządzeniach (on-device) oraz szybkie narzędzia lokalne.
  • GitHub: https://github.com/programasweights/programasweights-python
  1. Training vs. Inference Policy (2606.29526)
  • Problem: Modele często działają inaczej podczas trenowania niż w rzeczywistym użytkowaniu.
  • Pomysł: Skupienie się na ulepszeniu polityki (policy) stosowanej podczas rzeczywistego wnioskowania (inference).
  • Nowe podejście: Dostosowanie celów treningowych do podejmowania decyzji w świecie rzeczywistym.
  • Zastosowanie: Stabilne rozumowanie LLM i potoki (pipelines) RLHF.
  • Projekt: https://anitaleungxx.github.io/MIPU/
  1. AgenticSTS (2607.02255)
  • Problem: Agenci długoterminowi zawodzą, ponieważ ich pamięć jest nieuporządkowana.
  • Pomysł: Wykorzystanie typowanego wyszukiwania (typed retrieval) do organizowania fragmentów pamięci zamiast zapełniania okna kontekstowego.
  • Nowe podejście: Tworzenie kontrolowanych warstw pamięci dla informacji krótkoterminowych i strategicznych.
  • Zastosowanie: Długoterminowi asystenci AI i złożone procesy korporacyjne.
  • GitHub: https://github.com/AlayaLab/AgenticSTS
  1. EvoPolicyGym (2607.02440)
  • Problem: Brakuje metod pomiaru tego, czy agent potrafi ulepszać własne reguły.
  • Pomysł: Środowisko, w którym agenci muszą edytować własne polityki.
  • Nowe podejście: Ocena procesu samodoskonalenia, a nie tylko końcowego rezultatu.
  • Zastosowanie: Auto-agenci i robotyka.
  1. FlashMorph (2606.30562)
  • Problem: Pełna uwaga (full attention) w Transformerach jest zbyt kosztowna dla długich tekstów.
  • Pomysł: Połączenie pełnej uwagi z tańszą uwagą liniową (linear attention).
  • Nowe podejście: Wykorzystanie bramki opartej na warstwach w celu znalezienia najlepszej hybrydowej konfiguracji.
  • Zastosowanie: Przetwarzanie długich dokumentów i systemy RAG.
  • GitHub: https://github.com/LanDisen/FlashMorph
  1. MrFlow (2607.01642)
  • Problem: Modele dyfuzyjne są wolne przy wysokich rozdzielczościach.
  • Pomysł: Przyspieszenie generowania bez dodatkowego trenowania.
  • Nowe podejście: Najpierw generowanie w niskiej rozdzielczości, a następnie zastosowanie super-rozdzielczości.
  • Zastosowanie: Szybkie narzędzia text-to-image.
  • GitHub: https://github.com/Xingyu-Zheng/MrFlow
  1. AgenticDataBench (2607.01647)
  • Problem: Obecne benchmarki nie odzwierciedlają rzeczywistej pracy w dziedzinie data science.
  • Pomysł: Kompleksowy test dla agentów danych w wielu domenach.
  • Nowe podejście: Pomiar konkretnych umiejętności, takich jak rozumienie schematów i analiza błędów.
  • Zastosowanie: Ewaluacja analityków danych AI.
  • GitHub: https://github.com/AgenticDataBench/AgenticDataBench
  1. WorldDirector (2607.02517)
  • Problem: Generowanie wideo brakuje długoterminowej spójności.
  • Pomysł: Oddzielenie planowania ruchu od renderowania wizualnego.
  • Nowe podejście: Wykorzystanie LLM do zarządzania ścieżkami obiektów 3D i ruchem kamery.
  • Zastosowanie: Filmy AI i treści do gier.
  1. VLA-Corrector (2607.01804)
  • Problem: Roboty podejmujące szybkie decyzje mogą zbaczać z kursu.
  • Pomysł: Dodanie monitora wizyjnego do wykrywania błędów w czasie rzeczywistym.
  • Nowe podejście: Uruchamianie ponownego planowania tylko w przypadku wystąpienia odchylenia.
  • Zastosowanie: Złożone zadania robotyczne typu pick-and-place.
  • GitHub: https://github.com/ZJU-OmniAI/vla-corrector
  1. MRPO (2606.31825)
  • Problem: W medycznym AI jeden mały błąd niszczy cały łańcuch rozumowania.
  • Pomysł: Nagradzanie modelu za każdy poprawny krok, a nie tylko za końcową odpowiedź.
  • Nowe podejście: Wykorzystanie nagród procesowych krok po kroku (step-wise process rewards) w rozumowaniu medycznym.
  • Zastosowanie: Kliniczne VQA i wsparcie obrazowania medycznego.
  • GitHub: https://github.com/dmis-lab/MRPO

Podsumowanie trendów:

  • Lepsi agenci: Kierunek ku ustrukturyzowanej pamięci i samodoskonaleniu.
  • Większa wydajność: Redukcja kosztów dzięki hybrydowej uwadze i przepływom wielorozdzielczym.
  • Większa niezawodność: Dostosowanie treningu do wnioskowania i nagradzanie poprawnych kroków logicznych.

Źródło: https://dev.to/y_hnhnhan_2f26de65ffcc4/top-ai-papers-on-hugging-face-2026-07-06-225o

Opcjonalna społeczność edukacyjna: https://t.me/GyaanSetuAi