Các bài báo AI hàng đầu trên Hugging Face
AI đang tiến triển rất nhanh. Các xu hướng hiện tại tập trung vào các tác nhân (agents) dài hạn, học tăng cường (reinforcement learning) cho LLM và khả năng kiểm soát tốt hơn đối với các mô hình tạo sinh (generative models).
Dưới đây là 10 bài báo nổi bật từ Hugging Face:
- Program-as-Weights (2607.02512)
- Vấn đề: Việc lập trình cứng (hard-coding) các tác vụ rất khó khăn, nhưng chạy các mô hình khổng lồ lại rất tốn kém.
- Ý tưởng: Chuyển đổi các mô tả bằng ngôn ngữ tự nhiên thành các tạo tác thần kinh (neural artifacts) nhỏ gọn.
- Cách tiếp cận mới: Sử dụng một trình biên dịch 4B để tạo ra một gói trọng số (weight package) siêu nhỏ mà một mô hình 0.6B có thể chạy được.
- Trường hợp sử dụng: AI trên thiết bị và các công cụ cục bộ tốc độ cao.
- GitHub: https://github.com/programasweights/programasweights-python
- Training vs. Inference Policy (2606.29526)
- Vấn đề: Các mô hình thường hoạt động khác nhau giữa quá trình huấn luyện và khi sử dụng thực tế.
- Ý tưởng: Tập trung vào việc cải thiện chính sách (policy) được sử dụng trong quá trình suy luận (inference) thực tế.
- Cách tiếp cận mới: Đồng nhất các mục tiêu huấn luyện với việc ra quyết định trong thế giới thực.
- Trường hợp sử dụng: Suy luận LLM ổn định và các quy trình RLHF.
- Dự án: https://anitaleungxx.github.io/MIPU/
- AgenticSTS (2607.02255)
- Vấn đề: Các tác nhân dài hạn thất bại vì bộ nhớ của chúng bị lộn xộn.
- Ý tưởng: Sử dụng truy xuất có kiểu (typed retrieval) để tổ chức các mảnh bộ nhớ thay vì lấp đầy cửa sổ ngữ cảnh (context window).
- Cách tiếp cận mới: Tạo ra các lớp bộ nhớ có kiểm soát cho thông tin ngắn hạn và thông tin chiến lược.
- Trường hợp sử dụng: Trợ lý AI dài hạn và các quy trình làm việc doanh nghiệp phức tạp.
- GitHub: https://github.com/AlayaLab/AgenticSTS
- EvoPolicyGym (2607.02440)
- Vấn đề: Chúng ta thiếu các phương pháp để đo lường liệu một tác nhân có thể tự cải thiện các quy tắc của chính nó hay không.
- Ý tưởng: Một môi trường nơi các tác nhân phải tự chỉnh sửa các chính sách của mình.
- Cách tiếp cận mới: Đánh giá quá trình tự cải thiện, chứ không chỉ đánh giá kết quả cuối cùng.
- Trường hợp sử dụng: Các tác nhân tự động (auto-agents) và robot học.
- FlashMorph (2606.30562)
- Vấn đề: Cơ chế chú ý đầy đủ (full attention) trong Transformers quá tốn kém đối với văn bản dài.
- Ý tưởng: Kết hợp chú ý đầy đủ với chú ý tuyến tính (linear attention) rẻ hơn.
- Cách tiếp cận mới: Sử dụng một cổng dựa trên lớp (layer-based gate) để tìm ra thiết lập lai (hybrid) tốt nhất.
- Trường hợp sử dụng: Xử lý tài liệu dài và các hệ thống RAG.
- GitHub: https://github.com/LanDisen/FlashMorph
- MrFlow (2607.01642)
- Vấn đề: Các mô hình khuếch tán (diffusion models) hoạt động chậm ở độ phân giải cao.
- Ý tưởng: Tăng tốc độ tạo mà không cần huấn luyện thêm.
- Cách tiếp cận mới: Tạo ở độ phân giải thấp trước, sau đó sử dụng siêu phân giải (super-resolution).
- Trường hợp sử dụng: Các công cụ chuyển văn bản thành hình ảnh tốc độ cao.
- GitHub: https://github.com/Xingyu-Zheng/MrFlow
- AgenticDataBench (2607.01647)
- Vấn đề: Các bộ tiêu chuẩn (benchmarks) hiện tại không phản ánh đúng công việc khoa học dữ liệu thực tế.
- Ý tưởng: Một bài kiểm tra toàn diện cho các tác nhân dữ liệu trên nhiều lĩnh vực.
- Cách tiếp cận mới: Đo lường các kỹ năng cụ thể như hiểu lược đồ (schema) và phân tích lỗi.
- Trường hợp sử dụng: Đánh giá các chuyên gia phân tích dữ liệu AI.
- GitHub: https://github.com/AgenticDataBench/AgenticDataBench
- WorldDirector (2607.02517)
- Vấn đề: Việc tạo video thiếu tính nhất quán dài hạn.
- Ý tưởng: Tách biệt việc lập kế hoạch chuyển động khỏi việc kết xuất hình ảnh (visual rendering).
- Cách tiếp cận mới: Sử dụng một LLM để quản lý đường đi của các vật thể 3D và chuyển động của camera.
- Trường hợp sử dụng: Phim AI và nội dung trò chơi.
- VLA-Corrector (2607.01804)
- Vấn đề: Robot khi đưa ra các quyết định nhanh có thể bị chệch hướng.
- Ý tưởng: Thêm một bộ giám sát thị giác để phát hiện lỗi trong thời gian thực.
- Cách tiếp cận mới: Chỉ kích hoạt lập kế hoạch lại khi có sự sai lệch xảy ra.
- Trường hợp sử dụng: Các tác vụ gắp-đặt (pick-and-place) phức tạp của robot.
- GitHub: https://github.com/ZJU-OmniAI/vla-corrector
- MRPO (2606.31825)
- Vấn đề: Trong AI y tế, một sai sót nhỏ cũng có thể làm hỏng toàn bộ chuỗi suy luận.
- Ý tưởng: Thưởng cho mô hình ở mỗi bước đúng, chứ không chỉ ở câu trả lời cuối cùng.
- Cách tiếp cận mới: Sử dụng phần thưởng theo từng bước (step-wise process rewards) cho suy luận y tế.
- Trường hợp sử dụng: VQA lâm sàng và hỗ trợ chẩn đoán hình ảnh y tế.
- GitHub: https://github.com/dmis-lab/MRPO
Tóm tắt các xu hướng:
- Tác nhân tốt hơn: Hướng tới bộ nhớ có cấu trúc và khả năng tự cải thiện.
- Hiệu quả tốt hơn: Giảm chi phí thông qua cơ chế chú ý lai và luồng đa độ phân giải.
- Độ tin cậy tốt hơn: Đồng nhất quá trình huấn luyện với suy luận và thưởng cho các bước logic chính xác.
Nguồn: https://dev.to/y_hnhnhan_2f26de65ffcc4/top-ai-papers-on-hugging-face-2026-07-06-225o
Cộng đồng học tập tùy chọn: https://t.me/GyaanSetuAi
