Bảng xếp hạng các bài báo nghiên cứu trên Hugging Face tháng này cho thấy một lĩnh vực đang dần trưởng thành. Những công trình nổi bật không còn tập trung vào việc mở rộng số lượng tham số thô mà hướng tới việc giúp các mô hình có khả năng nhìn, ghi nhớ và hoàn thành những gì chúng đã bắt đầu. Mười bài báo dưới đây đề cập đến video thời gian thực, nhận thức của robot, đánh giá chuẩn trung thực và cuộc cách mạng thầm lặng trong việc coi các mô hình tạo (generators) như những người thầy.
Video thời gian thực mà bạn thực sự có thể sử dụng
Hầu hết các mô hình video vẫn hoạt động giống như những thí nghiệm phòng thí nghiệm đắt đỏ. Chúng mất nhiều phút xử lý trên các phần cứng mạnh mẽ và tạo ra các đoạn clip mà bạn không thể điều khiển giữa chừng. Vidu S1 đã thay đổi phương trình này. Nó hướng tới sự tương tác thời gian thực, cho phép người dùng điều khiển các nhân vật kỹ thuật số bằng lệnh thoại trong khi mô hình chạy trên các GPU tiêu dùng tiêu chuẩn thông qua một kỹ thuật gọi là TurboDiffusion.
Sự chuyển dịch về phần cứng đó rất quan trọng. Khi một mô hình không còn đòi hỏi cả một dàn máy tăng tốc hàng đầu, nó không còn là một bản demo mà trở thành cơ sở hạ tầng. Hãy tưởng tượng các avatar livestream phản ứng với khung chat trong thời gian thực, hoặc các nhân vật chăm sóc khách hàng có thể giao tiếp bằng mắt và thay đổi tông giọng theo yêu cầu. Vidu S1 hướng tới một loại AI video được tung ra như một sản phẩm thực thụ, chứ không chỉ là một bản thảo nghiên cứu khác.
Robot hiểu được các chỉ dẫn
Điều hướng vẫn là rào cản cơ bản đối với AI vật lý. ABot-N1 giải quyết vấn đề này bằng cách đề xuất một mô hình nền tảng cho việc điều hướng robot dựa trên các chỉ dẫn ngôn ngữ thông thường. Thay vì các lộ trình được lập bản đồ trước một cách cứng nhắc, hệ thống học cách di chuyển qua các môi trường đa dạng bằng cách nhận diện các quy luật từ những gì nó thấy và nghe.
Lợi ích tức thì nằm ở lĩnh vực logistics. Một robot giao hàng nhận được chỉ dẫn bằng lời nói như “để gói hàng ở lối vào bên cạnh giá để xe đạp” có thể phân tích chỉ dẫn đó và thích nghi khi giá để xe di chuyển. Các trợ lý tại gia cũng có được sự linh hoạt tương tự, có thể di chuyển quanh căn hộ mà không cần tải lên sơ đồ mặt bằng chính xác từ trước.
Robot có khả năng ghi nhớ chuyện ngày hôm qua
ABot-AgentOS kết hợp với công trình điều hướng đó bằng cách giải quyết một vấn đề khác: robot thường bị thiết lập lại sau mỗi câu lệnh. Hệ thống này coi máy móc như một tác nhân bền bỉ với bộ nhớ dài hạn về người dùng, vật thể và các thói quen hàng ngày.
Sự khác biệt giữa một bộ xử lý nhất thời và một tác nhân liên tục chính là sự khác biệt giữa một công cụ và một người đồng nghiệp. Trong tự động hóa kho bãi, một robot có trí nhớ sẽ nhận thấy các lô hàng vào thứ Ba luôn bao gồm các mặt hàng dễ vỡ và điều chỉnh lực cầm nắm. Đối với việc chăm sóc tại gia, nó nhớ rằng một cư dân cụ thể thích rèm cửa mở một nửa vào lúc 3 giờ chiều. Sự liên tục đó giúp việc cá nhân hóa có thể thực hiện được ở quy mô lớn.
Vạch trần sự thật về các bộ benchmark video
Video-Oasis đưa ra một chẩn đoán đáng lo ngại: nhiều bộ benchmark hiểu video phổ biến hiện nay đang gặp lỗi. Các mô hình thường trả lời câu hỏi chỉ bằng kiến thức văn bản mà không thèm xem xét các khung hình thực tế. Bài báo chứng minh rằng một nửa số câu hỏi trong các bộ benchmark hiện tại có thể được giải quyết mà không cần bất kỳ đầu vào hình ảnh nào.
Điều đó có nghĩa là các nhà nghiên cứu đang khen thưởng cho việc đoán mò thông minh chứ không phải khả năng nhận thức thực sự. Cộng đồng cần các giao thức đánh giá buộc các mô hình phải căn cứ mọi câu trả lời vào các bằng chứng ở cấp độ pixel. Nếu không, chúng ta có nguy cơ tung ra các hệ thống sẽ ảo giác một cách đầy tự tin khi điều kiện ánh sáng thay đổi.
Các tác nhân lập trình có thể hoàn thành các công việc dài hơi
Các trợ lý lập trình viết các đoạn mã ngắn rất tốt, nhưng các quy trình làm việc DevOps gồm hàng trăm bước vẫn là một "nghĩa địa". Long-Horizon-Terminal-Bench kiểm tra cách các tác nhân đối phó với các nhiệm vụ kéo dài, phục hồi sau các lỗi giữa chừng và lập kế hoạch lại mà không cần sự trợ giúp của con người.
Điều này quan trọng đối với bất kỳ ai đang mơ về việc quản trị hệ thống tự động. Một tác nhân có thể vá lỗi máy chủ, chạy chẩn đoán trên các thành phần phụ thuộc và hoàn tác nếu một bước thất bại sẽ có giá trị hơn nhiều so với một tác nhân viết Python hoàn hảo nhưng lại "đứng hình" ngay khi thiếu khóa API đầu tiên. Bộ benchmark này cung cấp cho các nhà nghiên cứu một bảng điểm để đo lường loại sức bền đó.
Học tăng cường rẻ hơn
Direct OPD giải quyết vấn đề chi phí trong học tăng cường. RL cho các mô hình lớn tiêu tốn rất nhiều tiền bạc và giờ chạy GPU. Lối tắt được đề xuất rất đơn giản: trước tiên hãy huấn luyện một mô hình nhỏ bằng RL, sau đó chuyển đổi chính sách đã học được đó sang một mô hình lớn.
Những "nhà thám hiểm" nhỏ mắc lỗi với chi phí thấp. Một khi chiến lược đã được xác nhận, mô hình lớn sẽ thừa hưởng các bài học mà không phải trả toàn bộ "học phí". Đối với các đội ngũ tinh gọn đang cố gắng căn chỉnh các mô hình ngôn ngữ lớn hoặc tinh chỉnh các tác nhân,
