Các mô hình ngôn ngữ-thị giác (VLMs) vẫn chưa đạt được kết quả như mong đợi trong các tác vụ thị giác cơ bản. Một đánh giá mới từ PerceptionBench cho thấy không có hệ thống hàng đầu nào trong số mười sáu hệ thống vượt quá 60% độ chính xác tổng thể, và ngay cả hệ thống mạnh nhất cũng vẫn dưới mức 80% ở bất kỳ kỹ năng riêng lẻ nào. Kết quả này cảnh báo các nhà phát triển rằng điểm số cao trong các bài kiểm tra mô tả hình ảnh (captioning) hoặc suy luận phổ biến không đảm bảo khả năng quan sát đáng tin cậy.

Tại sao các bài kiểm tra hiện tại lại che giấu vấn đề

Hầu hết các bộ tiêu chuẩn (benchmarks) công khai đều trộn lẫn giữa mô tả hình ảnh, trả lời câu hỏi và suy luận thông thường. Khi một mô hình đưa ra một mô tả sai, lỗi đó có thể là do sơ suất về ngôn ngữ, lỗi suy luận, hoặc đơn giản là không nhận diện được đối tượng. Vì ba thành phần này bị lẫn lộn, một điểm số thấp không cho biết rõ khiếm khuyết nằm ở khả năng thị giác. Do đó, các đội ngũ xây dựng ứng dụng thường có sự tự tin thái quá dựa trên các con số nổi bật, và giả định rằng mô hình đang "nhìn" một cách chính xác.

Sự khác biệt của PerceptionBench

PerceptionBench tách biệt mười khả năng thị giác và đánh giá từng mô hình dựa trên một tập hợp các tác vụ thị giác thuần túy. Bằng cách loại bỏ yếu tố ngôn ngữ và suy luận, bộ tiêu chuẩn này cho thấy khả năng hoạt động độc lập của phần đầu vào thị giác. Nhìn chung, cả mười sáu VLM hàng đầu đều không đạt ngưỡng độ chính xác 60%, và hệ thống hoạt động tốt nhất cũng không bao giờ đạt tới 80% ở bất kỳ kỹ năng đơn lẻ nào. Ảo giác (hallucination) — việc tạo ra các chi tiết không có trong hình ảnh — là lỗi phổ biến nhất, trong khi mô hình điểm mạnh và điểm yếu lại khác nhau đáng kể giữa các mô hình.

Ai là người chịu thiệt

Các nhà phát triển không nên thay thế các bộ phân loại thị giác chuyên dụng bằng các mô hình AI tổng quát.

Điểm yếu của lập luận

Dữ liệu từ PerceptionBench cho thấy hiệu suất giảm dần: ngay cả những mô hình lớn nhất vẫn vấp ngã trước các tác vụ nhận thức cơ bản.

Các bước thực tế cho nhà phát triển

  • Duy trì các bộ phân loại thị giác chuyên dụng cho các tác vụ đòi hỏi sự chính xác; hãy coi VLM là thành phần bổ trợ thay vì là sự thay thế.
  • Thêm một lớp xác minh để kiểm tra chéo kết quả đầu ra của mô hình với một bộ phát hiện đáng tin cậy trước khi chúng đến tay người dùng.
  • Triển khai một bộ lọc thị giác nhẹ để phát hiện sớm các lỗi ảo giác hoặc phân loại sai rõ rệt trong quy trình.

Việc kết hợp một VLM đa năng với một thành phần thị giác được xây dựng chuyên biệt cho phép các đội ngũ tận dụng khả năng suy luận của VLM trong khi vẫn phòng tránh được các điểm mù về thị giác của nó.

Nguồn: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1