Những năm gần đây bị thống trị bởi các hệ thống AI tạo hình ảnh. Ít hào nhoáng hơn, nhưng có thể nói là khó hơn, chính là thách thức trong việc dạy máy móc thực sự hiểu được những gì chúng đang nhìn thấy. Việc tạo ra một bức chân dung chân thực là rất ấn tượng, nhưng yêu cầu một AI đọc nhãn cảnh báo trong bức chân dung đó, cho biết vật thể nằm ở đâu so với nền, và sau đó trả lời một câu hỏi logic về khung cảnh vẫn là một bài toán kỹ thuật thực sự khó khăn. Qwen-Image, một mô hình ngôn ngữ-thị giác mới được trình bày chi tiết trong một báo cáo kỹ thuật gần đây, gia nhập lĩnh vực này với một mục tiêu cụ thể: vượt qua việc mô tả ở mức độ bề mặt và xử lý thông tin hình ảnh và văn bản như một luồng thống nhất duy nhất.
Sự khác biệt của Qwen-Image
Hầu hết các hệ thống thị giác trước đây tiếp cận một hình ảnh theo cách một người quan sát tình cờ lướt qua một tấm áp phích. Chúng xác định chủ thể chính, gắn một chú thích chung chung và chuyển sang việc khác. Một bức ảnh về góc phố đông đúc chỉ đơn giản trở thành "xe cộ và người đi bộ trên đường". Mức độ đầu ra đó hữu ích cho việc phân loại album ảnh, nhưng sẽ nhanh chóng bế tắc khi bạn cần sự chính xác.
Qwen-Image được xây dựng để tiến xa hơn. Thay vì coi nhận diện hình ảnh và hiểu ngôn ngữ là các nhiệm vụ riêng biệt được khâu lại với nhau, nó xử lý dữ liệu hình ảnh và văn bản cùng nhau ngay từ đầu. Việc xử lý thống nhất này rất quan trọng vì nó cho phép mô hình gắn kết ngôn ngữ vào những gì nó thực sự nhìn thấy, thay vì đoán dựa trên một bản phác thảo sơ sài về khung cảnh. Khi mô hình chú thích một hình ảnh, trả lời một câu hỏi hoặc đọc văn bản được nhúng trong một bức ảnh, nó đang dựa trên cùng một biểu diễn chung của đầu vào thị giác.
Bốn khả năng đáng chú ý
Báo cáo kỹ thuật nhấn mạnh bốn thế mạnh cụ thể giúp phân biệt Qwen-Image với các mô hình chỉ đơn thuần dán nhãn các vật thể.
Chú thích hình ảnh với độ chính xác cao. Một chú thích hữu ích không chỉ là một danh sách các vật thể. Nó nắm bắt được ngữ cảnh, hành động và các mối quan hệ. Trong thực tế, điều này có nghĩa là phân biệt giữa một bức ảnh về một đầu bếp đang thái rau củ và một cảnh tĩnh về các nguyên liệu trên quầy. Đối với các nhà phát triển đang xây dựng các công cụ kiểm duyệt nội dung, công cụ hỗ trợ tiếp cận hoặc trình tạo siêu dữ liệu tự động, lớp độ chính xác mô tả bổ sung đó giúp cắt giảm thời gian xem xét thủ công và giảm thiểu sai sót.
Khả năng nhận dạng văn bản mạnh mẽ bên trong hình ảnh. Nhiều tác vụ thị giác trong thế giới thực đòi hỏi việc đọc các từ xuất hiện tự nhiên trong ảnh. Hãy nghĩ đến biển hiệu cửa hàng được chụp ở các góc độ lạ, ảnh chụp màn hình thông báo lỗi, ghi chú viết tay hoặc tài liệu in được chụp bằng camera điện thoại. Một mô hình có thể trích xuất và hiểu văn bản này một cách đáng tin cậy mà không cần một quy trình OCR riêng biệt sẽ giúp đơn giản hóa kiến trúc ứng dụng đáng kể. Các nhà phát triển không còn cần phải gắn thêm một trình đọc bên ngoài và hy vọng hai hệ thống thống nhất về những gì hình ảnh chứa đựng.
Khả năng suy luận cải tiến cho các câu hỏi thị giác. Trả lời một câu hỏi về hình ảnh là dễ dàng khi câu trả lời hiển hiện rõ ràng, chẳng hạn như "Quả bóng màu gì?". Những câu hỏi khó hơn đòi hỏi tính logic: so sánh số lượng, theo dõi các thay đổi qua một chuỗi, hoặc suy luận chức năng từ ngoại hình. Một kỹ thuật viên bảo trì có thể hỏi liệu một tụ điện cụ thể có vẻ được lắp đúng vị trí hay không, hoặc một người mua hàng có thể hỏi sản phẩm nào trong hai sản phẩm có hạn sử dụng tốt hơn dựa trên một bức ảnh. Qwen-Image xử lý các tác vụ thị giác phức tạp này với độ chính xác cao hơn so với các mô hình chỉ đơn thuần khớp các từ khóa với các vùng hình ảnh.
Nắm bắt tốt hơn các mối quan hệ không gian. Thị giác con người mang tính không gian sâu sắc. Chúng ta hiểu ngay lập tức rằng chiếc cốc cà phê nằm sau nắp máy tính xách tay, hoặc chiếc xe đạp nằm giữa hàng rào và lề đường. Máy móc thường gặp khó khăn với các khái niệm như "bên trái", "bên dưới" hoặc "bị che khuất một phần", đặc biệt là khi khung cảnh lộn xộn. Khả năng suy luận không gian mạnh mẽ hơn giúp mô hình thị giác trở nên hữu ích hơn nhiều cho điều hướng robot, hệ thống kiểm kê kho hàng, lớp phủ thực tế tăng cường và bất kỳ ứng dụng nào mà sự sắp xếp vật lý của các vật thể mang ý nghĩa quan trọng.
Thu hẹp khoảng cách giữa Nhìn và Hiểu
Có một khoảng cách lớn giữa việc nhận diện điểm ảnh thô và sự hiểu biết thực sự. Một camera an ninh có thể "nhìn" thấy sàn kho theo nghĩa là nó ghi lại các photon, nhưng để hiểu rằng một pallet đã bị di chuyển, một biển cảnh báo hiện đang bị che khuất, và câu hỏi của một công nhân về chiều cao thông thoáng có thể được trả lời bằng cách đọc nhãn trên giá đỡ gần nhất thì đòi hỏi một thứ gì đó tinh vi hơn.
Các nhà nghiên cứu đứng sau Qwen-Image đã thiết kế nó đặc biệt để lấp đầy khoảng cách đó. Bằng cách thống nhất việc xử lý thị giác và ngôn ngữ, mô hình hướng tới việc mang lại khả năng hiểu dựa trên thực tế (grounded understanding) giúp thị giác máy tính trở nên thực tế cho các quy trình làm việc phức tạp, thay vì chỉ giới hạn ở các bản demo mang tính thử nghiệm.
Tại sao các điểm chuẩn (Benchmarks) lại quan trọng đối với các nhà phát triển
Việc demo một mô hình trên các ví dụ được chọn lọc kỹ lưỡng là một chuyện. Việc triển khai nó vào thực tế sản xuất, nơi người dùng tải lên các hình ảnh mờ, thiếu sáng và có bố cục kỳ lạ, lại là một chuyện khác. Báo cáo lưu ý rằng Qwen-Image hoạt động tốt trên các điểm chuẩn tiêu chuẩn. Những điểm chuẩn này quan trọng vì chúng giúp mô hình tiếp cận với nhiều loại hình ảnh đa dạng, các ví dụ đối kháng (adversarial examples) và các định dạng câu hỏi khác nhau trong các điều kiện được kiểm soát.
Đối với các nhà phát triển, hiệu suất benchmark ổn định đồng nghĩa với khả năng dự đoán được. Điều đó có nghĩa là sẽ ít xảy ra các lỗi bất ngờ khi ánh sáng thay đổi, khi văn bản xuất hiện với phông chữ không mong đợi, hoặc khi người dùng đặt một câu hỏi đòi hỏi phải kết nối nhiều dữ kiện thị giác lại với nhau. Khi bạn đang lựa chọn một mô hình nền tảng (foundation model) cho một ứng dụng thị giác máy tính, sự tin cậy đó thường quan trọng hơn các tính năng hào nhoáng.
Điểm mấu chốt thực sự
Không thiếu những mô hình có thể nhìn vào một bức ảnh và nói điều gì đó về nó. Những mô hình hữu ích là những mô hình có thể đọc văn bản trong khung hình, suy luận qua các câu hỏi phức tạp, mô tả chính xác bố cục không gian và tạo ra các chú thích phản ánh đúng những gì đang diễn ra. Qwen-Image dường như được xây dựng cho nhóm công việc thứ hai này.
Nếu bạn đang đánh giá các mô hình thị giác-ngôn ngữ cho một dự án thực tế, báo cáo kỹ thuật đầy đủ sẽ chứa phương pháp luận, chi tiết tập dữ liệu và kết quả thử nghiệm mà bạn sẽ cần để đưa ra so sánh có cơ sở. Bạn có thể đọc báo cáo đầy đủ tại đây. Nếu bạn muốn thảo luận về những phát triển này với các nhà xây dựng và nghiên cứu khác, cộng đồng học tập GyaanSetu luôn rộng mở.
