Cuộc đua đã tiến đến thời điểm này như thế nào

AI tạo hình ảnh đã là một cuộc kéo co giữa một vài phòng thí nghiệm được đầu tư mạnh mẽ. OpenAI đã thiết lập tiêu chuẩn ban đầu với dòng GPT-Image; Meta theo đuổi nghệ thuật cách điệu với Muse-Image, Google xây dựng Gemini cho các câu lệnh đa ngôn ngữ, và Alibaba tung ra Qwen-Image-3.0-Pro cho hình ảnh thương mại điện tử. xAI gia nhập vào năm ngoái với một biến thể “Quality” tạo ra những bức ảnh khá tốt nhưng còn tụt hậu về khả năng tuân thủ hướng dẫn và kiểm soát bố cục.

Imagine Image 2.0 đánh dấu bước nâng cấp thế hệ lớn đầu tiên. Được tích hợp vào nền tảng Grok, mô hình này tập trung vào hai mặt: chất lượng tạo hình thô và các công cụ chỉnh sửa thực tế phù hợp với quy trình làm việc chuyên nghiệp. Việc ra mắt diễn ra cùng lúc với xu hướng thúc đẩy sáng tạo nội dung có sự hỗ trợ của AI trong ngành, nơi tốc độ và độ chính xác cũng quan trọng như độ trung thực về mặt hình ảnh.

Những con số quan trọng

Arena, một hệ thống đánh giá độc lập cho các mô hình đối đầu trực tiếp với nhau, đã công bố điểm số mới nhất vào ngày 7 tháng 8 năm 2026. Biến thể “low” của Imagine Image 2.0 đạt mức xếp hạng Elo là 1.439 trong đấu trường Image Edit, so với 1.463 của GPT-Image-2. Trong đấu trường Text-to-Image, mô hình này đạt 1.320 điểm, so với 1.380 của OpenAI. Imagine Image 2.0 xếp thứ hai toàn cầu trong các bảng xếp hạng Arena, bám sát GPT-Image-2 của OpenAI.

Ngoài hai vị trí dẫn đầu, Imagine Image 2.0 đã vượt qua Muse-Image của Meta, Qwen-Image-3.0-Pro của Alibaba, Gemini của Google và SeedDream của ByteDance. Những chiến thắng này cho thấy mô hình đã chuyển từ vị trí ngoại vi lên nhóm hàng đầu về hiệu suất được đo lường công khai.

Các công cụ chỉnh sửa hướng tới công việc thực tế

Việc tạo hình thô chỉ là một nửa câu chuyện đối với các nhà thiết kế, nhà tiếp thị và nhà phát triển trò chơi. Imagine Image 2.0 tích hợp một bộ các tính năng chỉnh sửa giúp đưa nó tiến gần hơn tới một trình chỉnh sửa đồ họa đầy đủ tính năng:

  • Magic Wand – một loại cọ cục bộ giúp cô lập một khu vực cụ thể để thực hiện các thay đổi có mục tiêu mà không ảnh hưởng đến phần còn lại của hình ảnh.
  • Segmentation – cho phép người dùng chọn các vùng chính xác, giống như một lớp mặt nạ (mask) trong các phần mềm chỉnh sửa ảnh truyền thống.
  • Background Removal – xuất các đối tượng trên một khung nền trong suốt, sẵn sàng để ghép ảnh.
  • Multi-Ref Editing – hợp nhất tối đa năm hình ảnh đầu vào thành một kết quả tạo duy nhất, cho phép tạo ra các khái niệm lai mà nếu không sẽ phải cắt dán thủ công.
  • Smart Resize – sử dụng tính năng inpainting tạo sinh để lấp đầy các pixel bị thiếu khi thay đổi tỷ lệ khung hình, giúp bảo toàn bố cục trong khi thích ứng với các định dạng mới.

Các mẫu được cấu hình sẵn cho chụp ảnh sản phẩm, tài nguyên tiếp thị, sprites game và emoji livestream giúp tối ưu hóa quy trình từ câu lệnh đến kết quả đầu ra. Người dùng bắt đầu với một bố cục đã đáp ứng các tiêu chuẩn ngành, sau đó tinh chỉnh các chi tiết bằng các công cụ mới.

Đặt nền móng cho video điều khiển bởi AI

Lộ trình của xAI gợi ý về một tầm nhìn dài hạn hơn: tạo video. Sự nhất quán giữa các khung hình—duy trì cùng một phong cách nhân vật, ánh sáng và môi trường—từ lâu đã là trở ngại đối với AI tạo sinh.

Kết luận

Imagine Image 2.0 mang đến cho xAI một thách thức đáng gờm đối với vị thế dẫn đầu lâu đời của OpenAI, nhờ vào điểm số benchmark ấn tượng và các công cụ giải quyết nhu cầu hàng ngày của những nhà sáng tạo chuyên nghiệp. Mô hình này vẫn còn tụt hậu về hiệu suất thô, và tác động của nó sẽ phụ thuộc vào việc người dùng tiếp nhận quy trình chỉnh sửa nhanh đến mức nào và liệu studio có thể biến sự nhất quán về hình ảnh thành các quy trình video khả thi hay không. Vài tháng tới sẽ cho thấy liệu vị trí thứ hai này chỉ là một sự bùng nổ nhất thời hay là sự khởi đầu của một sự chuyển dịch bền vững trong thị trường hình ảnh tạo sinh.