Meta ra mắt Muse Image: Agentic AI đưa người dùng thực lên Instagram

Meta đã chính thức ra mắt mô hình tạo hình ảnh bằng AI đầu tiên được phát triển bởi bộ phận Superintelligence Labs mới, đánh dấu một bước chuyển mình quan trọng trong cách người dùng mạng xã hội tương tác với nội dung do AI tạo ra. Mô hình Muse Image dự kiến sẽ được tích hợp liền mạch trên Instagram, WhatsApp và ứng dụng Meta AI, trong khi sự hỗ trợ cho Facebook và Messenger sẽ sớm ra mắt.

Sự trỗi dậy của Agentic AI: Muse Image và Spark LLM

Khác với các mô hình khuếch tán (diffusion models) truyền thống vốn chỉ phản hồi lại văn bản, Muse Image của Meta được Alexandr Wang, người đứng đầu Superintelligence Labs, mô tả là "agentic" (có tính tác nhân). Điều này có nghĩa là mô hình không hoạt động một cách tách biệt; thay vào đó, nó hoạt động song song với mô hình ngôn ngữ lớn Muse Spark để suy luận qua các câu lệnh (prompt) phức tạp.

Bằng cách tận dụng khả năng suy luận của Spark LLM, Muse Image có thể tìm kiếm trên web và thực hiện giai đoạn lập kế hoạch trước khi tạo ra bất kỳ điểm ảnh nào. Điều này đảm bảo mức độ tuân thủ câu lệnh và tính nhất quán về logic cao hơn nhiều. Meta cũng đang hé lộ về mô hình Muse Video sắp tới, nhằm cạnh tranh với các đối thủ dẫn đầu ngành bằng cách tập trung vào độ trung thực về hình ảnh và tính nhất quán về thời gian (temporal consistency) — khả năng duy trì sự ổn định về hình ảnh qua các khung hình chuyển động.

Tích hợp mạng xã hội: @Mentions và việc đưa diện mạo vào hình ảnh

Có lẽ tính năng mang tính đột phá nhất của Muse Image là sự tích hợp sâu rộng với đồ thị xã hội (social graph) của Meta. Lần đầu tiên, người dùng có thể @mention các tài khoản Instagram khác trực tiếp trong một câu lệnh AI. Điều này cho phép mô hình truy cập vào các ảnh công khai của người dùng được gắn thẻ để đưa diện mạo của họ vào các hình ảnh do AI tạo ra.

Mặc dù điều này mở ra một biên giới mới rộng lớn cho sự sáng tạo và kể chuyện kỹ thuật số, nó cũng đặt ra những câu hỏi quan trọng về danh tính kỹ thuật số. Meta đã giải quyết những lo ngại này bằng cách tuyên bố rằng người dùng vẫn giữ quyền kiểm soát đối với cách nội dung của họ được tái sử dụng để huấn luyện và tạo AI, mặc dù khả năng "đưa" người thật vào các môi trường tổng hợp đại diện cho một bước tiến lớn trong tương tác mạng xã hội.

Vượt xa việc tạo ảnh: Tái thiết kế thực tại và chỉnh sửa tương tác

Muse Image đang được định vị là một công cụ sáng tạo đa năng thay vì chỉ là một trình tạo văn bản thành hình ảnh đơn thuần. Mô hình này giới thiệu một số tính năng hướng tới tiện ích:

  • Visual Redesign (Tái thiết kế hình ảnh): Người dùng có thể lấy hình ảnh từ Facebook Marketplace hoặc web để thiết kế lại toàn bộ căn phòng, cho phép trực quan hóa không gian tức thì.
  • Direct Manipulation (Thao tác trực tiếp): Công cụ này cho phép khả năng "in-painting" (vẽ đè lên vùng chọn), nơi người dùng có thể vẽ trực tiếp lên các bức ảnh có sẵn để hướng dẫn AI thực hiện các sửa đổi cụ thể.
  • Graphic Design Utility (Tiện ích thiết kế đồ họa): Mô hình có thể tạo ra các thiết kế có cấu trúc cho các mục đích thực tế, chẳng hạn như thiệp mời, bưu thiếp và các tài nguyên mạng xã hội.

Bằng cách vượt ra ngoài việc chỉ tạo ra nội dung và tiến vào lĩnh vực suy luận, lập kế hoạch và tích hợp xã hội, Meta đang cố gắng biến AI tạo sinh thành một lớp tiện ích nền tảng cho toàn bộ hệ sinh thái Meta.

Những điểm chính cần lưu ý

  • Agentic Workflow (Quy trình làm việc dạng tác nhân): Muse Image sử dụng Muse Spark LLM để suy luận, lập kế hoạch và tìm kiếm web, vượt xa việc khớp mẫu đơn thuần để thực hiện các câu lệnh phức tạp.
  • Social Graph Integration (Tích hợp đồ thị xã hội): Khả năng @mention người dùng Instagram cho phép AI đưa diện mạo thực tế từ các hồ sơ công khai vào nội dung được tạo ra.
  • Ecosystem Expansion (Mở rộng hệ sinh thái): Mô hình biến các ứng dụng mạng xã hội thành các studio sáng tạo có khả năng thiết kế lại phòng, thao tác ảnh trực tiếp và thiết kế đồ họa.