Meta представляет Muse Image: агентный ИИ, вовлекающий реальных пользователей в Instagram

Meta официально запустила свою первую модель генерации изображений на базе ИИ, разработанную новым подразделением Superintelligence Labs, что знаменует собой значительный сдвиг в том, как пользователи социальных сетей взаимодействуют с генеративным контентом. Модель Muse Image будет бесшовно интегрирована в Instagram, WhatsApp и приложение Meta AI, а поддержка Facebook и Messenger появится в ближайшее время.

Расцвет агентного ИИ: Muse Image и Spark LLM

В отличие от традиционных диффузионных моделей, которые просто реагируют на текст, Muse Image от Meta описывается Александром Вангом, главой Superintelligence Labs, как «агентная» (agentic). Это означает, что модель не работает в вакууме; вместо этого она работает в тандеме с большой языковой моделью Muse Spark, чтобы рассуждать над сложными промптами.

Используя возможности рассуждения Spark LLM, Muse Image может искать информацию в интернете и проходить этап планирования перед генерацией первого пикселя. Это обеспечивает гораздо более точное следование промптам и логическую последовательность. Meta также анонсирует готовящуюся модель Muse Video, которая призвана конкурировать с лидерами отрасли, делая ставку на высокую визуальную точность и временную согласованность (temporal consistency) — способность сохранять визуальную стабильность в движущихся кадрах.

Социальная интеграция: @упоминания и использование внешности

Пожалуй, самой революционной функцией Muse Image является её глубокая интеграция с социальным графом Meta. Впервые пользователи могут @упоминать другие аккаунты Instagram прямо в промпте для ИИ. Это позволяет модели получать доступ к публичным фотографиям отмеченных пользователей, чтобы использовать их внешность в генерируемых изображениях.

Хотя это открывает огромные новые горизонты для творческого самовыражения и цифрового сторителлинга, это также поднимает важные вопросы, касающиеся цифровой идентичности. Meta отреагировала на эти опасения, заявив, что пользователи сохраняют контроль над тем, как их контент используется для обучения и генерации ИИ, хотя возможность «переносить» реальных людей в синтетические среды представляет собой серьезную эволюцию взаимодействия в социальных сетях.

Больше чем генерация: редизайн реальности и интерактивное редактирование

Muse Image позиционируется как многофункциональный творческий инструмент, а не просто генератор изображений по тексту. Модель представляет несколько полезных функций:

  • Визуальный редизайн: Пользователи могут брать изображения из Facebook Marketplace или из интернета, чтобы полностью перепроектировать комнаты, что позволяет мгновенно визуализировать пространство.
  • Прямое манипулирование: Инструмент поддерживает возможности «инпейнтинга» (in-painting), позволяя пользователям рисовать прямо на существующих фотографиях, давая ИИ инструкции по внесению конкретных изменений.
  • Инструмент графического дизайна: Модель может создавать структурированные макеты для практических целей, таких как приглашения, открытки и контент для социальных сетей.

Выходя за рамки простой генерации и переходя в область рассуждений, планирования и социальной интеграции, Meta пытается превратить генеративный ИИ в фундаментальный сервисный слой для всей экосистемы Meta.

Основные выводы

  • Агентный рабочий процесс: Muse Image использует Muse Spark LLM для рассуждений, планирования и поиска в интернете, переходя от простого сопоставления шаблонов к сложному выполнению промптов.
  • Интеграция с социальным графом: Возможность @упоминать пользователей Instagram позволяет ИИ включать черты реальных людей из публичных профилей в генерируемый контент.
  • Расширение экосистемы: Модель превращает социальные приложения в творческие студии, способные выполнять редизайн помещений, прямое манипулирование фотографиями и графический дизайн.