Meta офіційно запустила свою новітню модель генерації зображень Muse Image та вперше продемонструвала раннє прев'ю Muse Video. Обидва рішення розроблені підрозділом Meta Superintelligence Labs і знаменують собою серйозний прогрес у сфері ШІ-медіа.

Muse Image: агентний підхід і соціальний контекст

Muse Image вже доступна в застосунку Meta AI, на платформі meta.ai, а також в Instagram Stories для користувачів у США та в WhatsApp в обмеженій кількості країн. Meta називає її своєю найпросунутішою моделлю генерації зображень. Ключова відмінність — агентна архітектура: Muse Image використовує пошук в інтернеті, інструменти для написання та виконання коду і здатна доопрацьовувати зображення в процесі генерації. Модель точніше слідує промптам, вміє редагувати картинки та збирати сцену з кількох референсів, а також враховує соціальний контекст Instagram.

Інтеграція з Muse Spark і нові можливості

Muse Image інтегрована з Muse Spark. Зв'язка моделей використовує код і медіагенерацію для створення анімованих GIF, веб-сайтів із вбудованими зображеннями і навіть інтерактивних візуальних ігор. Це перетворює генеративний ШІ з простого інструменту для створення картинок на повноцінну платформу для мультимедійної творчості.

Muse Video: прев'ю та амбіції

Паралельно Meta показала раннє прев'ю Muse Video. За заявою компанії, модель побудована на тій самій базі попереднього навчання, що й Muse Image, забезпечує високу візуальну якість і нативно підтримує аудіо. Однак компанія визнає, що ще доопрацьовує синхронізацію аудіо та відео, а також фізично точну передачу швидкого руху. Це вказує на те, що повноцінний запуск відеогенерації може зайняти ще кілька місяців.

Безпека та метрики

Meta впровадила систему захисту авторських прав: усі зображення, створені за допомогою Muse Image в застосунку Meta AI, отримують невидимий водяний знак Content Seal. За твердженням компанії, він зберігається після кадрування, стиснення, зміни розміру або створення скріншоту. У майбутньому Meta планує поширити цю мітку і на відео.

Згідно з даними внутрішньої платформи Arena, Muse Image посідає друге місце в категоріях text-to-image, single-image editing та multi-image editing, поступаючись лише GPT Image 2 від OpenAI. Це підтверджує високий рівень конкурентоспроможності рішення.

Як аналітик, я зазначаю, що агентний підхід Muse Image — це еволюційний крок уперед. Здатність моделі самостійно використовувати зовнішні інструменти та контекст соціальної мережі робить її не просто генератором, а повноцінним асистентом для творчості. Однак питання синхронізації аудіо та відео в Muse Video залишається критичним — без нього відеогенерація виглядатиме сирою. Загалом, Meta впевнено зміцнює свої позиції в гонці генеративних ШІ, і я очікую, що в найближчі квартали ми побачимо ще глибшу інтеграцію цих моделей в екосистему компанії.