Prompt StudioPrompt Studio

Grok Imagine 1.5: видео из текста и семь референсов (2026)

31 июля Grok Imagine научился делать видео без стартовой картинки и держать до семи зафиксированных элементов в кадре. Разбираем механику и показываем результат на своих генерациях.

Prompt Studio·
Grok Imagine 1.5: один герой в разных сценах

Grok Imagine Video 1.5 обновился 31 июля 2026 года: появились генерация видео из текста без стартовой картинки, нативный 1080p, референс голоса и мультиреференс - до семи изображений на одну генерацию, где каждое фиксирует один элемент сцены. Главное здесь не разрешение, а именно якоря: они убирают эффект лотереи, из-за которого герой менялся в каждом новом ролике.

Ниже - разбор механики и проверка на четырёх генерациях в боте Cyber AI, где эта модель доступна на русском.

Что вошло в обновление

По анонсу xAI и релиз-нотам:

ВозможностьЧто даёт
Текст в видеоСтартовая картинка больше не нужна, первый кадр модель рисует сама
Нативный 1080pДля режимов текст в видео и фото в видео, раньше потолок был 720p
Референс голосаОдно лицо и один голос во всех сценах генерации
МультиреференсДо семи референсов, каждый фиксирует один элемент

До обновления версия 1.5 умела только оживлять загруженный кадр. Раскатка началась в США на тарифах SuperGrok Heavy и Plus, дальше по остальным.

Как работают якоря

Формулировка простая: одно референсное изображение фиксирует одну вещь. Лицо. Товар. Комнату.

Дальше открываются три сценария:

  • держим героя и меняем сцену;
  • держим сцену и меняем героя;
  • держим оба и меняем только действие.

Два референса и результат генерации в Grok Imagine 1.5

Это переводит генерацию из режима «повезёт или нет» в режим конструктора. Вы указываете, что обязано остаться прежним, и меняете остальное осознанно.

Проверка на живых роликах

Мы сделали два референса в Banana 2 PRO: портрет мужчины на нейтральном фоне и пустую студию подкаста. Стартового кадра не давали вообще - только два якоря.

Первый ролик собрал их вместе: тот же человек за тем же столом, акустические панели и лампы совпали с референсом. Во втором мы заменили локацию на лофт с панорамным окном - лицо и рубашка остались прежними. В третьем поступили наоборот: оставили студию, а героя заменили на женский портрет, и комната совпала с первым роликом до деталей.

Один герой в двух разных локациях

Одна студия с двумя разными героями

Четвёртый ролик проверял генерацию из текста: промпт взяли из примера в документации xAI, про тлеющие угли над полем боя и гребень шлема на ветру. Стартовой картинки не было.

Что показали сами файлы: все четыре ролика 1280 × 720, 24 кадра в секунду, длительность 6,04 секунды, звуковая дорожка живая. Детектор смены планов не нашёл ни одного монтажного стыка - шесть секунд идут непрерывным кадром. Каждая генерация заняла около полутора минут.

Кадр из генерации по тексту без стартовой картинки

Что уже доступно в боте, а что нет

Настройки мини-приложения на 4 августа 2026:

Из анонсаСтатус в боте
Текст в видеоЕсть, отдельный режим
До семи референсовЕсть, лимит ровно 7
Редактирование и продление роликаЕсть у версии Grok Pro
Нативный 1080pНет, потолок 720p
Референс голосаНет

Референсы подключаются в режиме «Изображение → Видео», причём стартовый кадр в нём необязателен. Базовая версия тянет ролики от 6 до 30 секунд, Grok Pro - от 1 до 15, зато умеет редактировать и продлевать готовое видео.

Порядок работы

  1. Открыть бот, выбрать «Создать видео» и модель Grok.
  2. Нажать «Задать параметры», режим - «Изображение → Видео».
  3. Загрузить якоря в блок «Reference изображения»: отдельно героя, отдельно локацию, отдельно предмет.
  4. В поле «Описание видео» написать только действие и движение камеры.
  5. Запустить генерацию.

Главная ошибка - заново описывать словами то, что уже задано референсом. Модель начинает рисовать нового человека поверх якоря. Описание отвечает на вопрос «что происходит», а не «кто и где».

Референсы удобно готовить тем же ботом: портрет и пустую локацию мы собрали в Banana 2 PRO на ровном свете, без теней и лишних деталей.

Кому это полезно

Мультиреференс нужен там, где важна серия, а не один кадр: реклама с одним товаром в разных обстановках, серия роликов с одним ведущим, обучающие форматы с одним спикером. Пока нет референса голоса, звук для говорящего героя придётся добирать отдельно.

Готовые промпты под видео можно посмотреть и скопировать в галерее Prompt Studio.

Попробовать Grok в боте Cyber AI: TG | MAX

Частые вопросы

Что нового в Grok Imagine 1.5 после обновления 31 июля?

Четыре пункта: генерация видео прямо из текста без стартовой картинки, нативный 1080p, референс голоса для сохранения тембра между сценами и мультиреференс до семи изображений на одну генерацию.

Сколько референсов принимает Grok Imagine за раз?

До семи. Каждое референсное изображение фиксирует один элемент сцены: лицо, товар или локацию. Остальные элементы модель вольна менять от генерации к генерации.

Можно ли сделать видео в Grok без стартовой картинки?

Да, после обновления появился режим генерации из текста. Модель сама рисует первый кадр по описанию и анимирует его дальше.

Как удержать одного и того же героя в нескольких роликах?

Загрузить его портрет отдельным референсом и не описывать внешность заново в тексте промпта. В описании оставить только действие и движение камеры.

Понимает ли Grok Imagine русский промпт?

Да, описание сцены можно писать по-русски. Ограничение по длине описания в боте Cyber AI - 5000 символов.

Готовые промпты в галерее. Тысячи промптов для фото и видео — копируйте и пробуйте.

Открыть галерею