Grok Imagine 1.5: видео из текста и семь референсов (2026)
31 июля Grok Imagine научился делать видео без стартовой картинки и держать до семи зафиксированных элементов в кадре. Разбираем механику и показываем результат на своих генерациях.
Grok Imagine Video 1.5 обновился 31 июля 2026 года: появились генерация видео из текста без стартовой картинки, нативный 1080p, референс голоса и мультиреференс - до семи изображений на одну генерацию, где каждое фиксирует один элемент сцены. Главное здесь не разрешение, а именно якоря: они убирают эффект лотереи, из-за которого герой менялся в каждом новом ролике.
Ниже - разбор механики и проверка на четырёх генерациях в боте Cyber AI, где эта модель доступна на русском.
Что вошло в обновление
По анонсу xAI и релиз-нотам:
| Возможность | Что даёт |
|---|---|
| Текст в видео | Стартовая картинка больше не нужна, первый кадр модель рисует сама |
| Нативный 1080p | Для режимов текст в видео и фото в видео, раньше потолок был 720p |
| Референс голоса | Одно лицо и один голос во всех сценах генерации |
| Мультиреференс | До семи референсов, каждый фиксирует один элемент |
До обновления версия 1.5 умела только оживлять загруженный кадр. Раскатка началась в США на тарифах SuperGrok Heavy и Plus, дальше по остальным.
Как работают якоря
Формулировка простая: одно референсное изображение фиксирует одну вещь. Лицо. Товар. Комнату.
Дальше открываются три сценария:
- держим героя и меняем сцену;
- держим сцену и меняем героя;
- держим оба и меняем только действие.

Это переводит генерацию из режима «повезёт или нет» в режим конструктора. Вы указываете, что обязано остаться прежним, и меняете остальное осознанно.
Проверка на живых роликах
Мы сделали два референса в Banana 2 PRO: портрет мужчины на нейтральном фоне и пустую студию подкаста. Стартового кадра не давали вообще - только два якоря.
Первый ролик собрал их вместе: тот же человек за тем же столом, акустические панели и лампы совпали с референсом. Во втором мы заменили локацию на лофт с панорамным окном - лицо и рубашка остались прежними. В третьем поступили наоборот: оставили студию, а героя заменили на женский портрет, и комната совпала с первым роликом до деталей.


Четвёртый ролик проверял генерацию из текста: промпт взяли из примера в документации xAI, про тлеющие угли над полем боя и гребень шлема на ветру. Стартовой картинки не было.
Что показали сами файлы: все четыре ролика 1280 × 720, 24 кадра в секунду, длительность 6,04 секунды, звуковая дорожка живая. Детектор смены планов не нашёл ни одного монтажного стыка - шесть секунд идут непрерывным кадром. Каждая генерация заняла около полутора минут.

Что уже доступно в боте, а что нет
Настройки мини-приложения на 4 августа 2026:
| Из анонса | Статус в боте |
|---|---|
| Текст в видео | Есть, отдельный режим |
| До семи референсов | Есть, лимит ровно 7 |
| Редактирование и продление ролика | Есть у версии Grok Pro |
| Нативный 1080p | Нет, потолок 720p |
| Референс голоса | Нет |
Референсы подключаются в режиме «Изображение → Видео», причём стартовый кадр в нём необязателен. Базовая версия тянет ролики от 6 до 30 секунд, Grok Pro - от 1 до 15, зато умеет редактировать и продлевать готовое видео.
Порядок работы
- Открыть бот, выбрать «Создать видео» и модель Grok.
- Нажать «Задать параметры», режим - «Изображение → Видео».
- Загрузить якоря в блок «Reference изображения»: отдельно героя, отдельно локацию, отдельно предмет.
- В поле «Описание видео» написать только действие и движение камеры.
- Запустить генерацию.
Главная ошибка - заново описывать словами то, что уже задано референсом. Модель начинает рисовать нового человека поверх якоря. Описание отвечает на вопрос «что происходит», а не «кто и где».
Референсы удобно готовить тем же ботом: портрет и пустую локацию мы собрали в Banana 2 PRO на ровном свете, без теней и лишних деталей.
Кому это полезно
Мультиреференс нужен там, где важна серия, а не один кадр: реклама с одним товаром в разных обстановках, серия роликов с одним ведущим, обучающие форматы с одним спикером. Пока нет референса голоса, звук для говорящего героя придётся добирать отдельно.
Готовые промпты под видео можно посмотреть и скопировать в галерее Prompt Studio.
Частые вопросы
Что нового в Grok Imagine 1.5 после обновления 31 июля?
Четыре пункта: генерация видео прямо из текста без стартовой картинки, нативный 1080p, референс голоса для сохранения тембра между сценами и мультиреференс до семи изображений на одну генерацию.
Сколько референсов принимает Grok Imagine за раз?
До семи. Каждое референсное изображение фиксирует один элемент сцены: лицо, товар или локацию. Остальные элементы модель вольна менять от генерации к генерации.
Можно ли сделать видео в Grok без стартовой картинки?
Да, после обновления появился режим генерации из текста. Модель сама рисует первый кадр по описанию и анимирует его дальше.
Как удержать одного и того же героя в нескольких роликах?
Загрузить его портрет отдельным референсом и не описывать внешность заново в тексте промпта. В описании оставить только действие и движение камеры.
Понимает ли Grok Imagine русский промпт?
Да, описание сцены можно писать по-русски. Ограничение по длине описания в боте Cyber AI - 5000 символов.
Готовые промпты в галерее. Тысячи промптов для фото и видео — копируйте и пробуйте.
Открыть галерею