Последние недели у меня в рабочих чатах через слово мелькает фраза «а давай Гэндальф сварит зелье со Скуби‑Ду». Не потому что корпоратив затянулся. Просто мы в GPTunneL запустили штуку, которая заставляет весь офис вести себя как дети, которым выдали пульт от телевизора и сказали: «крути любой канал, какой захочешь — только этого канала ещё не существует, придумай сам».

Штука называется Grom TV — «Гром Телевизор». Это генеративный онлайн‑ТВ, куда заходит любой желающий, пишет промпт (буквально текстом, как в чат) и через 20–25 секунд видит на экране свой собственный видеоролик, сгенерированный нейросетью прямо по этому запросу.

Причём видит не один: на канале одновременно крутятся ролики других зрителей, а под телевизором — чат, куда можно отправлять промпты.

Попробовать можно прямо сейчас: gptunnel.ru/lab?section=tv. Регистрация простая, промпт пишется в поле справа от экрана — и дальше вы, по сути, режиссёр в прямом эфире. Собственно, вот как это выглядит вживую...

Как всем этим пользоваться

  1. Заходите на сайт;

  2. Регистрируетесь;

  3. Пишете промпт в чат от телека;

  4. Ждёте 20–25 секунд;

  5. Смотрите, как ваше творение крутится в эфире на глазах у всех.

Ввод промпта на сайте — от заявки до появления ролика в эфире проходит чуть более 20 секунд, а время генерации составляет лишь около ~8 сек.:

Что вообще происходит на экране

Несколько примеров:

Кроссовер, который сам напрашивался последние лет двадцать, просто никто не решался:

«Уолтер Уайт варит зелья на уроке Снейпа»

Кто‑то ушёл в эстетику нуара, и нейросеть переобулась в чёрно‑белое:

«Микки Маус в стиле Noir»

Концерт KISS x TBBT:

«Теория большого взрыва — концерт KISS, шелдон купер, радж, эмми играют на инструментах»

«Гуфи и Гомер Симпсон вдвоём собирают гриль по инструкции»

Нейросеть уверенно обращается с диснеевской пластикой и чёрно‑белым нуаром. Модели не нужно объяснять, «как выглядит Гомер Симпсон» — она уже знает. Задача пользователя — формулировать, а не рисовать.

Генеративка в прямом эфире

Обычная видеогенерация — асинхронный процесс: отправил запрос, подождал, получил файл, посмотрел когда удобно.

Прямой эфир — физика совсем другая. Тут нельзя «подождать чуть дольше»: если генерация начинает отставать от скорости просмотра хоть на полсекунды, эфир либо заикается, либо останавливается насмерть.

Сравним с конвейером, где деталь должна появляться на ленте быстрее, чем предыдущая уезжает, иначе вся линия встаёт.

Мировых примеров у формата, на самом деле, немного.

Самый известный — Nothing, Forever запущенный студией Mismatch Media в конце 2022-го на «Твитче». Это бесконечный «Сайнфелд», где фразы актёров генерировались LLM, а озвучка шла через синтез речи. Проект мгновенно обрёл популярность.

Как устроено внутри. 8 сек. видео/7,8 сек. генерации

Один видеоролик Grom TV длится восемь секунд — со звуком, а когда есть речь — нейросеть синхронизирует движения губ и реплику (липсинк).

На то, чтобы такой клип сгенерировать, у модели уходит около 7,8 секунды. Это значит, что коэффициент реального времени — 0,97. Генерация опережает эфир, хотя и с небольшим запасом. Всё это крутится не на кластере из десятков видеокарт, а через один чип Nvidia B200 (иногда подключается второй, чтобы оптимизировать скорость).

Параметр

Значение

Длина клипа

8 секунд видео + синхронный звук

Время генерации

~7,8 секунды

Частота кадров

~24 fps

Коэффициент реального времени

0,97 (генерация быстрее эфира)

Задержка «промпт зрителя → экран»

~8–25 секунд

Запас видео впереди зрителя

всегда не менее ~8 секунд

Чтобы оценить масштаб задачи: Blackwell (то самое поколение, к которому относится и топовый B200) — архитектура Nvidia, спроектированная в первую очередь под обучение и инференс больших моделей, а не под потоковую генерацию в реальном времени.

Дальше в дело идёт классика — ffmpeg, который в одном проходе (за какие‑то ~0,3 секунды на CPU) успевает сделать сразу несколько вещей:

  • подогнать темп воспроизведения ровно под скорость генерации (это тот самый механизм, который не даёт эфиру догнать модель),

  • наложить фирменный «плёночный» стиль канала — зерно, виньетку, мягкую цветность,

  • и нарезать всё на двухсекундные сегменты с ключевым кадром на каждой границе, чтобы плеер стартовал за две секунды и переключался между клипами без рывков.

Схематично конвейер выглядит так:

зритель ──► очередь ──► GPU: генерация 8 с видео + звука
                              │
                              ▼
             ffmpeg: темп, плёночный стиль, нарезка на 2-секундные сегменты
                              │
                              ▼
              HLS-плейлист (скользящее окно, непрерывный)
                              │
                ┌─────────────┴─────────────┐
              браузер (hls.js)          VLC / любой HLS-плеер

HLS выбрали, а потому что его понимает буквально всё: браузер, VLC, любой смарт‑телевизор.

Даже один лишний кадр в хвосте ролика вызывал заметное зависание на стыке двух клипов — и такие вещи можно отловить только по факту реального эфира, когда множество зрителей смотрят одновременно.

Что происходит, когда очередь пуста

Grom TV вообще не простаивает. Если очередь пользовательских промптов пустеет, в дело вступает Grom GPT — LLM‑модель нашей компании GPTunneL, которая сама придумывает сюжеты и подкидывает их в эфир, чтобы канал не молчал.

Архитектурно это построено так, что нейросеть способна генерировать порядка 10 000 уникальных клипов в сутки без единого повтора.

Кстати, похожая мысль была реализована в Nothing, Forever — там сценарии для стендапа и диалогов тоже писала языковая модель — только это была текстовая GPT-3, а не LLM + видеогенератор.

Модерация: фильтр стоит до генерации, а не после

Прямой эфир нельзя «отмотать назад» — если что‑то вышло на экран, это уже произошло у всех на глазах. Именно поэтому вся система фильтрации выстроена так, чтобы отсекать неприемлемый контент ещё до того, как он доберётся до видеомодели, чтобы не разгребать последствия постфактум.

запрос зрителя ──► GromMod ──► Grom (сценарист) ──► GPU ──► эфир
                    отсекает      убирает чувствительное
                    явную жесть   из промпта, переписывает
                                  сцену безопасно

Работает это в два независимых рубежа:

  • GromMod — собственный модератор GPTunneL, первый фильтр. Он смотрит на промпт целиком и сразу отклоняет откровенно недопустимое (насилие и так далее). Отказ зритель получает мгновенно, и здесь в GPU даже ничего не передаётся.

  • Grom на этапе сценария — второй рубеж. Превращая короткое пожелание зрителя в сценарий для видеомодели (сцена, реплики, звук, музыка), Grom попутно вычищает из него чувствительные детали и смягчает формулировки, сохраняя при этом сам творческий замысел. До модели промпт доходит уже в безопасном виде.

Два независимых этапа страхуют друг друга. То, что случайно проскочило первый фильтр, ловит второй.

GPTunneL — площадка, где всё это работает

Grom TV — лабораторный эксперимент внутри GPTunneL, российской ИИ‑платформы. Сервер физически расположен в России.

  • Это сервис, который объединяет больше сотни ИИ‑инструментов для генерации текста, изображений, видео, музыки и голоса в одном окне. Начинался проект в 2023 году как внутренний инструмент для собственной команды разработчиков, а вырос к 2026 году в платформу с более чем полутора миллионами зарегистрированных пользователей.

  • Изначально прототип вообще был продуктом для видеоконференций — но появились нейросети, и всё резко закрутилось в другую сторону.

  • Grom TV в этом смысле — пример того, что происходит, когда у платформы есть собственные модели (видео, LLM‑модератор, LLM‑сценарист) и собственное железо: перед нами эксперимент, который показывает, куда движется технология.

  • Технически можно поднять качество генерации выше и уйти в сторону полноценных стримов с цифровыми аватарами — с более стабильной картинкой, без малейшего дрейфа между кадрами, в честном HD‑разрешении.

  • Если у бизнеса есть интерес (например, B2B‑сценарии, где нужен именно живой генеративный видеоканал, а не предзаписанный ролик), такое решение реализуемо на серверном чипе B200 в реальном времени. Путём большего числа проходов генерации на кадр можно убрать дрейф картинки и выдавать HD в потоке.


Тут вся суть эксперимента: чем больше людей попробует, чем разнообразнее промпты — тем интереснее общий эфир.

Как нам известно, это первый в России подобный формат генеративного общего онлайн‑телевидения — открытого, куда заходит любой желающий и в реальном времени видит своё творение в общем эфире.

Grom TV для нас — это не финальный продукт, а скорее демонстрация принципа: генеративное видео можно поставить в прямой эфир на одной видеокарте, и это работающий канал, который вы можете открыть прямо сейчас. Мы продолжаем докручивать пайплайн, следить за качеством дословной речи, стабильностью склеек и модерацией.

Если хочется попробовать самому — заходите в «Гром Телевизор», пишите промпт и ждите 20–25 секунд до эфира.

Комментарии (3)


  1. SensDj
    08.09.2026 16:24

    А зачем изображение скукожено в маленький экранчик ? ничего не разглядишь, особенно на телефоне. На сайте fal.live изображение гораздо лучше видно


  1. RustTech
    08.09.2026 16:24

    Невозможно остановиться


  1. gennayo
    08.09.2026 16:24

    Но... Зачем?