В конце прошлого года мы представили семейство моделей генерации изображений и видео Kandinsky 5.0. Флагманская модель Kandinsky 5.0 Video Pro заняла и долгое время удерживала первое место среди open‑source‑моделей в категории text‑to‑video на arena.ai. Сегодня мы выкладываем в открытый доступ Kandinsky WM 1.0, набор из трех специализированных моделей генерации видео: для автомобильных сценариев, робототехники и сцен со сложной физикой. Код и веса под лицензией MIT: GitHub, GitVerse, HuggingFace.

WM расшифровывается как World Model, то есть «модель мира». Этот термин используют довольно широко, поэтому здесь важно уточнить, что именно мы имеем в виду. Фэй‑Фэй Ли (ведущий исследователь в области компьютерного зрения, инициатор проекта ImageNet) с командой World Labs предлагает классифицировать модели мира по функции. В этой схеме renderer отвечает за наблюдение — например, за кадры видео; simulator — за состояние и динамику мира; planner — за выбор следующего действия. Эти функции могут быть представлены разными системами или сочетаться в одной. Конечно же сочетать все три функции в одной модели — это dream, к которой стремятся исследователи и инженеры (фактически, это и будет foundation world model для Physical AI систем)

Renderer, simulator и planner в функциональной классификации моделей мира Фэй-Фэй Ли и команды World Labs. Анимация взята из материала «A Functional Taxonomy of World Models».
Renderer, simulator и planner в функциональной классификации моделей мира Фэй‑Фэй Ли и команды World Labs. Анимация взята из материала «A Functional Taxonomy of World Models».

По этой классификации Kandinsky WM 1.0 — renderer: на вход модели получают первый кадр и текстовое описание, а на выходе строят визуальное продолжение сцены. Для задач Physical AI при этом недостаточно, чтобы видео просто выглядело правдоподобно: модель должна сохранять геометрию объектов и правильно воспроизводить динамику и физику их взаимодействия.

Далее в этой статье мы расскажем, какие существуют основные вызовы в Physical AI, зачем используются модели мира, и, конечно, подробно о том, как мы собирали данные и обучали Kandinsky WM 1.0.

Physical AI и дефицит данных

Physical AI — это системы, которые воспринимают физический мир и действуют в нём: управляют роботами, автомобилями и другим оборудованием. От них требуется не просто распознать объекты в кадре — они должны понимать, как сцена меняется во времени и к чему приведёт то или иное действие. Для обучения таких систем нужны разнообразные видеоданные, достоверно передающие геометрию, динамику и физику реального мира. Особенно важны редкие и потенциально опасные сценарии. Однако собрать достаточное количество таких данных в реальных условиях сложно, дорого, а иногда и небезопасно.

Рассмотрим эту проблему детальнее на примере автономного транспорта. Даже если автомобиль будет ездить и записывать данные без остановки весь год, он соберёт менее 10K часов синхронных дорожных сцен. Дополнительные камеры дадут дополнительные видеопотоки, но не увеличат количество уникального времени на дороге. Для сравнения: NVIDIA обучала Cosmos на 20М часов видео, а Meta — V‑JEPA 2 более чем на 1М часов интернет‑видео. При этом большая часть данных, собранных автомобилем, всё равно будет состоять из простых сценариев — езды по прямой, остановок на светофорах и движения в потоке. Кроме того, наибольший интерес представляют именно редкие и потенциально опасные ситуации: внезапные перестроения других автомобилей, непредсказуемое поведение пешеходов, экстремальные погодные условия, дорожно‑транспортные происшествия, нарушения ПДД другими участниками, аномальные ситуации и прочие сложные дорожные сценарии.

Это так называемая проблема длинного хвоста (long tail): дорого не только собирать большие объёмы разнообразных данных, но и получать достаточное количество примеров редких сценариев, которые критически важны для безопасности.

Примеры редких дорожных сценариев.
Примеры редких дорожных сценариев.

Аналогичная проблема возникает и в робототехнике. Сбор обучающих данных требует реального робота, набора датчиков, контролируемого окружения и участия человека‑оператора. Кроме того, каждый эпизод необходимо валидировать: убедиться, что действия робота были корректными и датчики работали без сбоев. Для того чтобы обеспечить разнообразие данных, приходится менять объекты, конфигурацию сцены, освещение и сами задачи, а многие нестандартные ситуации трудно или небезопасно воспроизводить в реальности.

Один из способов закрыть пробелы в реальных данных — дополнить их синтетическими. Видеомодель можно попросить сгенерировать сцену с нужными объектами, действием или погодой — особенно если такой пример трудно собрать вживую. Но это работает только при достаточной физической достоверности: иначе вместе с новыми данными мы добавим в датасет ошибки модели.

Физическая достоверность

Современные модели видеогенерации пока ещё далеки от полноценного понимания физического мира, необходимого для генерации качественных синтетических данных для Physical AI. Несмотря на высокое визуальное качество генерируемых видео, мы видим ошибки в моделировании взаимодействия объектов, причинно‑следственных связей, сохранении геометрии и соблюдении физических законов.

Ниже — результаты генерации одного и того же сценария несколькими моделями. На вход модель принимает первый кадр и промпт «Two pillows on a table and two grabber tools hanging above them from which a brown tennis ball and an orange block are suspended. The grabber tools let go of the ball and block. Static shot with no camera movement.» Такие промпты могут быть достаточно длинными, поэтому в подписях к примерам мы не приводим их полностью, а коротко формулируем ожидаемый сценарий.

Промпт: манипуляторы отпускают мячик и блок.
Промпт: манипуляторы отпускают мячик и блок.

Модели зачастую отрисовывают всё, что нужно: разжатие манипуляторов, падение объектов, деформацию подушек и даже тени. Однако непонимание физики процесса приводит к неправильной генерации.

При этом проблема физичности является слишком глубокой, чтобы решить её исключительно на Post‑Train этапе — при улучшении модели на одних примерах, возникает деградация на других. Сначала требуется дообучение модели для адаптации к конкретному домену и лишь затем специфические для домена Post‑Train подходы. Это несколько снижает обобщающую способность модели, зато даёт высокое качество.

Как устроен Kandinsky WM 1.0

Видеогенерация Kandinsky WM 1.0 выполняется в режиме image‑to‑video (I2V): на вход модель получает первый кадр сцены и подробный англоязычный промпт, описывающий объекты, действия, ожидаемую динамику и условия съёмки, а затем генерирует продолжение видео. 

В основе Kandinsky WM 1.0 лежит Kandinsky 5.0 Video Lite — базовая видеомодель на 2 млрд параметров. На её основе мы обучили три специализированные модели: K5-AV (Autonomous Vehicle) для автомобильных сцен, K5-RO (Robotics) для робототехники и K5-PH (Physics) для сцен со сложной физикой — движением людей, протеканием процессов и взаимодействием объектов.

Сначала каждую модель адаптировали на данных соответствующего домена, а затем провели финальный Post‑Train. Для K5-AV и K5-RO использовали RL: модели обучались по сигналу reward‑модели, которая оценивала физическую достоверность сгенерированного видео. Для K5-PH применили SOAR — метод, позволяющий модели находить и исправлять отклонения в собственной траектории генерации. Выбор разных подходов связан со спецификой доменов; подробнее мы разберём это в следующих разделах.

Общая схема обучения Kandinsky WM 1.0
Общая схема обучения Kandinsky WM 1.0

Данные

Для обучения каждой из трёх специализированных моделей мы подготовили отдельную доменную выборку: автомобильные сцены для K5-AV, робототехнические демонстрации для K5-RO и видео со сложной физикой для K5-PH. Выборки не смешивали: каждую модель адаптировали только на данных соответствующего домена. Приведённые ниже объёмы указаны после нашей подготовки и фильтрации данных и могут отличаться от полного размера исходных публичных датасетов.

Три отдельные доменные выборки и соответствующие им ветки Kandinsky WM 1.0.
Три отдельные доменные выборки и соответствующие им ветки Kandinsky WM 1.0.

Автономный транспорт — 1.5М видео

Автомобильная часть основана на открытом датасете NVIDIA PhysicalAI Autonomous Vehicles. В исходном наборе — более 1700 часов поездок, записанных в 25 странах и более чем 2500 городах: разные типы дорог, погода, плотность трафика, пешеходы и сложные дорожные ситуации. Каждая сцена снята семью камерами; после подготовки мультикамерных записей мы получили 1.5М отдельных видеопримеров для обучения.

Робототехника — 2.2М видео

Это самая крупная из трёх выборок. Её основой стал GenRobot 10Kh RealOmni — набор реальных бытовых сцен с длительными, преимущественно двуручными действиями: складыванием одежды, работой с молниями и крышками, сортировкой предметов, уборкой и кухонными задачами. Из него в обучение вошло 1.4М видео.

Ещё 250К видео мы взяли из AgiBot World Beta, который фокусируется на длинных составных заданиях в разнообразных реальных сценах: контактные манипуляции, планирование на длинном горизонте и взаимодействие нескольких роботов. AgiBot Alpha и материалы ICRA Challenge добавили демонстрации отдельных навыков, включая захваты, перемещения и толкание объектов. Genie Sim 3.0 добавил вариативные симуляции гуманоидных роботов, а Fourier ActionNet, RoboCOIN, RoboMIND и другие подборки расширили набор платформ, ракурсов и типов задач.

Для обучения выбирали наиболее динамичные фрагменты, из AgiBot удаляли малоподвижные видео с задних камер, а также исключали сцены с чрезмерно размытыми объектами — такой артефакт иногда возникал из‑за неудачной анонимизации лиц.

Сложная физика — 1.6М видео

1.3М видео были взяты из Pre‑Train Kandinsky 5.0 Video. Они прошли многоступенчатую фильтрацию по разрешению, визуальному качеству, движению объектов, общей динамике сцены и физической достоверности. Нам были нужны не просто визуально привлекательные ролики, а сцены, на которых модель действительно может учиться движению и взаимодействию объектов.

Дополнительно 300K видео было отобранно вручную командой асессоров по специально созданной для этого методологии. В подборку вошли индустриальные и технологические процессы, механические взаимодействия, жидкости, разрушения, деформации и другие физически сложные явления.

Подготовка данных

После отбора оставляли видео с разрешением не меньше 512 пикселей по меньшей стороне и частотой кадров не ниже 24 FPS. В большинстве источников клипы уже были нарезаны; дополнительно сцены нарезали только для домена сложной физики, используя TransNetV2 с дополнительной проверкой OmniShotCut. Автомобильная и робототехническая выборки были собраны из готовых открытых датасетов, поэтому отдельную дедупликацию для них не проводили. Видео для домена сложной физики собирали из интернета, где одни и те же ролики могли встречаться в нескольких источниках, поэтому эту выборку отдельно очищали от дублей по косинусной близости видеоэмбеддингов InternVideo. Затем видео приводили к 5-секундным сценам и добавляли к ним текстовые описания длиной до 256 токенов с помощью Qwen3-235B‑A22B

Этап 1. Доменная адаптация

После подготовки выборок базовую Kandinsky 5.0 Video Lite дообучали отдельно для каждого домена. Сначала обучение шло в режиме T2V, затем — в смешанном режиме T2V/I2V. В смешанном режиме 25% примеров приходилось на I2V: это позволяло сохранить способность продолжать сцену по начальному кадру без потери качества генерации по тексту. T2V‑этап занял одну эпоху — 20 000 итераций, смешанный этап — ещё 5 000 итераций.

K5 (слева) vs K5-AV (справа). Промпт: ДТП перед фурой. Автомобили перестали ехать по встречке в обе стороны, ДТП произошло.
K5 (слева) vs K5-AV (справа). Промпт: ДТП перед фурой. Автомобили перестали ехать по встречке в обе стороны, ДТП произошло.
K5 (слева) vs K5-RO (справа). Промпт: робо-рука берёт ручку. Взяли ручку правильной робо-рукой.
K5 (слева) vs K5-RO (справа). Промпт: робо‑рука берёт ручку. Взяли ручку правильной робо‑рукой.
K5 (слева) vs K5-PH (справа). Промпт: швейный станок вышивает буквы. Более правильная геометрия и динамика, стабилизировалось положение камеры.
K5 (слева) vs K5-PH (справа). Промпт: швейный станок вышивает буквы. Более правильная геометрия и динамика, стабилизировалось положение камеры.

Этап 2. RL и SOAR

RL: обучение с подкреплением

Дообучение на специализированном датасете позволяет адаптировать модель к конкретному домену, однако само по себе не гарантирует улучшения физической достоверности генерируемых видео. Для дальнейшего повышения качества мы использовали второй этап обучения — обучение с подкреплением (RL) с моделью вознаграждения (reward‑моделью), оценивающей физичность сгенерированных сцен.

На схеме показано, как признаки foundation-моделей поступают в reward-модель.
На схеме показано, как признаки foundation‑моделей поступают в reward‑модель.

RL лучше подходит автомобильному и робототехническому доменам из‑за структуры самих данных: камера статична, либо же закреплена, а основные объекты — автомобили, роботы и предметы — сохраняют жёсткую геометрию. В таких сценах признаки формы, глубины и динамики дают reward‑модели достаточно устойчивый сигнал, поэтому оптимизация по награде приносит заметный прирост.

На первом этапе обучается reward‑модель. Для одного и того же текстового запроса формируются пары из реального и сгенерированного видео, после чего модель учится различать их. Затем reward‑модель принимает признаки, извлечённые несколькими специализированными foundation‑моделями, каждая из которых отвечает за отдельный аспект физического мира. В нашей реализации используются SAM для анализа сегментации и формы объектов, Depth Anything для оценки геометрии и глубины сцены, а также V‑JEPA, извлекающая представления, описывающие динамику объектов во времени. Задача reward‑модели — определить на основе этих признаков, является исходное видео реальным или сгенерированным.

Схема GRPO применительно к Kandinsky Video
Схема GRPO применительно к Kandinsky Video

После обучения reward‑модели её параметры фиксируются, а полученная функция награды используется на втором этапе — RL‑тюнинге генеративной модели с использованием алгоритма GRPO. На каждой итерации Kandinsky генерирует видео по заданному запросу, reward‑модель вычисляет награду, после чего алгоритм GRPO обновляет параметры генератора таким образом, чтобы максимизировать получаемую награду. В результате модель начинает генерировать ролики, которые лучше соответствуют ожидаемой геометрии сцены, поведению объектов и их взаимодействию.

K5-AV (слева) vs K5-AV-RL (справа). Промпт: на дороге стоит собака. Собака перестала двигаться вместе с автомобилем.
K5-AV (слева) vs K5-AV‑RL (справа). Промпт: на дороге стоит собака. Собака перестала двигаться вместе с автомобилем.
K5-RO (слева) vs K5-RO-RL (справа). Промпт: робо-рука ставит сок на полку. Геометрия стала стабильнее, бутылка консистентнее.
K5-RO (слева) vs K5-RO‑RL (справа). Промпт: робо‑рука ставит сок на полку. Геометрия стала стабильнее, бутылка консистентнее.

SOAR: коррекция траектории

Для модели K5-PH мы использовали SOAR (Self‑Correction for Optimal Alignment and Refinement). При обычном SFT (supervised fine‑tuning, дообучении с учителем) модель учится удалять шум из латентов реального видео. На обучении каждый промежуточный латент получают из исходных данных, однако во время генерации модель последовательно работает уже с собственными предсказаниями. Из‑за этого ошибка, возникшая на одном из ранних шагов, может накапливаться и отклонять дальнейшую генерацию от реалистичной траектории. Обычное SFT не учит модель исправлять такие отклонения.

SOAR специально создаёт во время обучения отклонения от идеальной траектории денойзинга. Из реального видео строится зашумлённое состояние, после чего текущая модель делает один шаг и получает собственное промежуточное предсказание, которое может отклоняться от правильной траектории. Затем это состояние повторно зашумляют на нескольких уровнях и учат модель возвращать его к исходному чистому примеру. Так модель обучается на собственных промежуточных состояниях — on‑policy — и получает сигнал для исправления ошибок на каждом шаге, без внешней reward‑модели.

В нашей реализации SOAR стал усиленным этапом SFT для сложной физики. Он дополняет доменную адаптацию и остаётся совместимым с последующим RL.

Наивное объяснение идеи SOAR. Подробнее — в статье SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion Models.
Наивное объяснение идеи SOAR. Подробнее — в статье SOAR: Self‑Correction for Optimal Alignment and Refinement in Diffusion Models.

Эффект SOAR для K5-PH также оказался доменно‑зависимым. В сценах с людьми, мягкими или деформируемыми объектами и более активным движением камеры RL показал плохие результаты. Возможно, это связано с тем, что контролировать сохранение формы и геометрии на каждом кадре менее осмысленно: естественная деформация легко выглядит как ошибка для reward‑модели. Здесь SOAR дал больший прирост, поскольку учит модель исправлять отклонения собственной траектории без явной оценки каждого объекта. Обратная картина наблюдалась в AV и RO: там, где уверенно работал RL, дополнительный эффект от SOAR был меньше.

K5-PH (слева) vs K5-PH-SOAR (справа). Детали стали точнее, камера стабилизировалась.
K5-PH (слева) vs K5-PH‑SOAR (справа). Детали стали точнее, камера стабилизировалась.

Результаты

Бенчмарки

Для количественной оценки мы используем три популярных бенчмарка домена Physical AI, каждый из которых проверяет отдельный аспект качества генерации. Все приведённые далее метрики и позиции получены в рамках нашей валидации по опубликованным процедурам соответствующих бенчмарков. Для простоты и единообразия во всех сравнениях далее будем использовать следующие обозначения: K5 Lite — базовая модель Kandinsky 5.0 Video Lite, K5 Lite FT — версии после доменной адаптации, Kandinsky WM 1.0 — финальные модели после специализированного Post‑Train. 

PAI‑Bench‑G

PAI‑Bench‑G — генеративная часть Physical AI Bench. В ней 1 044 реальных сценария из шести категорий: автономный транспорт, робототехника, индустрия, взаимодействия людей, физические процессы и бытовые ситуации (common sense). Domain Score считается по доле правильных ответов мультимодальной LLM на вопросы о сцене, Quality Score объединяет восемь метрик качества и временной согласованности, а Overall — среднее двух оценок.

Лидерборд PAI-Bench-G и наши результаты.
Лидерборд PAI‑Bench‑G и наши результаты.

Основной фокус был на трёх доменах, для которых адаптировались модели: AV (Autonomous Vehicle), RO (Robot) и PH (сложная физика). При этом благодаря сильной обобщающей способности базовой модели прирост наблюдался и в некоторых других близких доменах.

В результате доменной адаптации и последующего RL‑тюнинга финальная Kandinsky WM 1.0 заняла 4-е место в нашем расчёте по PAI‑Bench‑G. При этом модели, расположенные выше, имеют на один‑два порядка больше параметров. Наиболее подходящей для сравнения является NVIDIA Cosmos‑Predict2.5–2B — модель, ближайшая к Kandinsky по количеству параметров. Ниже приведено несколько сравнений:

NVIDIA Cosmos-Predict2.5-2B (слева) vs K5-AV-RL (справа). Промпт: подъезжаем к перекрестку. Правильный свет светофора, автомобили едут в правильных направлениях.
NVIDIA Cosmos‑Predict2.5–2B (слева) vs K5-AV‑RL (справа). Промпт: подъезжаем к перекрестку. Правильный свет светофора, автомобили едут в правильных направлениях.
NVIDIA Cosmos-Predict2.5-2B (слева) vs K5-RO-RL (справа). Промпт: переложить красную бутылку в другую тарелку. Правильное исполнение.
NVIDIA Cosmos‑Predict2.5–2B (слева) vs K5-RO‑RL (справа). Промпт: переложить красную бутылку в другую тарелку. Правильное исполнение.
NVIDIA Cosmos-Predict2.5-2B (слева) vs K5-PH-SOAR (справа). Промпт: двое мужчин занимаются борьбой. Более естественная динамика.
NVIDIA Cosmos‑Predict2.5–2B (слева) vs K5-PH‑SOAR (справа). Промпт: двое мужчин занимаются борьбой. Более естественная динамика.

По совокупности примеров и метрик Kandinsky WM 1.0 и NVIDIA Cosmos‑Predict2.5–2B достаточно близки по качеству: нередко обе модели одинаково хорошо справляются со сценой или допускают схожие ошибки. Разницу по отдельным доменам лучше видно в сводной таблице PAI‑Bench‑G: показатель Kandinsky WM 1.0 примерно на 5 процентных пунктов выше в автомобильных и робототехнических сценариях и на 2–3 процентных пункта — в индустрии, сложной физике и сценах с людьми. При этом Cosmos лучше в ряде других категорий, на которых мы не фокусировались.

Physics‑IQ Verified

Physics‑IQ Verified проверяет пять разделов: механику твёрдых тел, динамику жидкостей, оптику, термодинамику и магнетизм. Модель продолжает реальный физический эксперимент по первому кадру. В нашей валидации для каждого тестового примера генерировались четыре продолжения с разными значениями seed, после чего метрики усреднялись. Каждую генерацию сравнивают с реальным продолжением по четырём метрикам: Spatial IoU, Spatiotemporal IoU, Weighted Spatial IoU и MSE. Итоговый Physics‑IQ Score нормируется на физическую вариативность, оценённую по двум независимым дублям одного и того же эксперимента, и приводится к шкале от 0 до 100.

Лидерборд Physics-IQ Verified и наши результаты.
Лидерборд Physics‑IQ Verified и наши результаты.

Kandinsky WM 1.0 заняла 5-е место в нашей внутренней оценке. Кроме того, результат Kandinsky WM 1.0 преодолел психологически важную отметку в 30%. Для контекста: при первичной публикации исходного Physics‑IQ лучший результат составлял 29.5% и сами авторы бенчмарка характеризовали это как свидетельство сильно ограниченного понимания физики.

RBench (QWEN‑based)

RBench оценивает робототехническую видеогенерацию по пяти типам задач: обычные манипуляции, пространственные отношения, взаимодействие нескольких агентов, длинные последовательности действий и визуальное рассуждение. Отдельно проверяются четыре типа роботов: однорукие и двурукие манипуляторы, гуманоиды и четвероногие роботы. Автоматическая оценка учитывает нарушения физических законов, аномалии количества объектов, стабильность робота и объектов и соответствие заданию; итоговый Avg. — среднее девяти срезов по задачам и типам роботов.

Лидерборд RBench и наши результаты.
Лидерборд RBench и наши результаты.

В RBench мы столкнулись со сценариями, о которых ранее не задумывались, — например, с генерацией видео робота от третьего лица. Несмотря на это, Kandinsky WM 1.0 поднялась на две позиции и заняла 6-е место, чем мы достаточно довольны.

В целом, несмотря на сравнительно небольшой размер, Kandinsky WM 1.0 входит в топ-10 на всех трёх рассмотренных бенчмарках видеогенерации для Physical AI.

Kandinsky WM 1.0 в картине мира: итоги и планы

Следующий шаг — связать renderer с simulator, а затем и с planner. Именно в эту сторону сейчас движутся крупные команды. Хорошего отдельного ролика уже мало: нужна среда, которая помнит своё состояние, реагирует на действия и позволяет проверить несколько вариантов будущего. Проекты ниже находятся на разных участках этого пути — от более физичной видеогенерации до интерактивных симуляторов.

  • OpenAI / Sora. Ещё в первой работе о Sora OpenAI рассматривала видеогенерацию как шаг к симуляции реальности. В Sora 2 команда прямо писала о прогрессе в симуляции мира и понимании его физики. Продукт закрыли в апреле 2026 года. По слухам, ресурсы команды перенаправили на более крупные разработки в Physical AI.

  • NVIDIA / Cosmos 3. Первые версии Cosmos NVIDIA разрабатывала прежде всего для Physical AI и генерации отраслевых сцен. В Cosmos 3 рамки стали шире: модель работает с текстом, изображениями, видео, звуком и действиями, а также поддерживает reasoning, генерацию сцен и предсказание действий. Получилась единая модель, которая умеет и строить наблюдения, и работать с действиями; её можно использовать вместе с policy‑моделями роботов и автономного транспорта.

  • Runway / GWM-1. GWM-1 построена поверх видеомодели Gen-4.5. Она достраивает сцену кадр за кадром в реальном времени и принимает управляющие сигналы: движение камеры, команды роботу или аудио. Поэтому пользователь или агент может менять происходящее прямо по ходу генерации.

  • Google DeepMind / Genie 3. Genie 3 сразу проектировали как интерактивную модель мира. Она генерирует среду в реальном времени, сохраняет согласованность сцены в течение нескольких минут и обновляет её после действий пользователя или агента. Для DeepMind это среда обучения embodied‑агентов: агент выбирает действие, а модель показывает, как на него отреагирует мир.

  • Waymo World Model. Waymo адаптировала Genie 3 для автономного вождения. Модель генерирует данные камер и LiDAR, а сцену можно менять текстовой командой, траекторией автомобиля или конфигурацией окружения. Так Waymo может воспроизводить редкие дорожные ситуации и проверять, что произойдёт при другом манёвре.

В Kandinsky WM 1.0 нам удалось улучшить качество видеогенерации для задач Physical AI: были собраны отдельные доменные выборки, проверены разные Post‑Train подходы и получены три специализированных модели: K5-AV для автомобильных сцен, K5-RO для робототехники и K5-PH для сцен со сложной физикой. В результате модели стали лучше сохранять геометрию и воспроизводить динамику и физику взаимодействий. По результатам валидации Kandinsky WM 1.0 вошла в топ-10 на всех трёх бенчмарках, на которых мы тестировались: 4-е место на PAI‑Bench‑G, 5-е — на Physics‑IQ Verified и 6-е — на RBench. В целевых доменах она также опередила схожую по размеру Cosmos‑Predict2.5–2B. Отдельно заметен прогресс на редких дорожных сценариях: такие ситуации редко попадают в реальные датасеты, но очень важны для обучения и тестирования автономных систем.

K5 (слева) vs K5-AV-RL (справа). Промпт: ДТП на перекрёстке. Лучше воспроизводит редкие дорожные сценарии из длинного хвоста.
K5 (слева) vs K5-AV‑RL (справа). Промпт: ДТП на перекрёстке. Лучше воспроизводит редкие дорожные сценарии из длинного хвоста.

Далее мы планируем увеличить объём и разнообразие обучающих данных и добавить общий этап Mid‑Train на широком наборе видео с физическими взаимодействиями. Полученная модель станет единой основой для всех трёх специализированных направлений, что позволит перенести общие знания о динамике и физике мира во все три модели, сохранив их специализацию.

Следующий этап развития Kandinsky WM — перейти от генерации визуального продолжения сцены (renderer) к моделированию её состояния и динамики (simulator). Модель должна научиться реагировать на управляющие действия, сохранять историю взаимодействия и показывать последствия каждого действия с учётом контекста сцены. В дальнейшем такую систему можно будет связать с планировщиком (planner): он будет выбирать действия, модель среды — рассчитывать изменения в мире, а генеративная модель — возвращать новое наблюдение. Так получится интерактивная среда для проверки политик, обучения агентов и воспроизведения редких сценариев.

Kandinsky WM 1.0 — наш первый открытый релиз в направлении моделей мира для Physical AI. Мы публикуем код и веса трёх специализированных моделей, чтобы их можно было исследовать, сравнивать и развивать дальше.

Ссылки:

Авторы

  • Команда Kandinsky WM: Егор Малых, Марк Булыгин, Сергей Кузин, Александр Куницын, Дмитрий Авдеев

  • Руководитель трека Kandinsky World Model: Андрей Иванюта

  • Post‑training Data: Юлия Агафонова, Анастасия Аляскина

  • Руководитель трека Applied and Platform: Николай Герасименко

  • Руководитель трека Optimization: Владимир Корвяков

  • Руководитель Kandinsky Lab, CTO Kandinsky: Денис Димитров

Комментарии (2)


  1. rPman
    04.08.2026 09:43

    прямо дико интересно, что физичекая модель покажет по запросу симуляции Двойной_маятник

    p.s. https://huggingface.co/kandinskylab/Kandinsky-WM-1.0-I2V-5s-PH оно? 2B параметров, на каком минимальном железе это можно запустить? 16gb gpu?