Попробуйте объяснить ребёнку, почему кружка, столкнутая со стола, разбивается. Вы вряд ли начнёте с закона всемирного тяготения. Ребёнок просто увидит сотни падающих предметов, и в его голове сам собой сложился образ: вещи падают, твёрдое о твёрдое бьётся, жидкость растекается. Физику он «впитал» из наблюдений, а не из учебника.

А теперь представьте, что так же можно научить нейросеть. Не показывать ей тысячи часов одной и той же задачи, а дать посмотреть огромное количество видео, чтобы она сама поняла, как устроен мир. А потом прикрутить к ней руки, колёса или пропеллеры и объяснить, что от неё хотят, буквально за несколько десятков часов данных.

Именно на это делает ставку компания Odyssey. 15 сентября 2026 года она рассказала про Odyssey-3, а 8 октября открыла для всех research preview. В этой статье мы разберём, что это за модель, как её обучали, откуда берутся рекордные цифры и где заканчиваются факты и начинается маркетинг.

Пример с оф. сайта
Пример с оф. сайта

▍ Что такое мировая модель

Большие языковые модели предсказывают следующее слово. Мировая модель предсказывает следующее состояние мира: берёт то, что было раньше, добавляет действие (шаг вперёд, поворот руля, удар по предмету) и выдаёт, как всё будет выглядеть дальше.

Odyssey описывает Odyssey-3 как обучаемую динамическую систему, которая предсказывает, как объекты движутся и взаимодействуют в пространстве и как со временем развиваются ситуации. Модель получила знания о физике, динамике и причинно‑следственных связях из широкого набора визуальных наблюдений. Дальше эти знания можно использовать двумя способами: как симулятор окружения и как фундамент для обучения политик управления разными машинами.

Идея не с нуля. Ещё в 2025 году Odyssey показывала интерактивное видео, которое реагирует на действия в реальном времени. Тогда это было скорее про новую форму медиа. Теперь заявка серьёзнее: общий интеллект для физических и виртуальных систем.

▍ Кто за этим стоит

Основатели Odyssey, Оливер Кэмерон и Джефф Хоук, около десяти лет занимались беспилотными автомобилями. Логика у них понятная: машине, чтобы решить, что делать дальше, нужно предсказать, что будет вокруг. Компания основана в 2023 году с мыслью вынести эту идею далеко за пределы дорог.

Они же честно описывают проблему отрасли. Робототехника двигалась через всё более узкие системы, каждая под свою задачу и с огромным количеством данных именно под неё. Авторы называют это брутфорсом: не хватает общего понимания мира, и этот недостаток компенсируют горами демонстраций. Человек, по их аналогии, может в восемнадцать лет сесть за опасный станок и научиться им управлять, потому что до этого всю жизнь наблюдал, как предметы движутся, реагируют на силу и как опасны столкновения.

▍ Как устроена модель

Общая архитектура: авторегрессионный диффузионный трансформер. Разберём по частям.

Данные. Обучающая выборка состоит из трёх источников:

  • интернет‑видео с размеченными по времени и проверенными по схеме событиями;

  • записи игрового процесса с синхронизированными нажатиями клавиш и движениями мыши;

  • симуляции взаимодействия твёрдых тел с подписями и метаданными.

Первое даёт широту, второе даёт связь между действием и последствием, третье даёт аккуратную физику, где можно точно знать, что и почему произошло.

Обучение. Сначала Odyssey строит многошаговый видео‑диффузионный трансформер, в который можно подавать промпты и управляющие сигналы, меняющиеся во времени. Затем модель делают авторегрессионной с помощью teacher forcing и каузальных масок. Проще говоря, при обучении ей показывают настоящие предыдущие кадры и запрещают подглядывать в будущее, а она учится продолжать мир с учётом действий.

Дистилляция. Диффузионная модель обычно делает много шагов на каждый кадр, а для игры в реальном времени это слишком медленно. Поэтому Odyssey применила посттренинг, сочетающий distribution‑matching и adversarial distillation, и получила облегчённую версию, которая работает за несколько шагов. Это «ученик», который повторяет «учителя», но быстрее. Именно такую версию можно потрогать в браузере.

Размеры. Моделей две: Odyssey-3 с разрешением 832×480 и Odyssey-3 Pro с 1280×720. В превью можно ходить по сгенерированному миру от первого или третьего лица, отдельно двигать камеру и в процессе генерации вбрасывать события, чтобы посмотреть, как мир отреагирует. Число параметров в тех материалах, что я читал, не раскрывается.

▍ Физика: рекорд с оговоркой

Главный козырь Odyssey-3 Pro — результат на бенчмарке Physics‑IQ Verified. Его сделали Anates Labs и DeepMind. Модели дают видео реального физического эксперимента (жидкости, оптика, механика твёрдых тел, магнетизм, термодинамика), просят продолжить его и сравнивают с тем, что произошло на самом деле.

Вот что показали модели Odyssey (по данным из анонса):

Режим

Odyssey-3 (480p)

Odyssey-3 Pro (720p)

Видео‑в-видео, базовые промпты

51.8

—

Видео‑в-видео, улучшенные промпты

61.6

63.4

Видео‑в-видео, best‑of-8

64.4

66.1

Картинка‑в-видео, базовые промпты

41.0

—

Картинка‑в-видео, улучшенные промпты

48.8

50.0

Картинка‑в-видео, best‑of-8

52.8

54.7

Звёздочка здесь важная: заголовочные 66.1 получены в режиме best‑of-8, то есть из восьми попыток берётся лучшая. Обычные значения скромнее (63.4 у Pro с улучшенными промптами), хотя всё равно впечатляют. Для честного сравнения с другими моделями стоит смотреть на сопоставимые режимы.

Отдельно Odyssey подчёркивает компромисс между точностью и стоимостью генерации: по её расчётам, при тех же вычислениях можно получить больше симуляций. Стоимость они считают из допущения в один доллар за час работы GPU MI355X, так что это модельная оценка, а не прайс‑лист.

▍ Миры, в которых хочется жить

Второй бенчмарк, WorldMark, измеряет следование управлению, визуальное качество и память о мире. Odyssey посчитала среднее по 13 метрикам на собственных запусках, используя подписи самого бенчмарка. Результат:

Категория

Odyssey-3

Ближайший конкурент

От первого лица, стилизованные

77.2 (1 место)

LingBot‑World, 77.0

От первого лица, реальные

80.6 (3 место)

Lyra 2.0, 84.4

От третьего лица, реальные

79.0 (1 место)

HY‑World 1.5, 76.9

От третьего лица, стилизованные

76.3 (1 место)

HY‑World 1.5, 75.1

Обратите внимание: первое место в одной из категорий выиграно с разницей в 0,2 балла, а в «реальном» мире от первого лица модель только третья. Сама компания оговаривается, что эти метрики оценивают конкретные свойства сгенерированных миров, а для применения к физической системе нужно отдельно проверять поведение, важное именно для этой машины.

▍ От картинки к железу

Самое интересное начинается, когда мировую модель превращают в мозг для машин. Схема такая: основа остаётся замороженной, а к ней добавляют небольшой обучаемый компонент, который переводит внутренние представления модели в команды конкретного устройства. Для этого нужны пары «наблюдение, действие», и их нужно немного.

Роботы‑манипуляторы. С десятками часов демонстраций модель выполняет задачи вроде «налей хлопья в миску» или «закрой коробку с винтами». Авторы отдельно отмечают поведение восстановления, которого не было в демонстрациях: робот переориентирует захват после промаха и достаёт предмет, упавший в неудобном положении. Это ровно то, что обычно требует демонстраций всех возможных провалов. Для проверки на разных телах и средах Odyssey сотрудничает с Poke & Wiggle.

Гуманоиды. Компания Flexion построила на Odyssey-3 политики управления гуманоидами. По словам авторов, они лучше обобщаются на изменения среды, чем протестированные VLA‑базовые модели, и продолжают работать при смене освещения, на которой базовые падают. Какие именно базовые модели сравнивались, в анонсе не уточняется.

Автомобили. Политика, обученная на 20 часах симулированного вождения, при замороженной основе ездит в замкнутом контуре по улицам Индии, предсказывая точки маршрута впереди. Любопытная цифра: политики, обученные полностью в симуляции, проезжали между вмешательствами водителя‑страхующего около 77% от дистанции политик, обученных на реальных записях.

Дроны. Политика навигации обучена на десятках часов симулированных полётов и показала стабильный полёт с облётом препятствий, но в симулированном помещении.

Игры. Политики на основе Odyssey-3 играли в GTA V. А ещё есть намёк на перенос: модель, обученная примерно на двух часах GTA, умела двигаться верхом на лошади в Red Dead Redemption 2 и ездить на мотоцикле в Sleeping Dogs без дообучения на этих играх.

Многокамерные данные. После всего 100 шагов обучения контрольная точка выдавала видео сразу с трёх фронтальных камер автомобиля.

Обратите внимание, сколько здесь «симуляции». Это не упрёк, а способ читать анонс: часть демонстраций показывает, что подход работает, но реальный мир с его шумом и редкими ситуациями остаётся главным экзаменом.

▍ Мир как тренажёр для других ИИ

Отдельная линия: если модель умеет генерировать окружения, в них можно запускать и обучать других агентов. В демонстрации агент получает цель на естественном языке и пытается её выполнить, наблюдая сгенерированный мир.

За этим стоит идея рекурсивного обучения, которую Odyssey развивает в проекте PROWL: агенты находят слабые места мировой модели, это помогает её улучшать, а надёжные симулированные миры, в свою очередь, обучают агентов. Чем лучше мир, тем сложнее опыт, чем сильнее агенты, тем более скрытые недостатки они находят. Рядом лежат Agora-2, где в одном мире одновременно действуют несколько людей или ИИ, и Starchild-1, который пытается выйти за рамки обучения только на визуальных наблюдениях.

Есть и безопасностный мотив. Авторы пишут, что такие миры позволяют изучать, как ведут себя всё более способные агенты, и находить опасное поведение до того, как оно проявится в физическом мире.

▍ Скептический взгляд

Немного трезвости, потому что анонс красивый.

  • Рекордные 66.1 получены в режиме best‑of-8, а оценки по WorldMark Odyssey провела сама.

  • Черипикинг: мы видим удачные ролики, но не знаем, сколько было неудачных.

  • Физика видео не равна качеству управления. Physics‑IQ проверяет, насколько хорошо модель продолжает эксперимент, а не как хорошо по ней ездит машина.

  • Многие демонстрации (автомобили, дроны) основаны на симуляторе, а «десятки часов данных» всё равно остаются немалым объёмом, хоть и меньшим, чем раньше.

  • Сторонний обзор отмечает, что публичных цен, лицензии и документации API на момент его выхода не было. Доступ для разработчиков физических систем, судя по сайту, пока по запросу.

  • Фразы вроде «самая физически точная мировая модель в мире» остаются фразами из соцсетей. Подтверждает их лишь конкретный бенчмарк.

В защиту авторов: они сами пишут, что мировые модели пока отстают от языковых по масштабу примерно на два порядка, и признают, что вопрос устойчивости результатов на разных роботах и средах остаётся открытым.

▍ Итоги

Odyssey-3 — это попытка сделать для физического мира то, что большие языковые модели сделали для текста: один предобученный фундамент, на который за небольшое число часов данных навешивается руль, манипулятор или пропеллер. Пока это смесь настоящих достижений и обещаний, которые ещё предстоит проверить в реальном мире.

Следить за этим очень интересно, а попробовать preview можно уже сегодня.

Комментарии (1)


  1. Dron007
    11.10.2026 03:24

    Ну, и главное, что тут можно потестировать https://experience.odyssey.systems/