
Привет, Хабр! В начале июня в Вене прошла главная международная конференция по робототехнике и автономным системам — International Conference on Robotics and Automation (ICRA). В этом году среди участников была и наша команда автономного транспорта Яндекса.
Топиков, которые обсуждаются на ICRA, много, потому что она не только об ML — она скорее о робототехнике в целом. Например, есть секции о механизмах и дизайне, а также о медицинских роботах. Было немало и чисто инженерных работ.
Ключевой топик докладов на конференции — RL, он же Reinforcement Learning, обучение с подкреплением. Также нас интересовали статьи по классическому пайплайну автономного автомобиля: perception + prediction + planner + simulation. Новые подходы к Robotic Learning тоже интересны, так как их можно перенести на задачи автономного транспорта.
Меня зовут Егор Волков, я занимаюсь претрейном модели планирования движения в автономном транспорте Яндекса. Вместе со мной на конференцию ездил Максим Спорышев (@msporyshev) — руководитель службы поведения и предсказания движения. В этой статье мы собрали самые интересные тренды, доклады и инженерные развилки, которые заметили на ICRA 2026, — от Reinforcement Learning и генерации редких edge‑кейсов до того, куда вообще двигается ML в робототехнике.
О выборе жюри: best papers
Организаторы конференции отметили несколько ключевых работ. Best Conference Paper Award получили две статьи:
SymSkill: Symbol and Skill Co‑Invention for Data‑Efficient and Reactive Long‑Horizon Manipulation — интересный не ML‑подход к манипуляционным задачам с большим горизонтом планирования.
OmniRetarget: Interaction‑Preserving Data Generation for Humanoid Whole‑Body Loco‑Manipulation and Scene Interaction — новый способ ретаргетинга для обучения роботов‑гуманоидов на человеческих демонстрациях, который сохраняет пространственные отношения с объектами.
Не менее интересными были и победители других номинаций. Поговорим о них чуть подробнее.
В номинацию Best Paper Award on Robot Learning попала работа: Do You Know Where Your Camera Is? View‑Invariant Policy Learning with Camera Conditioning. В ней описывается необычный кондишенинг на положения камер в VLA‑моделях — тех, что переводят картинку и инструкцию в действия робота. Задача решалась на примере роборуки, но в целом актуальна для любых роботов и автономного транспорта.
У робота есть камера, которая снимает, что он делает, и авторы показали, что качество всех VLA сильно проседает, если камеру переставить: в сетапах с рандомным размещением success rate падает практически в два раза. При этом у разных роботов камеры стоят в разных местах.
Авторы предложили простое и при этом элегантное решение: положение камер закодировали в каждом пикселе при помощи плюккеровых координат. Задали луч камеры для каждого пикселя шестью дополнительными числами: дельтами и моментами. В результате профит есть даже без рандомизации положения камеры — качество работы моделей выросло.
В номинации Best Paper Award on Robot Perception отметили одну интересную статью: FindAnything: Open‑Vocabulary and Object‑Centric Mapping for Robot Exploration in Any Environment. Здесь речь идёт об exploration и mapping над пространством объектов. Робот ищет произвольный объект в неизвестной локации и по пути строит карту всего, что нашёл. Для каждого объекта он запоминает языковое описание, положение в пространстве, геометрию и визуальные признаки. Решается задача при помощи сетапа из нескольких foundation‑моделей.
Основная сложность была в том, чтобы совместить 3D‑фичи с моделями, которые умеют скрещивать картинки с текстом в момент построения карты. Так что пайплайн получился сложный, но интересный, а главное — работающий на реальном роботе.
О воркшопах
Один из основных воркшопов был целиком посвящён теме Reinforcement Learning в робототехнике. Рассказывали о разных вариантах претрейна на демонстрационных данных (IL, Offline RL), как делать ризонинг в embodied‑моделях, sim2real/real2sim, world modelling.
На воркшопе по автономным автомобилям, организованном Мюнхенским университетом, команда исследователей из Huawei, NVIDIA Research и OpenDriveLab из Shanghai AI Laboratory рассказала о своём посттрейновом фреймворке World Engine: обученная с его помощью модель планирования позволяет автономному автомобилю проезжать в среднем 200 км по Шанхаю без вмешательства водителя‑испытателя. Уже выложили в опенсорс. Работа нам показалась интересной с точки зрения генерации safety‑critical‑сценариев. Также в своём докладе NVIDIA объявили, что вслед за недавним релизом модели Alpamayo 2 и симулятора выложат огромный датасет и запустят челлендж AlpaSim. 25 стран, 2500 городов и 1700 часов проездов — звучит супермощно.
Другой интересный воркшоп — о предсказании траекторий пешеходов. На нём обсудили ключевую сложность задачи: движение пешехода зависит от взаимодействия с машинами и от того, что он считает безопасным. К сожалению, прорывных решений проблемы пока никто не предложил.
О докладах и постерах
Residual Off‑Policy RL for Finetuning Behavior Cloning Policies

Работа от Amazon Frontier AI & Robotics про планирование движения. Снова всё рассматривается на роботах, но подходы вполне применимы и в автономном транспорте.
Для больших VLA хорошо работает претрейн на behaviour cloning, а вот RL пока масштабируется плохо: данных не хватает, сложно учитывать success rate на длинных горизонтах, а пространства экшенов слишком большие, чтобы их покрыть, — в статье упоминаются 29 степеней свободы.
Авторы предлагают учить Residual RL — политику, которая даёт небольшую добавку к экшену от behaviour cloning. А ещё в статье делятся рецептом реализации.
FP3: A 3D Foundation Policy for Robotic Manipulation

Авторы критикуют vision‑энкодеры в современных VLA и утверждают, что без трёхмерного представления о мире не обойтись. В качестве решения они предлагают сетап обучения с Uni3D как энкодером. В чём заключаются ключевые преимущества:
Высокая эффективность с малым объёмом данных. Для адаптации к новой задаче достаточно всего около 80 демонстраций.
Сильное обобщение. Модель показывает высокую успешность (выше 90%) в новых средах с ранее не встречавшимися объектами.
Важность 3D‑представления. Эксперименты показывают, что использование 3D‑информации значительно улучшает способность робота адаптироваться по сравнению с чисто 2D‑подходами.
Search3D: Hierarchical Open‑Vocabulary 3D Segmentation

Постер о новом подходе к open vocabulary от ETH, Google и Stanford. Застать авторов, к сожалению, не получилось.
В статье рассказывается про подход в компьютерном зрении, который по текстовому запросу на обычном языке находит объект в 3D‑сцене и выделяет его границы. Ключевая идея — описать сцену иерархически, сразу на нескольких уровнях детализации: целый объект, его части, отдельные области. Запрос может попасть в любой из этих уровней — и в предмет целиком, и в его деталь.
COMPASS: Cross‑embOdiment Mobility Policy via Residual RL and Skill Synthesis

COMPASS — фреймворк от NVIDIA Research для универсальных политик передвижения: одна политика на роботов с разной конструкцией.
Идея — закрыть разрыв между общим и частным. Правила навигации у роботов примерно одни, а что робот физически может — зависит от его конструкции. COMPASS соединяет три подхода: Imitation Learning, Residual RL и дистилляцию политик.
В чём ещё преимущества COMPASS:
Позволяет эффективно адаптироваться к новым роботам, используя данные лишь с одной исходной платформы.
Обеспечивает высокую обобщающую способность: политика‑генералист достигает примерно в 5 раз более высокой успешности на unseen‑эмбеддингах по сравнению с предобученной IL‑политикой.
Демонстрирует потенциал для zero‑shot‑переноса из симуляции в реальные условия (sim2real).
Интересные статьи об автономном транспорте
Diffusion‑guided Generalizable Enhancer for Urban Scene Reconstruction

Работа от Waabi AI. Они улучшили 3D‑реконструкцию в зоне, ближайшей к исходному треку.
Основная идея — взять диффузионные модели как генеративный prior и на нём дотянуть 3D‑реконструкцию до устойчивости к экстраполяции. Для автономного транспорта это больное место: симуляция сенсоров нужна с тех ракурсов, которых в логах не было.
Тесты проводят на дистанциях 3, 4 и 5 метров от исходных положений камер: делают feedforward‑рендеринг с помощью 3D Gaussian Splatting, добавляют шум и денойзят всё диффузией, которая училась восстанавливать изображения на дистанции 3 метра.
Это хорошее решение для симуляции небольшого отклонения, например перестроения, но неподходящее для сложных разворотов и прокладывания нового маршрута.

Attention BEV — развитие идеи BEV Fusion, то есть всё того же представления сцены сверху, но с прибавкой по метрикам на nuScenes, одном из основных бенчмарков в автономном транспорте.
К классическому BEV здесь добавляется блок Fusion — цепочка аттеншенов. Данные на входе мультимодальные: с одной стороны — пространственная размерность, то есть координаты, с другой — каналы, лидар и несколько камер. Авторы считают, что перемножать эти размерности целиком незачем: аттеншен применяют к каждому пространству по очереди.
Такой подход улучшает способность модели фиксировать ключевую информацию за счёт динамической калибровки каналов и пространственных измерений. AttBEV показывает лучшие результаты по сравнению с BEVFusion по большинству оценочных показателей.
NDS достигает 0,6795 (на 2,63% выше, чем у BEVFusion);
mAP доходит до 0,6426 (на 1,79% выше, чем у BEVFusion).
TreeIRL: Safe Urban Driving with Tree Search and Inverse Reinforcement Learning

Авторы хотели совместить два мира: алгоритмический и ML‑планировщик. Сразу оговорюсь, почему считаю эту статью интересной: из множества постеров только этот — о решении, которое уже в проде. Они действительно ездят на этой технологии по Лас‑Вегасу.
Предлагаемая модель состоит из двух блоков:
поиск Монте‑Карло по дереву (Monte‑Carlo Tree Search, MCTS) для генерации траекторий кандидатов;
обученный с помощью Inverse Reinforcement Learning (IRL) scorer для выбора лучшей траектории.
MCTS генерирует 100 траекторий: все они удовлетворяют формальным требованиям физичности, однако не все из них применимы в реальности. IRL scorer оценивает каждую траекторию с точки зрения человеческих предпочтений. В итоге выбирается одна финальная траектория — она физична и похожа на то, как водил бы человек.
Модель показала себя хорошо по сравнению с бейзлайном без MCTS не только на датасете nuPlan, но и в реальной жизни. Средняя дистанция до вмешательства водителя — более 400 км.
Learning to Annotate Delayed and False AEB events: a Practical System for Extreme Class Imbalance and Asymmetric Label Noise

Авторы решают задачу автоматической аннотации событий для системы автономного экстренного торможения — Automated Emergency Braking. Чтобы её оптимизировать, нужны точные метки, но всё самое важное сидит в хвосте распределения: задержанные и ложные срабатывания — это меньше 5% всех триггеров. Разметить их руками слишком дорого и долго.
Авторы предлагают два решения:
Физически правдоподобная аугментация данных. Вместо обычного перевзвешивания классов авторы генерируют реалистичные примеры редких событий: варьируют параметры целевой зоны, переносят динамику автомобиля между примерами и маскируют нерелевантных участников движения. Это уменьшает влияние дисбаланса классов и улучшает обучение детектора.
Очистка шумных меток. Метод оценивает сложность (hardness) каждого примера и с помощью probe‑guided adaptive threshold отличает вероятные ошибки разметки от действительно сложных пограничных случаев. В результате обучающий набор очищается, а качество обнаружения редких событий повышается.
Learning to Drive by Imitating Surrounding Vehicles

Статья и постер об обучении через имитацию действий других участников дорожного движения. Чтобы собрать тренировочный датасет, авторы берут сцены на nuPlan, выбирают на них одного‑двух хороших агентов и трансформируют их движение так, будто всё происходит от лица эго‑агента. Оставляют только хорошие треки, используя фильтрации по метрикам комфорта, пройденной дистанции и TTC.
Вывод работы: поведение окружающих машин — это тоже обучающие данные, и ими можно расширить выборку для Imitation Learning. Но брать всё подряд нельзя. Среди чужих траекторий попадаются и опасные, и просто неинформативные, так что всё решает стратегия отбора примеров.
Правда, есть нюанс: с ростом количества данных эффективность обучения падает. На размере датасета в несколько тысяч сцен виден большой профит по метрикам, который почти сводится к нулю на ста тысячах сцен.

В задаче симуляции трафика на сцене исследователи предлагают EP‑Diffuser. Модель предсказывает траектории сразу всех участников движения — водителей и пешеходов — и достраивает реалистичное продолжение дорожной сцены, опираясь на её геометрию и историю движения агентов.
EP‑Diffuser похожа на MotionDiffuser, но входы и выходы диффузера — полиномы, в то время как у Motion Diffuser выходы — PCA‑представление. Полиномами описываются и элементы карты, и траектории агентов.
Чем же этот подход лучше? Авторы показывают, что полиномы переносятся с одного мира на другой: EP‑Diffuser работает с приемлемым качеством на датасете, на котором не обучался. MotionDiffuser с PCA‑компонентами так не умеет — PCA требует переобучения под новый датасет. При этом полиномы выигрывают и у сырого представления фич.
Отсюда и основной вклад работы: не новая диффузия, а удачное представление под неё.
Perfect Prediction or Plenty of Proposals? What Matters Most in Planning for Autonomous Driving

Эта работа интересна тем, что у неё довольно неочевидный вывод: даже идеальная информация о будущем (perfect predictions) — точные, «правильные» траектории других участников движения — не даёт существенного выигрыша в качестве итогового плана. Более того, в некоторых случаях (например, с методом DTPP) использование идеальных предсказаний даже ухудшало результат.
Проверялось это на двух бенчмарках:
Val14 — более распространённые сценарии с невысокой сложностью взаимодействия;
interPlan — высокоинтерактивные и выходящие за распределение данных ситуации.
По мнению авторов, фокус в развитии планирования сместился не на бесконечное улучшение предсказаний, а на умение системы генерировать богатый и качественный пул возможных действий, при этом используя предсказания разумно — в первую очередь для быстрой проверки сгенерированных планов на коллизии.
VL‑DPO: Vision‑Language‑Guided Finetuning for Preference‑Aligned Autonomous Driving

Авторы дообучают модель предсказания траекторий с помощью VLM. Сама VLM тут вспомогательный модуль, который выбирает лучшую траекторию из сгенерированных. Дальше этот преференс уходит в лосс основной модели.
Во время обучения VLM получает на вход 12 сгенерированных вариантов траектории, сцену в виде фотографий с камеры в разные моменты времени и вопрос: «У нас вот такая сцена. Скажи, пожалуйста, какую из этих траекторий ты предпочитаешь?»
Дальше модель должна пройти всю цепочку сама: понять, что происходит, найти, кто важен, сообразить, куда едут агенты, оценить риски и назвать лучшую траекторию. Рассуждение идёт в формате вопрос — ответ.
Чтобы превратить ответ VLM в лосс, берут DPO. Он поочерёдно сравнивает преференс‑траекторию со всеми остальными и приучает модель предпочитать её каждой из них. Относительно классического сетапа с выбором ближайшей траектории такой модуль качество поднимает.
По итогам на метриках open‑loop стало лучше. Closed‑loop авторы не проверяли.
KiGRAS: Kinematic‑Driven Generative Model for Realistic Agent Simulation

Сильная сторона KiGRAS — на момент публикации модель была SOTA на челлендже симуляции агентов. Задача у неё простая: генерировать реалистичные траектории и поведение агентов.
Основная идея: сырая траектория сама по себе мало что объясняет, а движением агентов и машины управляет физика. Значит, описывать надо не точки, а кинематику — в каждый момент времени движение описывается продольным и поперечным ускорением. После этого траекторию можно разбить на дискретные токены, и дальше всё выглядит очень похоже на языковые модели. А работать с токенами проще, чем с шумными точками.
Авторы показывают, что на этом выигрывают и в качестве, и в вычислениях. Складывается выигрыш из трёх вещей:
Компактное представление. Сцена превращается в распределения вероятностей действий на каждом шаге времени — данных и вычислений нужно меньше.
Физическая осуществимость. Кинематические ограничения не дают сгенерировать состояние, которое неисполнимо автомобилем.
Проще обучение. Задача свелась к классификации токенов действия на каждом шаге вместо регрессии сырых координат точек. А классификация всегда проще регрессии.
Conditional Flow‑VAE for Safety‑Critical Traffic Scenario Generation

Работа Waabi AI о генерации сложных сценариев поведения. Авторы учат Flow Matching переводить обычные дорожные сценарии в safety‑critical.
В чём суть: обычно водители стараются ни в кого не въезжать, а это и хорошо, и плохо. Хорошо потому, что так и нужно, а плохо потому, что в датасетах для обучения автономного транспорта нужны примеры опасного вождения — ситуации, из которых надо выбираться с достоинством.
И у обычного сценария, и у safety‑critical есть своё распределение, и по мысли авторов нужно научиться переходить из одного в другое. Сначала обучают вариационный автоэнкодер, который предсказывает будущие траектории агентов и эго — самой машины.
Здесь и появляется латентное пространство: Flow Matching делают именно в нём, потому что исходное пространство слишком сложное и многомерное. Flow‑модель учится переводить латент обычной сцены в латент опасной. Чтобы получить новый опасный сценарий, берут латент существующего примера и прогоняют через обученную flow‑модель — на выходе латент уже в пространстве safety‑critical. Подход хорош тем, что траектории выходят опаснее, но не скатываются в коллизии и не теряют реалистичности.
Бонус: что ещё запомнилось
Было много статей об автоматической парковке: есть end‑to‑end‑решения и подходы с декомпозицией задачи на предсказание интентов агентов и дальнейшую генерацию траектории, согласованной с намерениями агентов.
Сразу несколько работ были посвящены предсказанию опасных траекторий. Например, манёвров перестроения с подрезанием автономного автомобиля для последующей проверки в симуляции.
Одна команда собрала целый мини‑город в масштабе 1: 15 для тестирования планировщика.

Ну и общий настрой, когда уже сбился со счету, сколько посмотрел плакатов и докладов, но осталось ещё много интересного:
Что мы увезли с ICRA 2026
Наблюдение первое. Самое интересное среди докладов и плакатов этого года — не в архитектурах, а в представлениях. Плюккеровы координаты вместо неявного положения камеры, полиномы вместо PCA‑компонент, кинематические токены вместо точек траектории, латентное пространство вместо исходного. Сами модели при этом знакомые — диффузия, трансформер, автоэнкодер. Меняется то, что в них подают, — именно это даёт и перенос между датасетами, и экономию вычислений.
Наблюдение второе. То и дело мелькает Residual RL. И в Amazon, и в COMPASS базовую политику никто не выбрасывает: её аккуратно дотачивают небольшой добавкой.
Наблюдение третье. Данных реального мира недостаточно, приходится их симулировать: safety‑critical‑сценарии, ракурсы в трёх метрах от записанного трека. Особенно важно симулировать редкие сценарии.
Всё же ICRA — это конференция про то, что будет работать, а не про то, что уже работает, и относиться к ней стоит именно так. А самое полезное на ней — возможность пообщаться с авторами статей, чтобы спросить о том, чего нет в исследовании. Ради этого и стоит сюда ехать.
Подписывайтесь на наш канал об ML в автономном транспорте 404 Driver Not Found, чтобы не пропускать обзоры актуальных научных статей и новости с конференций.