Привет, Хабр. Предлагаем вам почитать и обсудить наше интервью с Вячеславом Васильевым, Senior Data Scientist в Управлении базовых моделей Kandinsky, блок «Развитие генеративного ИИ». Вячеслав — опытный исследователь в области Gen AI и один из создателей нескольких поколений нейросетей Kandinsky. Его совместные с коллегами научные статьи регулярно попадают на ведущие международные конференции по машинному обучению.
Вячеслав рассказал, как написать хорошую научную статью и почему важно лично представлять свои работы на больших международных конференциях, поделился мнением о генеративных сетях и актуальных проблемах индустрии ИИ, а также раскрылся с неожиданной для исследователя стороны.
Как ты пришёл к работе с искусственным интеллектом, и насколько сложным был путь к позиции синьора?
В.В.: Я бы сказал, что в моём случае этот путь был закономерным. Я учился на Физтехе, в МФТИ, закончил там бакалавриат и магистратуру на факультете, где у нас было много математики и компьютерных дисциплин. Также я закончил магистратуру Сколтеха по программе Data Science, где мне преподавали такие выдающиеся учёные, как Иван Оселедец, Евгений Бурнаев и Виктор Лемпицкий, который был моим научным руководителем и помог войти в мир генеративного ИИ.
Ещё со школы я думал о себе как об исследователе и мне хотелось работать в бодрой, высококонкурентной среде. За годы учёбы в бакалавриате я попробовал многое — от физики и биоинформатики до классического CV, науки о цвете и абстрактной математики. Ещё студентом я стажировался в Кембридже и Дрездене, а с третьего курса работал в Академии Наук. Позже я открыл для себя мир R&D в компаниях и на практике понял, что контакт науки и индустрии чрезвычайно полезен, а работа в большой корпорации открывает новые возможности, немыслимые в небольших институтских лабораториях.
В команде Kandinsky я уже четвёртый год, и за это время обучал модели, писал код и статьи, делал исследовательские и практические проекты, преподавал, руководил и консультировал коллег по разным вопросам, выполнял также ряд менеджерских задач, проводил собеседования. Так и развились мои навыки многопрофильного специалиста. Я считаю, что в основе умения справляться с любой задачей — умение и готовность учиться всему и всегда, а это закладывается хорошим образованием. Среда ML-разработчиков довольно конкурентная, поэтому в ней, как я считаю, без должной образовательной базы и вот этого умения учиться будет довольно трудно.
Твои научные статьи регулярно принимают на крупнейшие международные научные конференции (ICLR, ICML, EMNLP и так далее). В 2025 году две твои статьи получили RnD-премию Сбера как лучшие статьи года в обеих номинациях — «Журналы» и «Конференции». Что нужно для создания работ такого уровня?
В.В.: Как это ни банально, но прежде всего вы должны провести качественное исследование, полезное научному и инженерному сообществу. Однако что такое «полезность» в науке — вопрос дискуссионный. На то это и исследования на фронтире человеческих знаний, что нельзя предугадать — что выстрелит, а что нет. Что точно — у вас должно быть комплексное видение, это очень важно. Понимание, как позиционировать свою работу, как связать её с существующими решениями и чем ваш подход качественно отличается от всех предыдущих, насколько это может быть важно с точки зрения прогресса в конкретной задаче. Вы должны уметь концентрироваться и углубляться, а потом «выныривать» обратно и, как художник отходит от мольберта, смотреть на свою работу и отвечать себе на вопрос: «Имеет ли объективную ценность для науки и человечества то, что я делаю?» А вообще, конечно, важна практика и опыт. Чтобы написать хорошую статью, возможно, надо сначала написать несколько работ попроще. Но, когда вы студент, это и будет самое ценное — ваша первая статья. Пусть не идеальная — идеал недостижим, — но зато своя. Ещё всегда можно и нужно обращаться к более опытным коллегам и учёным, так и работает смена научных поколений.
Сегодня всё чаще и код, и статьи пишут с использованием LLM. Как ты к этому относишься и используешь ли эти инструменты в своей работе?
В.В.: Да, конечно, использую, как и все сейчас, — странно было бы не использовать то, что позволяет сэкономить время и в целом повысить качество работы в отдельных аспектах. Но важно помнить, что вы должны всегда проверять выход LLM-ки — не только с точки зрения конкретных фактов, но и в целом: какого уровня статья получается на выходе. К сожалению, в научном мире количество статей растёт, но качество исследований остаётся тем же, если не падает. Проблема ли это в целом научного сообщества? Да, безусловно. Но тем важнее каждому исследователю иметь развитую интуицию, глубокие знания и вкус, а не полагаться целиком и полностью на автоматизацию процессов, позволяющую максимизировать количество статей.
Есть мнение, что полностью избавиться от галлюцинирования моделей невозможно, можно лишь снизить его степень. Что ты думаешь по этому поводу, есть ли работы, позволяющие надеяться на решение этой проблемы?
Галлюцинирование моделей возникает из-за отсутствия полноценного контроля над их возможностями. Даже хорошо обученная простейшая модель классификации будет выдавать ошибки — редкие, но будет. Это практически неустранимо, но и в то же время нормально. Это исходит из самих принципов обучения моделей — модель должна выдавать какой-то ответ: писать текст по запросу, генерировать изображение или видео — в данном случае разницы нет. Это как если бы вы задали вопрос человеку, на который он не знает ответ, и вместо того, чтобы честно признать свою некомпетентность, пытается выдать вам что-то правдоподобное. Но только люди делают это осознанно, а у модели нет выбора — она не осознаёт никакой неправильности, потому что в данный момент она не различает семантического конфликта в контексте запроса. Не зная ответа, нейросеть всё равно пытается его угадать: статистически ей выгоднее сказать хоть что-то, чем честно признаться в незнании.
Проблема этого для моделей лежит в данных и принципах обучения. Пока единственный выход — повышение участия людей в процессе обучения, оценки и работы модели (human-in-the-loop). Что касается автоматических методов устранения галлюцинаций, то здесь работы ведут, но, насколько мне известно, прогресс пока небольшой. Во всяком случае, в области визуальной генерации методов действительно пока не так много. Кто знает, может, в случае LLM и агентных систем нас уже очень скоро ждёт возрождение классической лингвистической семантики на новом уровне.
Фантасты научили нас трём законам робототехники. Современные модели ИИ — те самые «умные» роботы из фантастики, однако они полностью лишены каких-либо моральных принципов: в различных экспериментах модели идут на что угодно, лишь бы сохранить себя: они готовы обманывать и хитрить, если это поможет не отключить сервер с моделью. Уже сейчас вопросы безопасности всё чаще поднимаются в сообществе, особенно с развитием автономных агентов, способных действовать во внешних сервисах. А что будет, когда массово появятся физические роботы с подобным ИИ? Известны ли тебе какие-нибудь работы в этом направлении?
Работ по усилению контроля над моделями пока довольно мало. В этом я вижу одно из ключевых направлений исследований в ближайшие годы. Что касается самих разработчиков, то это действительно интересный вопрос: заботит ли их самих мощь того, что они — то есть мы — создают? По моим личным наблюдениям за большинством коллег, пока что сами разработчики находятся в состоянии почти что детского удивления в духе «Ух ты, прикольно! Забавно, что оно так (не)смогло». Кто-то увидит в таком отношении риски, но по сути — это естественное состояние для того, кто делает шаг в неизведанное. Это и есть двигатель прогресса, ограничить его — значит ограничить развитие технологий. Что будет дальше, покажет время, но мы находимся в интересной и уникальной ситуации. Но история развития технологий показывает: на любой риск со временем находится ответ, и тот же изначально вызывающий опасения прогресс порождает достойного уровня защиту от того, чтобы выйти из под контроля.
Периодически в СМИ мелькают новости, как компания лишилась баз данных и кодовой базы, потому что сотрудники легкомысленно доверились модели, которая решила почему-то стереть «ненужное». Как ты видишь решение этой проблемы? Только ли в составлении инструкций, «написанных опытом прошлых разработчиков», или возможны иные способы решения?
Только лишь инструкции на естественном языке не помогут — ведь модель снова может начать галлюцинировать и поймёт что-то неправильно. Это извечная проблема плохого понимания промпта и вводных инструкций. Причины тут лежат гораздо глубже, практически на уровне фундаментальной математики. Пока здесь необходимы более низкоуровневые технические барьеры: тот же human-in-the-loop, ограничения на время работы моделей, бэкапы и разделения сред разработки.
По признанию крупнейших разработчиков ИИ, они уже скормили своим моделям всю доступную информацию из интернета и книг, им этого мало и теперь для обучения начали синтезировать данные. Не приведёт ли в будущем к неким глобальным проблемам тот факт, что крупнейшие ИИ-модели будут всё больше обучаться не на реальных, а на синтезированных данных? Понятно, что в некоторых областях, вроде управления транспортом, это пойдёт только на пользу, но если говорить о моделях общего назначения? Учитывая колоссальные масштабы данных и необъятность самих моделей, как можно контролировать и управлять возможными искажениями при росте доли синтетики в обучающих данных?
Синтетические данные действительно зачастую используются в обучении, в том числе и потому, что нет достаточного объема качественных реальных данных. Но верно — это в конечном счёте может привести к деградации моделей, если обучаться на всё возрастающем объёме синтетики. Причины этого, опять-таки, математические, фундаментальные и неустранимые в чистом виде. Нет другого пути кроме тщательной и аккуратной работы с данными — их сбора и фильтрации. Допустимая доля синтетики в данных, очевидно, разнится в зависимости от размера модели, типа задач, типа данных и процесса обучения модели (по этому поводу, например, можно посмотреть статью «Demystifying Synthetic Data in LLM Pre-training» с конференции EMNLP 2025). Однако даже небольшое количество синтетики может приводить к существенной деградации моделей (смотри статью «Strong Model Collapse» c ICLR 2025). Вывод: отбирать данные, даже синтетические, очень внимательно и с участием людей. Экспериментировать и оценивать качество моделей после очередного добавления данных также с помощью людей. Знаменитую фразу из «Соляриса» можно перефразировать так: «Модели нужен человек».
Виюле ты побывал на конференции ICML в Корее, где команда Kandinsky представляла свои работы. Расскажи, удалось ли получить инсайты, были ли интересные работы?
В.В.: Да, как и всегда после больших конференций, ты приезжаешь с целой пачкой фотографий постеров и сохранённых ссылок. Что-то потом, понятно, отбрасываешь, но что-то становится основой или вдохновением для следующей собственной работы. Особенно в этом смысле полезны мастер-классы — на них как раз можно узнать, о чём думает и чем дышит научное сообщество прямо сейчас. В Сеуле мне особенно было интересно проследить за достижениями в области интерпретируемости генеративных моделей и созданием моделей мира. Мы как раз представляли одну из своих работ, и организаторы мастер-класса пригласили нас на неформальную вечернюю посиделку в корейском ресторанчике — где как не на таких конференциях ты можешь за одним столом обсудить проблемы в своей области с топовыми исследователями?
А что вообще даёт участие в международных конференциях?
В.В.: Это возможность не просто представить свою работу и получить квалифицированный отзыв или полезную критику, но и шанс выстроить новые полезные коммуникации, получить инсайты, которые станут основой для новых идей и новой работы в будущем. Кроме того, это помогает пиарить разработки всей команды (учёные — это благодарная публика), и засветиться со своей работой на конференции такого уровня — это вклад и в науку, и в продукт, потому что узнаваемость и доверие к разработкам команды повышается. Конференции помогают держаться мировой технологической магистрали, быть в тонусе, общаться на одном языке и обмениваться идеями с людьми со всего мира — без этого наука и значительные технологические результаты недостижимы.
Чем тебе интересно направление генеративных моделей в целом и создание изображений/видео в частности?
В.В.: Человек в своей попытке познать мир задался задачей создать нечто подобное своему разуму и даже превзойти его природу. Значительная часть информации, которую мы обрабатываем, это визуальный домен — даже текст можно воспринимать как изображение, не говоря уже о том какой объём информации мы получаем сразу же, только взглянув на лицо человека. Попытка смоделировать взаимоотношения визуальных концепций и создать генеративную систему на основе выученных данных изображений или видео — одна из важных вех в попытке построения ИИ, способного к мультимодальным абстракциям, который, что немаловажно, будет обладать ещё и творческой способностью. А ведь творчество — это то, что отличает человека от животного. Научить творить других — это высшее достижение человека.
Некоторые представители научного сообщества скептически относятся к направлению генерации картинок и видео, не видя в этом стратегической бизнес- или научной цели. Какие аргументы ты бы дал в таком диалоге?
В.В.: На мой взгляд и бизнес-, и научных целей здесь достаточно: создание симуляций и обучающих данных для роботов и автономных систем, прогнозирование эволюции внешнего состояния объектов и сцен (скажем, на производстве или на дороге), для бизнеса — реклама, кинематограф, визуальные агенты и чат-боты, аватары, персонализированный мир каждого пользователя (да-да, будет как в «Матрице» ну или почти). С точки зрения науки, как я уже говорил, обработка и синтез визуальных данных — интересная задача, которая может вывести модели ИИ на принципиально иной уровень. Ведь не даром же дети рисуют на стенах и на всём, что попадётся под руку — так они познают мир в акте творчества, формируя более полное представление о том, как все устроено вокруг них.
Какую долю в твоей работе занимают именно научные исследования, а какую — непосредственная работа с продуктом, с алгоритмами? Что тебе ближе? Как отражаются эти две составляющие на твоём KPI в Сбере?
В.В.: Мне, конечно, ближе исследования. Но вообще это неотделимые вещи в идеальной ситуации. Хороший высокотехнологичный продукт невозможно создать без оригинальных разработок, особенно сейчас, когда ведущие игроки рынка проводят закрытые исследования и не спешат делиться рабочими результатами. Не занимаясь исследованиями, мы останемся без всего — и без науки, и без продукта. Нельзя всё время уповать на чужой open-source в надежде, что он нас спасёт от отсутствия собственного опыта. Я упомянул идеальную ситуацию: да, хотелось бы, чтобы продовые KPI логично следовали за исследовательскими, которые сначала и надо достигать и оценивать, так как это требует большой и напряжённой работы с львиной долей самоотдачи.
Есть ли у тебя любимое исследование? Которое было самым сложным и интересным, или привело к созданию уникальной статьи?
В.В.: Думаю, любимое исследование — то, которым занимаешься в данный момент. Каждая статья — отдельный проект, своего рода продукт, материальный объект, за которым стоит маленькая жизнь. Конечно, запоминается самая первая статья — у меня она сплошь состояла из математических теорем, и было это очень давно. Говоря о последних работах, тех что представлял на ICML, это «Time-Correlated Video Bridge Matching» и «Making Time Editable in Video Diffusion Transformers».
Случаются ли у тебя «творческие кризисы», когда исследование заходит в тупик или нет новых идей, непонятно, за какую мысль зацепиться? Как выходишь из такого состояния?
В.В.: Конечно случаются. Помогает общение с родными, друзьями, небольшая пауза и, опять же, сама работа. Если долго мучиться, что-нибудь получится. Иногда простая рутина спасительна. С другой стороны, конференции, преподавание, общение с более молодыми коллегами, признание сообщества тоже окрыляют, придают сил и мотивации.
Какие увлечения и интересы у тебя вне работы? Как проводишь свободное время?
В.В.: Свободного времени немного, но когда оно есть, то стараюсь отдавать его творчеству. Я занимаюсь музыкой, играю на классической гитаре, организовываю и выступаю на концертах, читаю лекции об истории искусства и музыки, веду личный канал. Недавно вот ещё кандидатскую диссертацию написал. Люблю литературу, философию, живопись. Стараюсь общаться с людьми разного мировоззрения, разного жизненного и духовного опыта — надо всегда обогащать себя и выходить за свои рамки — и в работе, и в жизни.
Какой совет напоследок ты мог бы дать начинающим исследователям?
В.В.: Пробуйте разные задачи, беритесь за многое, но доводите до конца. Не стремитесь прочитать все статьи, а попытайтесь решить задачу сами. Испытайте то священное удовольствие от самого процесса исследования и озарения какой-либо личной идеей (таких моментов немного и дальше на них будет всё меньше времени) — это то, что придаст вам интереса к вашей деятельности и вообще к жизни ещё на много лет вперёд. От науки надо получать удовольствие, иначе ей не надо заниматься.
diderevyagin
как приятно слышать глас разума про LLM ....