В каталоге кейсов внедрения искусственного интеллекта набралось 1352 проекта в российских компаниях и госорганах: от антифрода Сбера до распознавания сорняков с дронов у «Русагро». Каталог ведём мы в АНО «Цифровые платформы», кейсы в него добавляют сами компании и наша команда. Когда смотришь на внедрения 2025-2026 годов не по одному, а разом, видны закономерности: что повторяется из проекта в проект, где ломается и где приносит деньги. О них эта статья.

Главный вывод умещается в одну фразу. В кейсах, которые дошли до продакшена и до цифры, качество модели почти никогда не является решающим фактором. Решает обвязка: семантический слой, пороги уверенности, детерминированный код вокруг LLM, человек на границе. Ниже шесть паттернов с примерами.

1. Модель не принимает решение, она его оформляет

Самые спокойные кейсы 2026 года устроены одинаково: LLM не подпускают к данным напрямую. В Первой Грузовой Компании ИИ-агент операционной аналитики отвечает логистам на вопросы про выгрузку вагонов и выполнение плана. Но модель не пишет SQL. Между ней и хранилищем стоит семантический слой с описанными метриками и измерениями, а параметризованный запрос собирает конструктор. У агента нет прав на запись. Сводка по 150 объектам собирается за минуты вместо часа.

В Яндексе робот-документатор витрин данных на LLM описал 15 000 таблиц за полгода против 500 за предыдущий год. Секрет не в модели: сначала робот собирает объективный контекст (схемы, глоссарий, связанные таблицы через граф), и LLM только дописывает поверх него. Вторая модель независимо оценивает результат. Итог: 92 процента семантического совпадения с проверкой человека и около пяти человеко-лет аналитиков.

В Альфа-Банке автономный агент на локальной Qwen 3.6-35B стал предсказуемым только после того, как всю детерминированную обработку данных вынесли в отдельные сервисы на Go, а модели оставили потребление результата. В ДОМ.РФ платформа интеллектуальной обработки документов на LLM и RAG держит классический ML на классификации и извлечении сущностей, а LLM включает только там, где нужен ответ в свободной форме. Это и есть рабочее определение корпоративного ИИ-агента сегодня: детерминированный код думает, модель говорит.

2. Порог уверенности и человек за ним

Ни один из крупных кейсов с деньгами не построен на полной автоматизации. Система CV-модерации фотоотчётов «Иваныч» в X5 проверяет 10 млн фотоотчётов в месяц из 27 тысяч магазинов «Пятёрочки» и «Перекрёстка». Это 26 моделей и 62 типа проверок: классификаторы чистоты, детекция зон, VLM-проверки ценников, YOLO плюс OCR для сроков годности. На пороговых значениях уверенности подключается человек. Точность выросла с 79 до 92 процентов, операционные расходы на модерацию снизились вдвое, а большую часть жизни система работала на 4 vCPU и 16 ГБ памяти.

В VK Видео первая попытка заменить асессоров VLM-разметкой провалилась. Сработал гибрид: дообученная Qwen3-VL-4B размечает поток, человек проверяет пограничные случаи, а качество контролирует Golden Set. Стоимость точки разметки упала в 60 раз, 4,5 млн примеров собрали за пять дней.

Самый честный кейс в этой группе у AGIMA: детектор промпт-инъекций дообучали пять раз, в продакшен ушёл один раунд, три откатили из-за деградации. Ложные блокировки упали со 140 до 1 на 179 безопасных текстов. Пять раундов на один успешный это нормальная цена, просто о ней редко пишут.

3. Агентная цепочка живёт пять-шесть шагов

Про длину надёжной цепочки инструментов в 2026 году есть уже не мнения, а измерения. Петрович-Тех сравнил облачные и локальные модели в агентной обвязке: три модели (облачная Claude Sonnet, облачная Qwen3-235B и локальная Qwen3.5-9B на одной видеокарте) по трём сценариям, 27 запусков. Двухшаговая задача: успех во всех девяти прогонах, локальная 9B ничем не хуже. Трёхшаговая: локальная модель дала 100 процентов точности, облачные отклонились от инструкции. Пятнадцатишаговая: ни одного полного успеха из 27, и хуже всего то, что модели рапортовали о завершении, которого не было.

VK Tech с локальным ИИ-агентом на Ollama в закрытом контуре на арендованной A30 с двумя моделями (gpt-oss:20b и qwen3-vl:8b) получил ту же границу с другой стороны: надёжная работа до примерно шести последовательных вызовов инструментов.

Ответ на это ограничение тоже виден в кейсах, и он снова про обвязку. Команда GigaChain сделала профиль GigaChat для агентного фреймворка Deep Agents: десять промпт-блоков под классы отказов плюс middleware на уровне кода (LoopBreaker, ShellSafety, PathNormalizer). Точность GigaChat на 391 задаче выросла с 77 до 87 процентов, расход токенов упал почти вдвое. Модель не менялась.

Отсюда же рост MCP как корпоративного стандарта интеграции: платформа агентной разработки с mcp-hub в Авито, MCP-сервер дизайн-системы для агентов вёрстки в X5, MCP-сервер банковских операций для ИИ-агентов в Сбере. Агенту дают не «доступ к системам», а шесть-семь проверенных инструментов с контрактами.

4. Ассистент разработчика: узкая задача даёт разы, широкая даёт ноль

Здесь два ряда цифр, и они противоречат друг другу только на первый взгляд. Узкие задачи. X5 подключил агенту вёрстки знание реальной дизайн-системы через MCP: экран стал занимать 2-3 часа вместо 8, команда из трёх человек делает 10 экранов в день вместо трёх. КОРУС Консалтинг сгенерировал моделями утилиту для выгрузки метаданных Qlik Sense, около тысячи строк, за шесть часов и 15 промптов.

Широкая задача. Пилот агентной разработки в Авито на 100 инженерах с платформой из skills-hub, mcp-hub и Spec-Driven Development не дал статистически значимых изменений объективных метрик разработки. Качество не упало, удовлетворённость высокая, эффект в метриках отсутствует. Авито объясняет это J-кривой обучения и считает окупаемость так: при зарплате 2500 долларов и подписке за 100 достаточно ускорения на 4 процента, то есть 6,4 часа в месяц.

Вывод для тех, кто это покупает: измерять надо конкретный процесс (вёрстка экрана, ревью, разбор инцидента), а не «производительность разработчиков». В MWS так и сделали: агент разбора инцидентов закрывает 45 процентов задач полностью, 40 частично, 15 требуют проверки.

5. Деньги там, где метрика была до ИИ

Кейсы с подтверждённым рублём группируются вокруг процессов, где потери уже считали. ЕвроХим: ИИ-рекомендательная система на производстве удобрений одного цеха на «Невинномысском Азоте» дала 270 млн рублей за 2024 год. Что изменилось физически: качество продукции проверяли раз в четыре часа, стали каждую минуту. Нижнекамскнефтехим после ухода Aspen и Honeywell меньше чем за год запустил отечественную систему усовершенствованного управления и получил 61 млн рублей за первые три месяца промышленной эксплуатации. ИИ-антифрод «Нейрощит» Т-Банка предотвратил потери на 170 млн за полгода, ИИ-антифрод Сбера сохранил клиентам 360 млрд за 2025 год. Авито Подработка заменила ручные правила субсидий ML-моделью: связка CatBoost и линейного программирования на A/B-тесте снизила расходы на надбавки на 9,3 процента.

У LLM-проектов деньги тоже есть, но масштаб другой. RAG-помощник для сотрудников отделений ВТБ: поиск информации в 9 раз быстрее, 12 тысяч сотрудников, 75 млн рублей за 2025 год. ЦИАН перевёл модерацию объявлений на LLM: 2,2 млн объявлений в месяц, эффект 20-25 млн рублей в год. Это десятки миллионов, не миллиарды.

А вот у корпоративных LLM-платформ денег в кейсах пока нет, хотя охват впечатляет. Совкомбанк вывел LLM-платформу на 34 тысячи сотрудников, 4000 инициатив за год, 30 проектов агентов, финансовый результат не раскрыт. Северсталь на платформе генеративного ИИ «Да Винчи» подтвердила 40 гипотез из 80, PnL-эффект планирует показать в 2026 году. Корпоративная платформа доступа к ИИ-моделям «Нейрошлюз» Ростелекома обрабатывает 470 тысяч запросов в месяц от 40 тысяч сотрудников, экономия 100 млн в год по внутренней оценке. Платформа даёт охват. Рубль даёт цех.

6. Малые модели там, где нужна скорость, и экономия токенов как отдельная работа

Параллельно с гонкой больших моделей в кейсах живёт другая линия, и она чаще доходит до устройства в руках. Яндекс распознаёт быстрые голосовые команды в колонках сетью весом 0,5-1,5 МБ: ложные срабатывания минус 60 процентов, потребление памяти минус 50. YADRO делает нейросетевую цветокоррекцию камеры планшета сетью на 8000 параметров: снимок 12 Мп за 0,45 секунды. Smart Engines определяет ориентацию документа для OCR детектором на 110 тысяч параметров за 15 миллисекунд, быстрее PaddleOCR в четыре раза при той же точности.

Там, где без больших моделей нельзя, экономия стала инженерной дисциплиной. SberDevices в контекстной ИИ-справке для телевизоров семантическим кэшем на Qdrant снизили расход токенов на два порядка. VK Cloud описал в разборе деградации продакшен-инференса LLM, как PagedAttention и FP8-квантизация KV-кэша поднимают пропускную способность в 2-4 раза, а tail-aware планирование режет p99 на 35-50 процентов. Wildberries через AIOps-платформу управления GPU поднял утилизацию GPU на 62 процента на одном кластере. Если у вас в бюджете GPU это заметная строка, эти три кейса стоят прочтения целиком.

Что с этим делать

ИТ-директору: спрашивать у вендора не «какая модель», а «что стоит между моделью и моими данными» и «где порог, за которым человек». Кейсы с подтверждённым рублём в каталоге можно отобрать фильтром по экономическому эффекту, их там около сотни на две с лишним тысячи проектов.

Внедренцу: начинать с процесса, где потери уже измерены (брак, фрод, расход сырья, модерация), закладывать пять раундов дообучения на один успешный и не обещать цепочки длиннее шести шагов.

Считаю, что через год спор о том, чья модель лучше, уйдёт из корпоративных кейсов совсем. Останется спор об обвязке: чей семантический слой, чьи guardrails, чей MCP-хаб. В 2026 году в этом споре уже есть измеренные ответы, и они в кейсах выше.

Важная оговорка. Все суммы в каталоге названы самими компаниями, в их публикациях и карточках кейсов, независимой проверки эффекта нет. И в большинстве кейсов экономический эффект вообще не раскрыт, и это чаще не скрытность, значительная часть внедрений это пока пилоты и проверка гипотез, где считать ещё нечего. Поэтому цифры это то, что компании готовы показать, а не аудит.

Комментарии (21)


  1. ToxaBes
    22.09.2026 16:35

    1352 кейса внедрения ИИ в России: почему в продакшене побеждает не модель, а обвязка

    Потому что внедряющие в большинстве своем не умели правильно дообучать модели!

    Исторически так сложилось, что изначально методы дообучения были дороги и неоптимизированы, специалистов по этому делу практически не было (да и сейчас не так чтобы есть на рынке), да и сами модели были не сравнимы с текущими.

    Поэтому интеграторы брали модель как есть и пытались дотянуть до нужной точности/качества системными промтами, скилами и прочими обвязками.

    После чего эти решения худо-бедно переиспользовались на похожих проектах.

    Ситуация уже поменялась, но мало кто уже адаптировался к ней.

    По поводу статистики, у меня 120 кейсов в 18 отраслях для B2B интеграторов (могу выслать временный доступ на закрытый портал автору в личку для подтверждения своих слов). Так вот, в 87% побеждала именно модель и ее SFT. Приходилось и чужие системы дорабатывать таким образом, чтобы увеличить точность.

    Поэтому, по моему мнению, приведенная в статье статистика интересна сама по себе в историческом плане, но уже не отражает текущую реальность.


    1. boofer_obmena
      22.09.2026 16:35

      Теперь в ветке два измеренных вывода с противоположным знаком: 1352 кейса — побеждает обвязка, 120 кейсов @ToxaBes — в 87% модель с SFT. Подозреваю, оба правы, потому что статья сама содержит доказательства тезиса @ToxaBes точность у X5 с 79 до 92 поднялась на дообученных классификаторах, AGIMA дообучал детектор пять раз. Похоже, раскладка по типу задачи: узкие с измеримой точностью — выигрывает SFT и порог с человеком, открытые сценарии — семантический слой. Вопрос автору: можно ли фильтром каталога расщепить ту сотню рублёвых кейсов на эти два класса? Если расщепление подтвердится, спор рассосётся в классификацию.


      1. ToxaBes
        22.09.2026 16:35

        Я думаю, тут нужно разделять статистику по кейсам с локальными моделями до 100B внутри контура предприятия и по решениям с облачными моделями либо большими локальными (больше 100-200B). Такое деление вызвано целесообразностью и возможностю дообучения модели.

        Подозреваю, что выводы статьи полностью справедливы для решений с облачными и большими моделями, а мои наблюдения (и кейсы) лежат исключительно в on-prem решениях с моделями до 100B.


        1. boofer_obmena
          22.09.2026 16:35

          Деление по контуру напрашивается, но статья сама его осложняет: у Альфа-Банка локальная Qwen 35B стала предсказуемой не после дообучения, а после выноса детерминированной логики в сервисы на Go — обвязка в on-prem. VK Tech на локальном gpt-oss:20b нашли границу шести вызовов — тоже обвязка. А у VK дообученная Qwen3-VL-4B — маленькая модель, но SFT-история. Получается, малые локальные модели лежат по обе стороны. Ваше «возможность дообучения» кажется мне правильным механизмом, только работает он через другую ось — тип задачи: узкие с измеримой точностью выигрывают дообучением (дообучать можно только свою модель, поэтому у интеграторов on-prem это главный инструмент), открытые агентные сценарии — обвязкой. Вопрос по вашей выборке: много ли среди 120 кейсов открытых агентных задач — цепочки инструментов, RAG, свободный диалог? Если почти все узкие с целевой точностью, то ваши 87% и выводы статьи вообще не противоречат — просто режете одну карту по разным линиям.


          1. ToxaBes
            22.09.2026 16:35

            узкие с измеримой точностью

            Да, думаю вы правы.

            Вопрос по вашей выборке: много ли среди 120 кейсов открытых агентных задач — цепочки инструментов, RAG, свободный диалог? 

            Сложно сказать точно, но меньше половины, примерно 30-40%.


            1. boofer_obmena
              22.09.2026 16:35

              Спасибо, цифра полезная. Тогда любопытная арифметика: узких задач у вас 60-70%, а модель побеждала в 87% — получается, SFT выигрывал даже на части открытых агентных задач из ваших 30-40%? Если так, моя ось «тип задачи» неполная: похоже, своя модель в контуре расширяет зону дообучения на то, что в облачном мире лечится только обвязкой. Тогда ваши 87% и выводы статьи — два среза одной карты: интегратор с on-prem режет её там, где всё можно дообучить, облачный мир — там, где можно только обвязать. И был бы рад примеру: хоть один кейс из открытых, где дообучение решило то, что обычно лечат цепочкой инструментов и порогами?


              1. ToxaBes
                22.09.2026 16:35

                своя модель в контуре расширяет зону дообучения на то, что в облачном мире лечится только обвязкой

                Именно так! Я к этому собственно и пришел.

                UPD:

                И был бы рад примеру: хоть один кейс из открытых, где дообучение решило то, что обычно лечат цепочкой инструментов и порогами?

                Из недавнего:

                1. Дообучение модели в контекстуальном RAG для юридической фирмы. Перестала путать номера и даты, галлюцинировать и стала способна нормально сравнивать два документа.

                2. Этой весной дообучал локальную модель тк Claude Opus отказывался признавать что PHP 8.5.4 вышел, у клиента была задача переписать на свежую версию с PHP 7.4.6 (вроде), опус постоянно скатывался на 7ю ветку даже если проверял сами и отвечал что "да вы правы, такая версия уже вышла". Дообучил на отличиях + деталях проекта (код и отобранные git коммиты), модель переписала проект (не маленький) за несколько дней с учетом внутренних бизнес-сущностей и абстракций системы.

                3. Заказчику понадобилась расшифровка созвонов и совещаний для HR-департамента, а руководитель HR-направления картавила так сильно, что мне приходилось напрягаться, чтобы разобрать слова. Универсальные модели вроде Whisper не справлялись, дообучил на ее размеченной речи + добавил аугментацию по похожем случаям, в том числе мужским и все получилось.


                1. boofer_obmena
                  22.09.2026 16:35

                  Примеры сильные. Похоже, правило такое: знания частые и проверяемые — в контекст, большие и приватные — в веса. Как измеряли точность в юридическом RAG — или человек на пороге остался?


                  1. ToxaBes
                    22.09.2026 16:35

                    Похоже, правило такое: знания частые и проверяемые — в контекст, большие и приватные — в веса.

                    Не совсем так, дообучение плохо усваивает отдельные факты, но хорошо переносит нужные.. привычки (иначе и не сказать). Суть не в запоминании конкретных номерров или дат, а принципов работы с ними.

                    Как измеряли точность в юридическом RAG — или человек на пороге остался?

                    Проверял стандартно, сначала precision/recall, затем вместе с юристом MRR и версионирование (чтобы старые нормы не подтягивал).


      1. scheltsin Автор
        22.09.2026 16:35

        Посчитал по выгрузке, грубо, по ключевым словам. Из 221 кейса с суммой в рублях около 100 узкие задачи. антифрод, CV, предиктив, рекомендации. Открытых, где агенты, RAG и ассистенты, около 40. Если убрать “ожидаемый” и “по оценке”, остаётся 43 узких против 24 открытых, причём у открытых сумма чаще про весь портфель ИИ, а не про конкретный проект. Так что ваша ось подтверждается, спор скорее про классификацию.


        1. boofer_obmena
          22.09.2026 16:35

          Спасибо, что пошли в выгрузку. Итого: ~100 узких (SFT-территория), ~40 открытых (обвязка), а после отсева «ожидаемых» и «по оценке» — 43 к 24: у открытых цифры ещё и туманнее, чаще портфельные. Ваша выгрузка подтверждает ваш же пятый паттерн: честные деньги там, где метрика была до ИИ. Спор рассосался в классификацию, как и должно было.


  1. boofer_obmena
    22.09.2026 16:35

    Хочу понять, насколько можно доверять цифрам, на которых стоит статья. Из инструкции кейсов на платформе видно: публикуют вендоры из личного кабинета, дальше модерация — но про неё сказано только «будет комментарий с причиной». Про верификацию цифр эффекта — методика измерения, подтверждение заказчиком — не видно ничего, и анонимные заказчики («Крупный ритейлер») принимаются. При этом «подтверждённый рубль» — ключевая категория, по ней отобрано около сотни кейсов с деньгами. Что вкладывается в «подтверждённый»: проверка командой каталога или цифры берутся из самоотчёта вендора как есть?


    1. ToxaBes
      22.09.2026 16:35

      Эм, я думаю вполне можно доверять, какой смысл обманывать? Статья хорошая, просто в статистике сразу все (небольшие и большие on-prem и облачные модели) поэтому перекос в одних наиболее частых (исторически) кейсах кроет все остальные.

      Полайкал автору во всех местах жду еще статей, более подробных.


      1. boofer_obmena
        22.09.2026 16:35

        Проблема в несравнимости: у каждого вендора своя методика расчёта эффекта, и в каталог попадает то, что готовы показать. Каждая цифра честна — но это витрина, а не аудит, и сравнивать сотню таких цифр между собой можно с оговорками. Поэтому вопрос был к автору, и он в силе: что вкладывается в «подтверждённый» — проверка командой каталога или цифры из самоотчёта как есть? Сам каталог как карта того, что компании считают результатом, — полезная штука, мне как раз интересно, как он устроен внутри.

        Автору большой респект за работу. Лайки, подписки, колокольчики.


        1. ToxaBes
          22.09.2026 16:35

          Блин, а ведь вы правы (снова). Мы же видим верхушку айсберга и пытаемся мерять удава в попугаях.


          1. boofer_obmena
            22.09.2026 16:35

            Метафора прям из классики: удав, как известно, 38 попугаев и одно попугайское крылышко. В каталоге всё ровно так: у ЕвроХима свой попугай (эффект по цеху, внутренняя оценка), у ВТБ свой (9-кратное ускорение поиска при 12 тысячах пользователей), а у половины кейсов — то самое крылышко: «результаты в денежном выражении не раскрыты». И тогда вопрос с вашей стороны баррикад: заказчики у интеграторов вообще спрашивают, как посчитан эффект — методика, базис сравнения, до/после? Или все довольствуются цифрой со слайда? Сдаётся мне, что если даже покупатель не требует линейку, вендор её сам не заведёт — тогда попугаи с нами надолго.


    1. scheltsin Автор
      22.09.2026 16:35

      Да, все цифры от авторов кейса, из их публикаций и из карточек, которые они заполняют. Своего аудита эффекта , и “подтверждённый” в статье значит “названа сумма и период”, не больше. Тут, вы правы, это витрина, и сравнивать сотню таких цифр между собой надо с оговоркой. Добавлю её в текст.


      1. boofer_obmena
        22.09.2026 16:35

        Спасибо за прямой ответ и за оговорку в тексте — редкость.


  1. Cordekk
    22.09.2026 16:35

    Невиномысский азот мимо. Кейс не использованием генеративной нейросети, а модели вычисляющей показатели качества из параметров тех.процесса.

    ККачество не контролируется каждую минуту, а пересчитывают. Похожие системы Цифра запускала на нефтепереработке (конкретных сроков и данных у меня нет).

    Ну а самый показательный пример был на хабре про цементный завод https://habr.com/ru/post/596701/ тоже самое и точно без ИИ.


    1. ToxaBes
      22.09.2026 16:35

      Возможно, тогда просто не было технической возможности.

      За последние пару лет CV и VLLM шагнуло сильно вперед: например, теперь я могу сделать автоматический контроль флотации для горно-обогатительной фабрики или решение для автоматического извлечения допусков и материалов из обычных 2D-чертежей с генерацией DFMEA матрицы в машиностроении и приборостроении или ИИ понимающий ректификацинную колонну в нефтепереработке и тд.

      Еще 2 года назад это было практически невозможно сделать, но новые архитектуры и методы обучения сдвинули планку.


  1. Dhwtj
    22.09.2026 16:35

    Решает прокладка между рулём и сидением экраном и клавиатурой