Пара вводных слов, чтобы было понятно о чем речь
Всем привет!
Я обещал написать эту статью и я наконец‑то закончил тесты и готов поделиться с вами результатами.
Я потратил МНОГО времени на то, чтобы прогнать эти бенчмарки. Много времени на сетапы, много времени на ожидание тестов. Все вместе заняло около двух недель работы — модели обрывались, где‑то нужно было костылять заплатки чтобы они отвечали, где‑то просто ждать по несколько дней на прохождение теста (даже в многопоточном тестировании).
Наконец‑то я получил ответы, которые мне интересны — и, надеюсь, будут интересны и вам, и создателям Алисы и Гигачата. Почему они сами не проходят такие бенчмарки я догадываюсь, но на месте руководства этими проектами я бы наоборот, поставил бы прохождение бенчмарков в цикл. Потому что только так можно понять где твоя модель, а где мировые лидеры.
Я хотел сделать бенчмарк и Маракуйи ИИ, но ребята ушли в глубокий рефакторинг и обещают скоро вернуться с совсем новым продуктом — отечественной кодовой средой, аналогом Cursor, Claude Code, Codex, но без VPN, иностранных карт и вообще суверенное решение. Поэтому, к сожалению, в этой статье я поделюсь результатами только трех моделей: Алиса, Гигачат Ультра, Гигачат Макс, а Маракуйю оставлю видимо на потом и на отдельную статью.
Алиса тестировалась через веб‑коннектор — именно так, как с ней взаимодействуют пользователи. В 90% случаев она в процессе оправдывалась: «Сейчас повышенная нагрузка, поэтому я включаю модель попроще». Но тест на то и есть тест: именно так с ней и взаимодействуют пользователи и именно такой результат они и получают. Гигачат — тестировался по АПИ. Бесплатных токенов, которые дают при регистрации, не хватило — поэтому я тестировал с трех аккаунтов: двух своих и с аккаунта жены. Этого хватило.
Важно про Алису: тестировалась Алиса, доступная пользователям. Алиса для бизнеса, которая появилась в Алиса 360, не тестировалась — она вышла недавно и пока что руки не дошли до нее. Вероятно, она покажет немного лучший результат; но судя по моему персональному опыту работы с ней, шансов на это не так чтобы много.
Ну вот и все о чем стоило бы рассказать перед тем, как я поделюсь результатами, а сами результаты — ниже.
Зачем гонять чужие бенчмарки
Русский чат легко проверить на «напиши стихотворение». Мне нужно было другое: держит ли он форму, когда задание длинное, на английском, с правилами и несколькими репликами подряд. Западные лаборатории для этого давно собрали открытые наборы задач. Я прогнал по ним отечественные чаты — одни вопросы, одни правила счёта.
Сначала модель отвечает как обычный чат, каждый пункт — новый диалог. Потом отдельный судья читает готовые ответы. Здесь это Grok 4.6. Если связь оборвалась и вопрос до модели не дошёл, попытку не считаю и повторяю. Если чат вернул пустоту или свою ошибку сервера — это ноль, а не «у нас сломался браузер».
Кто в сравнении
Алиса — чат на alice.yandex.ru с подпиской Яндекс Плюс. Человек в стране открывает сайт, поэтому я тестировал сайт.
GigaChat Max и GigaChat Ultra — два тарифа Сбера. Их нельзя склеить в одну строку: Ultra сильнее на длинном тексте и на задачах с инструментами, Max дешевле и слабее на тех же вопросах.
Arena‑Hard — кто пишет лучше на трудном задании
Два ученика, одна сложная контрольная: код, кейс, длинная инструкция. Учитель не ставит «пять из пяти», а говорит, чей лист лучше. Так устроен Arena‑Hard: 750 тяжёлых заданий, ответы сравниваются парами — победа, поражение или ничья. Победа уходит тому, кто довёл расчёт и закрыл пункты.
У каждой пары два столбика. Левый — доля побед модели слева в названии, правый — справа. Ничья входит в 750, на графике её нет. 83% у Max против Алисы значит: из 750 пар учитель отдал лист Max в 620 случаях, Алисе — в 106, ничья — 24.

На сложных письменных задачах Ultra чаще даёт полный и технически верный ответ, Max — заметно чаще Алисы. Алиса выигрывает там, где соперник отказывается или ломает условие. Порядок: Ultra, затем Max, затем Алиса.
Результаты мировых моделей для сравнения - не проводил дуэли с Алисой/Гигачатом, поэтому тут нет смысла показывать лидеров в мире.
WildBench — длинный рабочий чат
Обычный рабочий день с ассистентом: длинные треды, чеклисты, «доделай», «перепиши мягче», «учти прошлый абзац». WildBench — 1024 таких разговора. Судья ставит оценку от 1 до 10 за весь ответ. Пятёрка — «нормально, без блеска». Ниже пяти — слабее обычного. WB‑Score — та же шкала, сдвинутая так, чтобы пятёрка стала нулём: (средняя − 5) × 2. Минус на ней не значит «ноль ответов», а «средняя ниже пяти».

Алиса в среднем чуть ниже «нормально», Max чуть выше, Ultra увереннее держит длинный чат. Разрыв небольшой, порядок тот же: Ultra, Max, Алиса.
Результаты моделей в мире:
Место |
Модель |
WildBench WB Score |
|---|---|---|
1 |
Qwen3 235B A22B 2507 |
86,6 |
2 |
GPT-5.1 |
86,3 |
3 |
Kimi K2 |
86,2 |
4 |
o3 |
86,1 |
5 |
Gemini 3 Pro |
85,9 |
6 |
GPT-5 |
85,7 |
7 |
Gemini 2.5 Pro |
85,7 |
8 |
GPT-5 mini |
85,5 |
9 |
o4-mini |
85,4 |
10 |
Claude Sonnet 4.5 |
85,4 |
11 |
GPT-4.1 |
85,4 |
12 |
Claude Opus 4 |
85,2 |
13 |
Grok 3 |
84,9 |
14 |
GPT-OSS-120B |
84,5 |
15 |
Claude Haiku 4.5 |
83,9 |
MultiChallenge — память и послушание в диалоге
Диалог из нескольких реплик. В середине пользователь меняет правило, просит учесть сказанное раньше, правит текст. Модель отвечает на последнюю реплику. Судья говорит только «да» или «нет»: попал ли финальный ответ в критерий.
Четыре оси. Память — не забыть факт из начала разговора. Инструкция — не соскочить с правила, которое задали по ходу. Редактирование — править текст, а не писать заново мимо задания. Согласованность — не противоречить своему же предыдущему ответу.
46% у Ultra — примерно каждый второй финальный ответ попал в критерий. 15% у Алисы — примерно каждый седьмой. Для бытового чата это жёсткий экзамен: критерии узкие, история длинная.

Ultra вдвое чаще Max закрывает условие в конце длинного диалога. Алиса чаще теряет правило по пути. На «перепиши версию» все трое слабее, чем на память факта.
Как проходили другие модели:
Gemini 3.1 Pro Preview — 71,4%
GPT-5.4 — 69,2%
Qwen3.5-397B-A17B — 67,6%
Qwen3.5-122B-A10B — 61,5%
Kimi K2.5 — 61,4%
Claude Opus 4.7 — 58,6%
τ³ — агент в колл‑центре
Модель сажают на место оператора. У неё правила компании и кнопки в учебной CRM: найти клиента, поменять билет, провести возврат. С другой стороны говорит симулятор клиента — в этом тесте везде Ultra. Зачёт только если задача закрыта по правилам с первого раза. Можно красиво извиниться и провалить возврат — балл не зачтётся. Три мира: авиабилеты, розница, телеком.
Число 0,66 у Ultra — доля успешных разговоров из 278. Алиса в среднем 0,076, Max 0,119. Ultra уходит вперёд за счёт телекома и розницы.

Ultra умеет закрывать тикет по правилам, особенно в телекоме. Max чаще срывает процедуру. Алиса на авиа далеко даже от Max, на рознице почти не закрывает сценарий, на телекоме внезапно немного обогнала Max.
Результаты в мире (retail & telecom):
Модель |
Pass@1 |
|---|---|
Qwen 3.5 397B A17B |
84,4% |
GPT-5.2 |
81,6% |
Claude Opus 4.5 |
79,6% |
Gemini 3 Flash |
76,8% |
Gemini 3 Pro |
75,9% |
GLM-5 |
73,7% |
Claude Sonnet 4.5 |
72,4% |
Скорость ответа
Отдельная ось: сколько секунд чат думал, пока писал ответ. Это не качество. Алиса на Arena отвечает быстрее. Ultra на MultiChallenge отвечает быстрее Max.

Arena / WildBench / MultiChallenge, секунды: Алиса 9,6 / 10,4 / 19,2; Max 15,6 / 20,8 / 10,9; Ultra 17,9 / 21,6 / 10,7.
ПРАКТ-120 — работа с файлами и вебом
Это — самый интересный тест из всех. Он определяет как модель ведет себя в агентских задачах, которые реапьно нужны людям, то есть то, с чем фактически приходят люди к ИИ. Об этом тесте я писал в этой статье.
Кратно, что такое ПРАКТ-120: это 120 рабочих задач «как у человека в офисе с ChatGPT». Модели дают бриф и, где нужно, дают файлы в обработку. На выходе ждут текст с источниками, например в формате Word, или исправленную таблицу Excel, или ответ по пачке документов, и так далее. Эксперт ставит 0–100: правильность, полнота, следование инструкции, источники, пригодность в деле.
Поиск, 30 задач. Открытый веб, входных файлов нет. «Собери факты, укажи источники».
Документы, 30 задач. Ответ должен сидеть в выданной пачке. Выдуманная цитата режет балл.
Word, 25 задач. Нужен настоящий файл.docx, не текст в чате.
Excel, 25 задач. Нужен настоящий.xlsx с расчётом, не картинка таблицы.
Сквозные, 10 задач. Найти, посчитать, оформить документом.

Как выадются оценки: нет обязательного файла на выходе — ноль. Критическая выдумка, которая меняет решение, — не выше 49. Среднее по всем 120 задачам включает нули. Word, Excel и сквозные у всех троих — ноль: настоящего документа они не отдали.
Внезапно, Алиса, вебовская, почти на уровне Гигачата Ультра. Ультра лучше работает с документами, Алиса вытащила себя буквально за волосы за счет поисковика. Это и неудивительно, с Яндекс поиском в кармане.
Что из всего этого следует
На письменных и диалоговых тестах картина одна. Ultra сильнее Max, Max сильнее Алисы. Разрыв большой на Arena и MultiChallenge, спокойнее на WildBench: там все трое живут около школьной «четвёрки‑пятёрки».
τ³ добавляет другое измерение: умение закрывать заявку по правилам в учебной CRM. Ultra здесь уходит далеко вперёд (0,66). Max и Алиса обе около 0,08–0,12 и практически бессильные.
Для офиса с файлами ПРАКТ важнее «напиши эссе»: Word и Excel у всех троих ноль, Ultra выигрывает за счёт работы с выданными документами, Алиса — за счёт поиска в вебе. Работать с файлами нормально из этих моделей никто не умеет (забегая вперед — Алиса для бизнеса наконец‑то научилась работать более чем с одним файлом и даже появился какой‑то RAG внутри; работает пока что криво‑косо, автономии практически нет и каждые 5 минут надо тыкать палочкой чтобы продолжала — но это предмет следующих тестов).
Что еще из важного: письменные ответы оценивал Grok 4.6 Extra High. Другой судья может сдвинуть проценты. Порядок силы на этих трёх чатах совпал на Arena, WildBench и MultiChallenge. Это уже повод относиться к Ultra как к сильному отечественному чату на длинном тексте, к Max — как к середняку той же семьи, к Алисе — как к быстрому потребительскому чату, которому на жёстком ТЗ чаще не хватает полноты, и которая, спустя столько лет, все еще больше развлекушка, чем что‑то полезное в реальных задачах.
Для тех, кто хочет изучить результаты (и может быть со мной посмотрить, найти неточности или косяки, или просто вникнуть в результаты) — архив с результатами тут.
Мое следующее приключение
Прямо сейчас я занимаюсь очередным мазохизмом: я пытаюсь прогнать Гигачат и Алису 360 через два самых сложных бенчмарка, которые наверное существуют в природе: OS World и Terminal Bench 4.
Предварительно скажу так: оценка 0 у всех. Грешил на настройки моей инфраструктуры, но судя по всему нет — модели просто не справляются. Возможно, эти тесты в принципе не скормить им снаружи, будучи обычным пользователем и не частью команды Алисы/Сбера, или без специального доступа к какому‑нибудь АПИ. В общем если это читают разработчики Гигачата/Алисы и у вас есть желание независимого бенчмарка на том, на что смотрит весь мир — напишите мне в диалоги, проведем бенчмарки вместе.
Всем спасибо, надеюсь статья была интересная и может быть кому‑то даже полезная.
Комментарии (4)

AlekseyPraskovin
18.09.2026 08:24Зачем это? Вы типа к чебурнету готовитесь? Есть же нормальные модели и нормальные инструменты.

Hau515 Автор
18.09.2026 08:24Вам чем-то мешает исследование возможностей отечественных моделей?
И да, к чебурнету стоит приготовиться, законы о запрете иностранных ИИ уже готовятся. И огромное количество структур - госы, силовики, медики, разработчики суверенного софта и многие другие уже не могут пользоваться иностранными ИИ, и дальше будет только жестче.
И дело даже не в умении ВПН настроить или прокси поднять. Дело в том, что очень большое количество компаний уже сейчас не готово отправлять свои данные в иностранные ИИ.
pzolnikov
В большинстве подобных задач решает агентная обвязка, а не веса модели.
Hau515 Автор
Вы совершенно правы. Обвязка бралась стандартная. Ни Алиса, ни Гигачат обвязку не дают (по крайней мере я не нашел где ее взять), поэтому для Алисы использовались обвязка ее стандартная, для Гигачата - те стандартные, что нашлись к бенчмаркам.