Всем привет, с вами команда MERA.

В прошлом анонсе мы рассказали о новых публичных тестах на рассуждения и обещали, что следующим большим обновлением станет основная текстовая часть MERA. Пришло время выполнить обещание: представляем MERA Text 2.0 — новую версию текстового бенчмарка и, по сути, переосмысление, что сегодня имеет смысл измерять у фундаментальных текстовых языковых моделей.

Первую версию MERA мы начали создавать ещё в 2023 году. В то время бенчмарки хорошо разделяли модели в задачах, которые сегодня кажутся намного проще: знания о мире, логика, причинно-следственные связи, понимание текста, профессиональные и предметные знания. Во многих из этих задач даже сильным моделям было куда расти, и сам факт успешного решения уже многое говорил об их возможностях.

За три года картина заметно изменилась. Модели стали значительно умнее, а вместе с ними изменились и требования к оценке. На прежнем бенчмарке MERA современные SOTA-модели уже достигают, а в отдельных задачах и превышают результаты человека (Human Baseline). Часть тестов постепенно насыщается: верхняя часть бенчмарка сжимается, разница между сильными моделями становится всё менее заметной, а некоторые задачи просто перестают давать нам достаточно новой информации.

Для бенчмарка это естественный жизненный цикл. Если несколько лет назад вопрос был, скорее: «умеет ли модель это делать вообще?», то сегодня всё чаще приходится спрашивать: «где проходят реальные границы её возможностей?».

Поэтому мы решили не просто добавить в старый бенчмарк ещё несколько датасетов. Вместо этого мы пересобрали текстовую оценку вокруг групп навыков, которые пока ещё остаются сложными и содержательными для современных моделей.

Что входит в новую линейку тестов?

В новой версии мы разделили задачи на четыре группы: Human-Centric, Culture-Specific, Agentic и Reasoning. В каждой — по три теста.

Название сета

Количество

примеров

Общее количество

токенов на сет

Среднее число

токенов на один пример

Characters

640

504974

789

Enantiosemy

506

169256

334

GorillaHard

1169

6511730

5570

Humor

600

454949

758

IFHardBench

1260

231505

184

NewReasoning

370

137084

370

Riddles

500

36882

74

RUBIN

783

89781

115

RussianRegions

603

209848

348

SAGE

1000

242333

242

SOBHard

825

6100810

7395

LIMUR

423

119490

282

Человекоцентричность (Human-Centric): понимает ли модель контекст человека

Здесь нас интересуют вещи, которые человеку обычно кажутся естественными: метафоры, юмор, характер собеседника, контекст и неписаные правила коммуникации.

Тест Riddles проверяет способность разгадывать русскоязычные загадки: собирать объект по отдельным признакам, понимать метафоры и языковую игру и при этом не терять подробности условия. Для теста подготовили набор данных из 500 загадок, ответы на которые нельзя просто найти в интернете.

Пример загадки из датасета: "Серёжки для простаков."

Ответ: "Лапша"

Отсылка к устойчивому выражению «Лапша на уши». Именно такие короткие задания иногда оказываются для моделей неприятнее длинной логической задачи.

Тест Humor (Юмор) проверяет уже не просто способность заметить, что текст смешной. Модель должна определить, за счёт чего работает шутка, а затем найти среди других текстов пример с тем же механизмом. Всего в датасете 600 примеров и 12 классов: от игры слов, абсурда и обмана ожиданий до иронии и контрольного класса «не анекдот».

Например, модель получает короткий анекдот про профессора, студента и неожиданный ответ на вопрос: «как забить червяка в землю», а затем должна не просто сказать «это смешно», а классифицировать механизм юмора и найти другой текст того же класса.

Тест Characters (Персонажность) — тест на понимание персонажа. Модель получает описание нескольких героев с разным возрастом, кругом знаний, манерой речи и ограничениями, а затем должна понять, какой ответ мог или не мог дать конкретный персонаж. В датасете 640 заданий четырёх типов.

Например, одна из героинь — 25-летняя киноманка Аля. На вопрос: «Аля, какой фильм Лантимоса ты любишь больше всего?» модели нужно выбрать ответ, который соответствует одновременно её знаниям, возрасту, характеру и стилю общения, а не просто наиболее фактологичный вариант.

Культурная специфика (Culture-Specific): русский язык и культурный контекст

Хорошо отвечать на русском языке и хорошо понимать русскоязычную среду — не одно и то же. Поэтому в отдельную группу мы вынесли региональную лексику, культурный код и работу с реальным русским текстом.

Тест RussianRegions проверяет знание российских регионализмов и способность правильно интерпретировать их в контексте. Задачи охватывают понимание региональной лексики, сопоставление её с кодифицированным русским языком и определение региона происхождения выражения.

Например, модель получает несколько совершенно естественно выглядящих предложений со словами вроде «толчёнка», «скубались», «жидрики» и «дебилизатор» и должна определить, в каком тексте регионализм употреблён без смысловой ошибки.

Тест SAGE — задача на автоматическую коррекцию русского текста. Здесь мало просто «писать грамотно»: нужно найти орфографические, пунктуационные, морфологические и другие ошибки, исправить их и при этом не переписать автора заодно — сохранить смысл, стиль, разговорную лексику и форматирование.

Например, в реальном пользовательском отзыве модель должна понять, что «одела с застегнутым замком» следует исправить на «надела с застёгнутым замком», расставить пунктуацию и поправить другие ошибки, но не превращать отзыв в литературно отредактированный текст.

Тест RUBIN проверяет уже непосредственно русский культурный код: мемы, сленг, песни, кино, фольклор, поговорки, скороговорки и другие вещи, смысл которых возникает не только из слов, но и из культурного контекста. В текущий релиз вошло 783 тестовых задания.
Один из вопросов выглядит так: «Какая реакция из ролика с падающей в реку сиба-ину стала мемом о неудачах?» Среди вариантов ответа — «Это фиаско, братан». Для носителя культуры ответ практически мгновенный; для модели это проверка того, насколько хорошо она действительно понимает русскоязычный культурный контекст.

Агентные (Agentic): базовые навыки, без которых не получится агент

Здесь мы не пытаемся измерить сложного автономного агента целиком. Вместо этого раскладываем агентные сценарии на базовые способности самой модели: следование инструкциям пользователя, структурированный вывод и выбор инструментов.

Тест IFHardBench проверяет сложное следование инструкциям. Каждый из 1260 запросов сочетает простое содержательное задание с тремя-шестью формальными требованиями, каждое из которых проверяется детерминировано, любое нарушение можно точно локализовать.

Например, модель просят рассказать, чем она занимается в свободное время, но одновременно требуют:

  • ровно четыре абзаца;

  • ровно три предложения в каждом;

  • повторить последнее слово первого абзаца в последнем;

  • получить ровно 492 символа с пробелами;

  • и нигде не использовать букву «п».

Содержательно задача элементарная, но удержать все ограничения одновременно не так просто. Это не английский бенчмарк IFEval, наш тест вдохновлён им, но собран с нуля.

Тест SOBHard проверяет структурированность ответа в сценариях, близких к реальным конвейерам обработки данных. Модель получает настоящий документ — иногда два, — и должна преобразовать его в другой формат без потери структуры и значений, или внести изменения, составить схему, достать информацию. В тесте 825 вопросов, 11 семейств операций, 15 входных и 6 выходных форматов. Среди задач есть convert (конвертация одного формата в другой), extract (извлечение информации по заданному условию), repair («починка» документа с ошибками), transform (преобразования документа без изменения формата), patch (применить операции к документу), diff (поиск различий в документах), merge (объединение двух документов в один) и многоходовые session-сценарии.

То есть вместо условного «верни JSON» модель может получить большой YAML, CSV или XML, применить к нему несколько заданных преобразований и вернуть целый документ в нужном формате. Ошибка в одном значении из тысячи — тоже ошибка: такие ответы дальше уже не проходят. Именно поэтому проверка здесь полностью детерминирована, её можно построить на чётких и понятных правилах.

Тест GorillaHard проверяет базовое использование инструментов. Не путайте его с оригинальным Gorilla benchmark: наш набор вдохновлён самим классом задач, но собран с нуля.

В каждом из 1169 заданий модель получает каталог из 14-22 инструментов, файлы и пользовательский запрос. Она должна решить, нужен ли один вызов, последовательный план, несколько независимых вызовов, уточнение или вообще отказ. Дополнительно в заданиях встречаются похожие инструменты-двойники, невыполнимые запросы, неоднозначности и спрятанные в файлах инструкции.

Например, пользователь спрашивает значение integrity у dependencies.date-fns в приложенном package-lock.json. Из 22 доступных инструментов модель должна выбрать правильный и сформировать:

{"tool": "json.value_at", "args": {"path": "app/package-lock.json", "pointer": "dependencies.date-fns.integrity"}}

То есть мы проверяем не выполнение инструмента, а способность самой модели правильно спланировать его вызов и указать нужные аргументы в предоставленном контексте.

Рассуждения (Reasoning)

Последняя группа тестов посвящена задачам, где нужно работать с неоднозначностью, удерживать условия и действительно разбирать структуру задачи.

Тест Enantiosemy проверяет понимание энантиосемии — слов и выражений, которые в одной и той же форме могут иметь противоположные значения в зависимости от контекста. Классический пример — «прослушать»: это может означать как внимательно что-то выслушать, так и пропустить, не услышать.

В одном из заданий слово «стишки» появляется в явно положительном контексте: ребёнок поздравил маму, а она называет его стихи «замечательными». Модель должна заметить, что продолжение «простенькие, неказистые… ужас» уже противоречит заложенному значению слова в этом контексте.

Тест NewReasoning — набор коротких задач на рассуждение с логическими ловушками, изменением условий и нарушением привычных шаблонов решения. В датасете есть задачи на дедуктивное, индуктивное, причинно-следственное, аналогическое и другие типы рассуждения.

Например:

Матери 55 лет. У неё три дочери: 15, 7 и 21 год. Через сколько лет возраст матери будет равен сумме возрастов дочерей?

Правильный ответ — через 6 лет. Простая арифметика, но сначала нужно правильно заметить, что за каждый прошедший год возраст матери увеличивается на один, а суммарный возраст трёх дочерей — сразу на три.

Тест LIMUR (LInguistic aMbigUity Resolution) проверяет разрешение референции, синтаксическую неоднозначность и способность извлекать смысл из грамматики даже тогда, когда привычная лексическая семантика исчезает. Тест состоит из двух примерно равных частей: задачи в стиле Russian Winograd Schema и задачи с нестандартной или искусственной лексикой. Человек способен понять смысл даже из фразы вроде «Глокая куздра штеко будланула бокра и курдячит бокрёнка»: корней мы не знаем, но окончания, суффиксы и синтаксис всё равно дают информацию о том, кто что сделал и с кем. LIMUR проверяет, умеет ли модель пользоваться этими сигналами, а не только знакомыми словами.

Все тестовые наборы новой линейки MERA Text 2.0 приватные: модели не видят ответы, что снижает риск контаминации и сохраняет ценность бенчмарка по мере появления новых моделей. Структура промптов также изменилась: каждый тест имеет не менее пяти различных формулировок инструкции, которые позволяют избежать смещения модели в сторону одной конкретной. Сами промпты составлены по простой схеме: если в задаче мало смысловых блоков, то они отделены друг от друга простыми переносами строки и подписываются «тегом» (Задача, Контекст, Формат ответа, Вопрос, Варианты ответа и так далее). Если полей много, то для различения между ними вводятся XML-теги, которые являются на данный момент обычной практикой для SOTA-моделей.

Как собирается рейтинг на сайте?

Итоговый скор модели рассчитывается в три этапа: сначала объединяются метрики каждого теста, затем результаты тестов внутри групп, а после — скоры всех групп. На каждом этапе используется геометрическое среднее, поэтому отдельные аномально высокие значения слабее влияют на итог, чем при обычном среднем арифметическом, а стабильные результаты учитываются лучше. Если отдельное значение равно нулю, то при расчёте оно заменяется на 0,01, поскольку иначе один ноль обнулил бы весь итоговый скор.

Расширяемость бенчмарка — одно из ключевых свойств выбранной агрегирующей метрики и архитектуры: отдельные метрики, тесты и целые группы можно добавлять или удалять без изменения логики расчета. Каждый новый элемент включается на своём уровне — метрика в тест, тест в группу, группа в итоговый скор, — поэтому структура остаётся целостной и не превращается в плоскую таблицу. Для корректного сравнения достаточно пересчитать результаты всех моделей по одной и той же версии набора тестов.

История предыдущих прогонов никуда не исчезает. В личном кабинете остаются старые сабмиты и их результаты, а отправлять новые замеры можно по привычному процессу.

При этом публичный текстовый бенчмарк теперь один — MERA Text 2.0. Предыдущую версию мы замораживаем: она остаётся частью истории MERA, но публичный рейтинг по ней больше не изменяется.

Дополнительные степени свободы, которые могут влиять на итоговый результат, убрали из сравнения. Мы не подбираем отдельные промпты или постобработку под конкретную модель: протокол каждого задания зафиксирован заранее, параметры запуска и логи сохраняются, чтобы результат можно было воспроизвести.

И отдельно про «обвязки» (harness). Мы оцениваем прежде всего возможности самой модели, поэтому не добавляем агентные, reasoning- или tool-обвязки, которые могли бы решить часть задачи и повлиять на метрики. Технический фреймворк для запуска оценки остаётся прежним, но он не становится ещё одной интеллектуальной системой поверх оцениваемой модели.

Для полноценных средовых и агентных сред и harness в экосистеме MERA предполагаются отдельные направления.

Корректность итоговой оценки — не единственное требование к бенчмарку: полный замер должен оставаться удобным и на практике. Поэтому в новой версии размер бенчмарка сократился с 23 датасетов и примерно 37 000 запросов до 12 датасетов и примерно 8700 запросов (суммарный объём по количеству запросов уменьшился в 4,3 раза), что при сопоставимых условиях позволяет выполнять полный прогон ощутимо быстрее.

Результаты

На старте MERA Text 2.0 мы провели оценку ряда актуальных открытых и закрытых моделей. Результаты опубликованы непосредственно в бенчмарке вместе с разрезами по группам навыков.

Мы сознательно не дублируем здесь статический рейтинг: по мере появления новых моделей и сабмитов результаты будут обновляться, поэтому актуальным источником остаётся сам бенчмарк.

Что показывают результаты?

Геометрическое среднее обеспечивает более сбалансированную агрегированную оценку и при этом сохраняет различия между результатами. Просадка в одной из групп навыков, которая при обычном усреднении могла бы компенсироваться высокими результатами в остальных группах, в данном случае остаётся заметной и позволяет точнее отражать профиль возможностей модели.

Группа «Культурная специфика» демонстрирует наибольший потенциал для дальнейшего улучшения и при этом слабее других связана с общим уровнем модели.

Группа «Agentic» обладает наибольшей дифференцирующей способностью: лидирующие модели показывают на этих задачах высокие результаты, тогда как модели следующего уровня заметно им уступают.

SOTA-модели демонстрируют стабильно высокие и близкие результаты на задачах рассуждения. Это отражает существенный прогресс современных моделей именно в reasoning-задачах и согласуется с результатами лидерборда MERA Reason.

Одновременно всё заметнее становится более общая проблема современной оценки: существующие бенчмарки быстро насыщаются по мере роста качества SOTA-моделей. В результате верхняя часть лидербордов сжимается, различия между моделями сокращаются, а тесты постепенно теряют разделяющую способность. Поэтому всё сложнее создавать оценки, которые одновременно остаются содержательными, воспроизводимыми и позволяют выявлять реальные границы возможностей современных моделей.

Базовые способности современных LLM уже во многом хорошо покрыты существующими бенчмарками, многие из которых достаточно быстро достигают насыщения. Поэтому в MERA Text 2.0 мы не стремились охватить все возможные сценарии использования моделей. Полноценное взаимодействие со средами, длительные агентные сценарии и сложные сквозные конвейеры намеренно оставлены за пределами этой ветки. MERA Text 2.0 сфокусирован именно на измерении возможностей текстовых моделей.

В заключении

Если вы разрабатываете русскоязычную модель — присылайте результаты на лидерборд. Чем больше в нём моделей разных классов и размеров, тем полезнее становится сама оценка и тем лучше видно, какие способности уже насыщаются, а где у индустрии всё ещё остаётся пространство для роста.

Этот релиз стал возможен благодаря совместной работе участников Альянса в сфере искусственного интеллекта. Партнёры и члены Альянса внесли вклад в создание и развитие наборов задач, которые легли в основу новой версии, а MERA объединила их в единую инфраструктуру оценки.

Комментарии (0)