Открытый российский бенчмарк для комплексной оценки языковых моделей на русском языке.
MERA — это набор стандартизированных тестов (бенчмарк), созданный для объективной оценки способностей языковых моделей работать с русским языком: от базового понимания грамматики до решения задач на логику, знание фактов и следование инструкциям на русском.
Необходимость в таком бенчмарке возникла потому, что большинство международных тестов для LLM ориентированы на английский язык, и модель, хорошо показывающая себя в этих тестах, не обязательно так же хорошо работает с русским языком, его грамматическими особенностями и культурным контекстом.
Результаты MERA публикуются в открытом лидерборде, что позволяет разработчикам, бизнесу и исследователям сравнивать российские и зарубежные модели по единой, воспроизводимой методологии, а не полагаться только на маркетинговые заявления вендоров.
MERA — открытый академический бенчмарк с фиксированным набором задач, Полярный тест — независимое сравнение AI Радар с собственной методологией оценки моделей на практических сценариях.
Бенчмарк открытый — им может воспользоваться любой исследователь или компания для оценки собственной или чужой модели по стандартной методологии.
Основной фокус — языковые модели, но название (Multimodal) указывает на постепенное расширение охвата и на мультимодальные задачи в будущих версиях бенчмарка.