MMLU простыми словами — что измеряет этот бенчмарк | AI Радар
Главная / Глоссарий / MMLU
Тестирование и оценка

MMLU

Обновлено 30 сентября 2026Александр ГригорьевТестирование и оценка

Один из самых известных международных бенчмарков, измеряющий знания и логику модели по десяткам академических дисциплин.

Весь глоссарий →

Коротко

  • MMLU (Massive Multitask Language Understanding) — бенчмарк, проверяющий знания модели по 57 академическим дисциплинам
  • Формат — вопросы с вариантами ответов, от математики и права до медицины и истории
  • Один из самых часто цитируемых бенчмарков при сравнении топовых LLM
  • Критикуется за то, что современные топовые модели уже показывают результаты, близкие к максимуму, что снижает различающую способность теста

Определение

MMLU (Massive Multitask Language Understanding) — это один из наиболее широко используемых международных бенчмарков для оценки языковых моделей, включающий тысячи вопросов с несколькими вариантами ответа из 57 разных предметных областей — от элементарной математики и физики до юриспруденции, медицины и истории искусств.

Широкий охват дисциплин делает MMLU удобным общим индикатором «энциклопедических знаний» модели, но у теста есть известные ограничения: по мере роста возможностей топовых моделей их результаты приближаются к теоретическому максимуму, из-за чего тест хуже различает качество между лучшими современными моделями, чем несколько лет назад.

На практике

MMLU часто упоминается в пресс-релизах о выходе новых моделей как один из ключевых показателей, но специалисты рекомендуют смотреть на него в сочетании с другими, более специализированными и сложными бенчмарками для полной картины.

Частые вопросы

Что означает высокий результат в MMLU?

Модель хорошо справляется с вопросами по широкому кругу академических дисциплин в формате выбора варианта ответа — это индикатор общих «знаний», но не гарантия качества в открытых, творческих или узкоспециализированных задачах.

MMLU подходит для оценки русскоязычных моделей?

Тест ориентирован преимущественно на английский язык, поэтому для оценки работы с русским языком лучше подходят специализированные бенчмарки вроде MERA.

Почему топовые модели показывают похожие результаты в MMLU?

Потому что современные лучшие модели уже близки к теоретическому максимуму теста, из-за чего он теряет различающую способность между ними — отсюда потребность в более сложных и новых бенчмарках.

Как сослаться на эти данные
Radarii.ru, «MMLU», обновлено 30 сентября 2026. Ссылка: radarii.ru/glossary/mmlu