Исследователи из Калифорнийского университета в Беркли представили новый бенчмарк «Agents' Last Exam» — набор из более чем 1500 задач, подготовленных практикующими экспертами по 55 различным профессиям: от юриспруденции и медицины до инженерии и финансового анализа. Принципиальное отличие от привычных академических тестов вроде MMLU или GPQA в том, что задачи здесь смоделированы по образцу реальной профессиональной работы — это не тесты с выбором одного правильного ответа, а комплексные кейсы, требующие последовательных агентных действий, работы с неполной информацией и профессиональных суждений, которые нельзя свести к одному «правильному» варианту.
Задачи разбиты по уровням сложности — от базового, сопоставимого с рутинной работой junior-специалиста, до высшего, требующего экспертизы уровня практикующего профессионала с многолетним стажем. Именно такая градация и позволила исследователям показать не просто «средний балл» модели, а то, где именно проходит граница возможностей современных LLM — и граница эта, как выяснилось, проходит гораздо раньше, чем предполагали разработчики моделей, ориентирующиеся на более простые академические бенчмарки.
Результаты оказались отрезвляющими для всей индустрии. Лучший результат показала GPT-5.5 от OpenAI — но и она справилась лишь с 24% заданий. В тестирование также вошли Claude Fable 5 от Anthropic, Composer 2.5 от Cursor и Gemini 3.1 Pro от Google — ни одна из моделей не смогла преодолеть даже планку в четверть решённых задач. Ещё показательнее статистика по самому сложному уровню бенчмарка: на нём все без исключения топовые модели, включая Fable 5, показали результат 0% — то есть не решили ни одной задачи высшей категории сложности.
Для контекста: те же модели на устоявшихся бенчмарках вроде MMLU регулярно показывают результаты выше 85–90%, что в индустрии давно воспринимается как признак приближения к «человеческому» уровню понимания. Контраст с 24% на «Agents' Last Exam» настолько разителен, что исследователи прямо указывают на риск переоценки реальных возможностей моделей — вендоры и медиа склонны цитировать именно те бенчмарки, где результаты выглядят наиболее эффектно, оставляя за скобками задачи, спроектированные так, чтобы отражать сложность настоящей профессиональной работы.
Отдельного внимания заслуживает экономика вычислений: по данным исследователей, Claude Fable 5 обходится в 4–12 раз дороже конкурентов в пересчёте на стоимость решения одной задачи — при этом не демонстрируя сопоставимого прироста качества. Это прямо ставит под сомнение расхожий тезис «дороже — значит качественнее» применительно к сложным агентным задачам: рост инференс-затрат Fable 5, судя по всему, уходит на более долгие цепочки рассуждений, которые не всегда конвертируются в успешное решение реальной профессиональной задачи.
Для компаний, планирующих бюджет на внедрение ИИ-агентов, это означает необходимость считать не абстрактный балл на лидерборде, а стоимость решения конкретного класса задач в пересчёте на успешный результат — метрику, которую в индустрии иногда называют «cost per solved task». По этой метрике более дешёвая модель с сопоставимым процентом решённых задач оказывается объективно выгоднее, даже если по номинальному качеству ответов на простых запросах она уступает более дорогому флагману.
Главный практический вывод для бизнеса, который планирует автоматизировать профессиональные функции с помощью ИИ-агентов: результаты бенчмарков вроде MMLU или SWE-bench, на которые обычно ссылаются вендоры, плохо предсказывают реальную способность модели заменить эксперта в комплексной задаче с открытым концом. Разрыв между 90%+ на популярных лидербордах и 24% на «Agents' Last Exam» показывает, что индустрия близка к переоценке готовности текущего поколения LLM к автономной работе в профессиональных ролях с высокой ответственностью — юриспруденции, медицине, инженерном проектировании.
Это не означает, что инвестиции в ИИ-агентов бессмысленны — скорее указывает на необходимость реалистично калибровать зону ответственности, которую сегодня можно доверить модели без обязательного контроля человека. Задачи низкой и средней сложности, судя по распределению результатов бенчмарка, современные модели решают вполне уверенно; проблема концентрируется именно на верхней границе сложности, где цена ошибки для бизнеса — например, в юридическом заключении или инженерном расчёте — особенно высока.
Для российских компаний, которые в 2026 году активно внедряют ИИ-агентов в такие направления, как юридический комплаенс, инженерный аутсорсинг или финансовый анализ, — в том числе в рамках отраслевых KPI по цифровизации, утверждённых правительством, — результаты бенчмарка становятся сигналом к пересмотру ожиданий по срокам полной автоматизации сложных ролей. Практический вывод: ИИ-агенты пока рациональнее использовать как инструмент ускорения работы эксперта-человека, а не как его полноценную замену в задачах с высокой сложностью и ответственностью — независимо от того, что показывают модели на стандартных, более простых бенчмарках.
Дополнительный вывод касается выбора модели для внедрения: раз более дорогая модель не гарантирует пропорционально лучшего результата на сложных задачах, российским компаниям при пилотировании ИИ-агентов имеет смысл тестировать несколько моделей — включая открытые, вроде DeepSeek или свежей Kimi K3, — на собственных внутренних кейсах, максимально приближенных к реальным задачам сотрудников, а не полагаться на общие рейтинги производительности, которые, как показал бенчмарк Berkeley, могут вводить в заблуждение.