Бенчмарк Berkeley: лучшая модель ИИ решает лишь 24% сложных задач | AI Радар
Исследования

Бенчмарк Berkeley «Agents' Last Exam»: лучшая ИИ-модель решает лишь 24% сложных профессиональных задач

📅 28 июля 2026 ✍️ Александр Григорьев 🏷 Бенчмарки · UC Berkeley · LLM
Исследователи UC Berkeley собрали более 1500 задач от экспертов по 55 профессиям — лучший результат показала GPT-5.5 с 24% решённых заданий, а на самом сложном уровне все топовые модели, включая Claude Fable 5, набрали 0%. При этом Fable 5 обходится в 4–12 раз дороже конкурентов за решение одной задачи.
1500+
Задач в бенчмарке
от экспертов 55 профессий
24%
Лучший результат
GPT-5.5
0%
На сложнейшем уровне
у всех топ-моделей

Что такое «Agents' Last Exam» и чем он отличается от обычных бенчмарков

Исследователи из Калифорнийского университета в Беркли представили новый бенчмарк «Agents' Last Exam» — набор из более чем 1500 задач, подготовленных практикующими экспертами по 55 различным профессиям: от юриспруденции и медицины до инженерии и финансового анализа. Принципиальное отличие от привычных академических тестов вроде MMLU или GPQA в том, что задачи здесь смоделированы по образцу реальной профессиональной работы — это не тесты с выбором одного правильного ответа, а комплексные кейсы, требующие последовательных агентных действий, работы с неполной информацией и профессиональных суждений, которые нельзя свести к одному «правильному» варианту.

Задачи разбиты по уровням сложности — от базового, сопоставимого с рутинной работой junior-специалиста, до высшего, требующего экспертизы уровня практикующего профессионала с многолетним стажем. Именно такая градация и позволила исследователям показать не просто «средний балл» модели, а то, где именно проходит граница возможностей современных LLM — и граница эта, как выяснилось, проходит гораздо раньше, чем предполагали разработчики моделей, ориентирующиеся на более простые академические бенчмарки.

Результаты: даже лучшая модель проходит лишь четверть задач

Результаты оказались отрезвляющими для всей индустрии. Лучший результат показала GPT-5.5 от OpenAI — но и она справилась лишь с 24% заданий. В тестирование также вошли Claude Fable 5 от Anthropic, Composer 2.5 от Cursor и Gemini 3.1 Pro от Google — ни одна из моделей не смогла преодолеть даже планку в четверть решённых задач. Ещё показательнее статистика по самому сложному уровню бенчмарка: на нём все без исключения топовые модели, включая Fable 5, показали результат 0% — то есть не решили ни одной задачи высшей категории сложности.

Для контекста: те же модели на устоявшихся бенчмарках вроде MMLU регулярно показывают результаты выше 85–90%, что в индустрии давно воспринимается как признак приближения к «человеческому» уровню понимания. Контраст с 24% на «Agents' Last Exam» настолько разителен, что исследователи прямо указывают на риск переоценки реальных возможностей моделей — вендоры и медиа склонны цитировать именно те бенчмарки, где результаты выглядят наиболее эффектно, оставляя за скобками задачи, спроектированные так, чтобы отражать сложность настоящей профессиональной работы.

Стоимость vs качество: почему Fable 5 не оправдывает цену

Отдельного внимания заслуживает экономика вычислений: по данным исследователей, Claude Fable 5 обходится в 4–12 раз дороже конкурентов в пересчёте на стоимость решения одной задачи — при этом не демонстрируя сопоставимого прироста качества. Это прямо ставит под сомнение расхожий тезис «дороже — значит качественнее» применительно к сложным агентным задачам: рост инференс-затрат Fable 5, судя по всему, уходит на более долгие цепочки рассуждений, которые не всегда конвертируются в успешное решение реальной профессиональной задачи.

Для компаний, планирующих бюджет на внедрение ИИ-агентов, это означает необходимость считать не абстрактный балл на лидерборде, а стоимость решения конкретного класса задач в пересчёте на успешный результат — метрику, которую в индустрии иногда называют «cost per solved task». По этой метрике более дешёвая модель с сопоставимым процентом решённых задач оказывается объективно выгоднее, даже если по номинальному качеству ответов на простых запросах она уступает более дорогому флагману.

AI Радар — Аналитический дашборд
Полная картина рынка ИИ России и мира
520 млрд ₽рынок ИИ России
+24%рост г/г
800+AI-компаний
$3.68 трлнпрогноз мир к 2030
На главную

Что это значит для внедрения ИИ в реальный бизнес

Главный практический вывод для бизнеса, который планирует автоматизировать профессиональные функции с помощью ИИ-агентов: результаты бенчмарков вроде MMLU или SWE-bench, на которые обычно ссылаются вендоры, плохо предсказывают реальную способность модели заменить эксперта в комплексной задаче с открытым концом. Разрыв между 90%+ на популярных лидербордах и 24% на «Agents' Last Exam» показывает, что индустрия близка к переоценке готовности текущего поколения LLM к автономной работе в профессиональных ролях с высокой ответственностью — юриспруденции, медицине, инженерном проектировании.

Это не означает, что инвестиции в ИИ-агентов бессмысленны — скорее указывает на необходимость реалистично калибровать зону ответственности, которую сегодня можно доверить модели без обязательного контроля человека. Задачи низкой и средней сложности, судя по распределению результатов бенчмарка, современные модели решают вполне уверенно; проблема концентрируется именно на верхней границе сложности, где цена ошибки для бизнеса — например, в юридическом заключении или инженерном расчёте — особенно высока.

Значение для российских компаний, внедряющих ИИ-агентов

Для российских компаний, которые в 2026 году активно внедряют ИИ-агентов в такие направления, как юридический комплаенс, инженерный аутсорсинг или финансовый анализ, — в том числе в рамках отраслевых KPI по цифровизации, утверждённых правительством, — результаты бенчмарка становятся сигналом к пересмотру ожиданий по срокам полной автоматизации сложных ролей. Практический вывод: ИИ-агенты пока рациональнее использовать как инструмент ускорения работы эксперта-человека, а не как его полноценную замену в задачах с высокой сложностью и ответственностью — независимо от того, что показывают модели на стандартных, более простых бенчмарках.

Дополнительный вывод касается выбора модели для внедрения: раз более дорогая модель не гарантирует пропорционально лучшего результата на сложных задачах, российским компаниям при пилотировании ИИ-агентов имеет смысл тестировать несколько моделей — включая открытые, вроде DeepSeek или свежей Kimi K3, — на собственных внутренних кейсах, максимально приближенных к реальным задачам сотрудников, а не полагаться на общие рейтинги производительности, которые, как показал бенчмарк Berkeley, могут вводить в заблуждение.

📎 Первоисточник: Хабр · 28 июля 2026 ↗