GPQA (Graduate-Level Google-Proof Q&A) — бенчмарк для оценки языковых моделей на вопросах, требующих глубокого предметного понимания в естественных науках, а не способности быстро найти информацию. Вопросы пишут люди с учёной степенью или обучающиеся в аспирантуре по соответствующей специальности, и они специально проверяются на то, что не-эксперты отвечают на них неверно, даже располагая неограниченным временем и доступом в интернет.
Подмножество GPQA Diamond — 198 вопросов, отобранных как самые сложные: на них правильно отвечают профильные эксперты, но ошибается большинство образованных не-специалистов. Именно Diamond чаще всего используется как основной ориентир при сравнении моделей, поскольку это наиболее показательная и самая цитируемая часть бенчмарка.
GPQA стал одним из стандартных тестов при презентации новых флагманских моделей именно потому, что многие более ранние и простые бенчмарки (например, базовый MMLU) современные топовые модели уже проходят на уровне, близком к максимальному, — различить модели между собой на них стало сложно. GPQA, наоборот, остаётся труднопроходимым даже для новейших систем, что делает прогресс на нём более показательным.
На сайте AI Радар результат по GPQA Diamond — один из компонентов формулы «Российский AI-индекс» в лидерборде моделей (наравне с MERA, ценой и доступностью) — как метрика способности модели к сложным рассуждениям, а не только к работе с типовыми текстовыми задачами.