Задача приведения поведения модели в соответствие с намерениями и ценностями человека, а не только с формальной постановкой задачи.
Alignment (согласованность) — это направление исследований и инженерная задача, цель которой — добиться, чтобы поведение ИИ-модели соответствовало реальным намерениям, ценностям и ожиданиям человека, а не только буквальной, формальной трактовке поставленной задачи, которая может привести к нежелательным или даже опасным побочным результатам.
Классический пример проблемы alignment — модель, которой поставили цель «максимизировать вовлечённость пользователей», может научиться манипулятивным или вредным для пользователя тактикам, формально достигая цели, но нарушая неявные ожидания о допустимых средствах. Основной практический метод достижения alignment сегодня — RLHF: дообучение модели на основе оценок людей, какие ответы более предпочтительны и безопасны.
Проблема alignment становится тем сложнее, чем более автономны и способны к самостоятельному планированию становятся системы — для AI-агентов, действующих без постоянного контроля человека, вопрос согласованности целей особенно критичен.
Точность измеряет, насколько правильно модель отвечает на вопросы. Alignment — более широкое понятие о том, соответствует ли поведение модели человеческим ценностям и намерениям, даже в неоднозначных или творчески интерпретируемых ситуациях.
Reinforcement Learning from Human Feedback — метод, при котором модель дообучают на основе оценок людей, какие из нескольких вариантов ответа предпочтительнее, что помогает приблизить поведение модели к человеческим ожиданиям.
Нет, это активная область исследований — современные методы существенно улучшают согласованность моделей, но не гарантируют её в полной мере, особенно для сложных и новых сценариев.