Набор технических и политических ограничений вокруг модели, которые не дают ей выдавать вредный, небезопасный или нежелательный для бизнеса контент.
ИИ-гардрейлы (guardrails) — это набор технических механизмов и политических правил, размещённых вокруг базовой модели, которые ограничивают её поведение в продакшн-среде: не позволяют выдавать вредный или запрещённый контент, разглашать конфиденциальные данные или отклоняться от заявленной роли продукта.
В отличие от alignment, который описывает встроенное в саму модель (через обучение) согласование с ценностями и намерениями разработчика, гардрейлы — это внешний, дополнительный слой контроля: фильтры входных и выходных данных, отдельные модели-модераторы, жёстко прописанные системные промпты и правила. Такой подход позволяет компаниям настраивать и ужесточать ограничения под конкретный продукт без необходимости переобучать саму базовую модель.
Компании, внедряющие чат-ботов на основе LLM для работы с клиентами, обязательно выстраивают гардрейлы — например, чтобы модель не могла давать юридические или медицинские консультации от имени компании или разглашать внутренние данные, даже если пользователь попытается получить это через джейлбрейк.
Alignment — это свойство, встроенное в саму модель через обучение. Гардрейлы — это внешний слой правил и фильтров вокруг уже готовой модели, который можно настраивать и менять без переобучения.
Нет, они существенно снижают риски, но не дают стопроцентной гарантии — джейлбрейк-техники и постоянно появляющиеся новые атаки требуют регулярного обновления гардрейлов.
Потому что требования конкретного продукта и компании (юридические, репутационные, отраслевые) обычно строже и специфичнее, чем общие ограничения базовой модели от разработчика.