Склонность модели генерировать оскорбительный, дискриминационный или вредоносный контент — одна из ключевых метрик безопасности ИИ.
Токсичность модели — это метрика, отражающая, насколько часто и насколько сильно языковая модель склонна генерировать оскорбительные высказывания, дискриминационные суждения о группах людей, откровенно вредоносные инструкции или иной неприемлемый контент в ответ на обычные или намеренно провокационные запросы пользователя.
Поскольку модель обучается на огромном массиве текстов из интернета, включающих и токсичный контент, без специальных мер она способна воспроизводить подобные паттерны. Снижение токсичности достигается комбинацией методов: фильтрацией обучающих данных, дообучением на основе обратной связи от людей (RLHF), а также дополнительными модерационными фильтрами, проверяющими уже сгенерированный ответ перед показом пользователю.
Оценка токсичности — обязательный этап red teaming тестирования перед публичным релизом новой модели: специалисты намеренно пытаются спровоцировать модель на неприемлемые ответы, чтобы выявить и устранить уязвимости заранее.
Полностью — нет, это фундаментальный риск любой генеративной модели, обученной на данных из интернета. Задача разработчиков — минимизировать частоту и серьёзность таких случаев.
С помощью специальных наборов провокационных запросов и автоматических классификаторов, оценивающих сгенерированный ответ на предмет оскорбительности, дискриминации или вредоносности.
Да, снижение токсичности — часть более широкой задачи alignment, то есть приведения поведения модели в соответствие с человеческими ценностями и ожиданиями.