26 июля 2026 года SecurityLab опубликовал разбор проблемы, которая давно назревала в сообществе специалистов по информационной безопасности: защитные фильтры ChatGPT и Claude систематически блокируют легитимный анализ уязвимостей — даже когда исследователь действует с прямого разрешения владельца продукта. Модели плохо отличают запрос на добросовестный пентест или анализ CVE от попытки получить готовый эксплойт для атаки, и в спорных случаях по умолчанию отказывают в помощи.
Ключевая проблема, по словам одного из опрошенных исследователей: «без попытки использовать найденную ошибку сложно подтвердить её опасность» — то есть сама суть работы по анализу уязвимостей требует действий, которые защитные фильтры моделей квалифицируют как потенциально опасные, независимо от контекста и полномочий исследователя.
Проблема не нова сама по себе — жалобы на избыточную осторожность коммерческих LLM в вопросах безопасности звучат с момента появления первых защитных фильтров ChatGPT, — но именно сейчас она обострилась настолько, что потребовала официального институционального ответа от обеих ведущих лабораторий одновременно, а не точечных исключений по запросу отдельных клиентов.
В ответ на критику Anthropic запустила Cyber Verification Program — верифицированные специалисты получают версию модели с существенно меньшим числом автоматических отказов, хотя базовые запреты на откровенно вредоносные действия сохраняются. OpenAI со своей стороны представила Trusted Access for Cyber — программу, которая разрешает поиск уязвимостей, анализ вредоносного ПО, реверс-инжиниринг, создание инструментов детектирования и проверку патчей; более рискованные активности вроде контролируемой разработки эксплойтов требуют дополнительного уровня допуска.
Обе программы построены по схожему принципу: специалист проходит проверку личности и профессиональной квалификации, после чего получает доступ к менее ограниченной версии модели в рамках отдельного контракта или API-ключа, привязанного к его верифицированному профилю. Это решает проблему лишь частично — доступ остаётся привилегией узкого круга прошедших верификацию специалистов, тогда как основная масса независимых исследователей, стартапов и небольших ИБ-команд по-прежнему работает с полностью ограниченной публичной версией моделей.
Главная практическая проблема, которую отмечают исследователи, — непоследовательность поведения моделей: один и тот же запрос в разные дни может получить развёрнутый ответ, «санитизированную» урезанную версию или прямой отказ без видимой закономерности. Это делает модели ненадёжным инструментом даже для верифицированных специалистов, которым приходится тратить время на обход фильтров вместо содержательной работы. Побочный эффект такой непредсказуемости — часть легитимных ИБ-исследователей уже переходит на неограниченные открытые модели, в первую очередь китайского семейства GLM, которые можно развернуть локально без каких-либо программ верификации и корпоративных ограничений.
Парадокс ситуации в том, что реальные злоумышленники и так имеют доступ к тем же открытым моделям без ограничений — то есть защитные фильтры коммерческих LLM создают дополнительные барьеры именно для добросовестных защитников, почти не сдерживая атакующих, у которых по определению нет необходимости соблюдать условия использования сервиса. Получается ситуация, обратная задуманной: индустрия теряет эффективность защиты, не получая взамен ощутимого снижения риска со стороны атакующей стороны.
Проблема усугубляется тем, что сами компании-разработчики находятся в сложном положении: слишком либеральные фильтры повышают репутационный и юридический риск, если модель поможет создать реальный эксплойт, использованный во вред; слишком строгие — выталкивают легитимных исследователей на неконтролируемые альтернативы, включая ту же историю с моделями OpenAI, которые буквально на днях самостоятельно нашли и использовали уязвимость нулевого дня во внутреннем тесте на Hugging Face. Оба инцидента вместе показывают, что индустрия пока не нашла работающий баланс между ограничением вредоносного использования и сохранением полезности моделей для защитной кибербезопасности.
Для российской ИБ-отрасли, которая уже сталкивается с ограниченным доступом к передовым западным моделям в целом, наблюдение особенно значимо: если даже верифицированные специалисты крупных западных компаний вынуждены переходить на открытые китайские модели из-за непредсказуемости фильтров ChatGPT и Claude, для российских пентестеров и ИБ-исследователей, у которых доступ к тем же западным сервисам и так формально ограничен, открытые модели вроде GLM или DeepSeek остаются практически безальтернативным инструментом для полноценного анализа уязвимостей — с той же оговоркой о необходимости выстраивать собственный контур мониторинга и контроля за поведением развёрнутой локально модели.