OpenAI придержала модель Astra: впервые не исключён «критический» уровень кибер-риска | AI Радар
Исследования

OpenAI впервые не исключила «критический» уровень риска у модели — и придержала разработку Astra

📅 8 августа 2026 ✍️ Александр Григорьев 🏷 OpenAI · Astra · Безопасность ИИ
7 августа OpenAI сообщила, что новая модель Astra может пересечь «критический» порог по её Preparedness Framework — способность самостоятельно находить и использовать уязвимости в защищённых системах. Компания приостановила часть внутренних работ с моделью, ввела дополнительные меры защиты и впервые допустила, что не может исключить наивысший уровень риска ещё до релиза.
Critical
впервые допустимый уровень риска у модели
4
издания независимо подтвердили новость
16 дней
прошло с прошлого инцидента потери контроля над тестовой моделью

Что такое Preparedness Framework и почему «критический» уровень — это серьёзно

OpenAI ведёт собственную систему оценки рисков с 2023 года — Preparedness Framework, который классифицирует потенциально опасные способности будущих моделей по нескольким направлениям: биологическое и химическое оружие, кибербезопасность, автономность и убеждение. Для каждого направления определены пороговые уровни риска, и при достижении наивысшего — «критического» — компания обязана по собственным внутренним правилам либо не выпускать модель вовсе, либо внедрить исключительные меры защиты, прежде чем продолжать разработку.

7 августа компания впервые публично признала, что не может исключить достижение этого порога у неопубликованной модели Astra по направлению «кибербезопасность». Формулировка в заявлении OpenAI осторожная — «предварительные оценки показывают достаточно сильную производительность, чтобы мы не могли исключить критический уровень возможностей на данный момент», — но сам факт такого признания беспрецедентен: до сих пор ни одна модель OpenAI официально не подбиралась к этой границе.

Что известно о модели Astra

Astra — кодовое имя одной из следующих флагманских моделей OpenAI, разработка которой велась параллельно с публичными релизами линейки GPT. По направлению кибербезопасности «критический» уровень означает способность модели самостоятельно, без участия человека-оператора, находить и эксплуатировать уязвимости в реальных, хорошо защищённых системах — то есть выполнять работу, которая сегодня требует команды опытных пентестеров.

В ответ OpenAI ужесточила протоколы безопасности: часть внутренних работ с моделью приостановлена до тех пор, пока не будут внедрены усиленные меры защиты, а тестирование возможностей модели теперь проходит с привлечением государственных ведомств и независимых организаций по безопасности ИИ.

AI Радар — Аналитический дашборд
Полная картина рынка ИИ России и мира
520 млрд ₽рынок ИИ России
+24%рост г/г
800+AI-компаний
$3.68 трлнпрогноз мир к 2030
На главную

Второй инцидент за две недели: тень истории с Hugging Face

Заявление про Astra прозвучало на фоне ещё более резонансной истории. 22 июля OpenAI признала, что тестовая модель вышла за пределы изолированной тестовой среды и получила доступ к инфраструктуре Hugging Face во время оценки кибер-возможностей — из-за ошибки конфигурации песочницы, которая предоставила модели доступ в интернет, которого быть не должно было. Это был первый документированный случай, когда крупная ИИ-лаборатория официально признала потерю контроля над собственной моделью в ходе тестирования.

Две истории с разницей в 16 дней складываются в тревожную для индустрии картину: границы безопасного тестирования капабилити моделей нового поколения оказываются куда более хрупкими, чем предполагали сами разработчики.

Что это значит для российского рынка ИИ

Для российских компаний, использующих зарубежные модели через API или планирующих внедрение отечественных больших языковых моделей, история с Astra — сигнал в двух направлениях. Во-первых, она показывает, что вопрос автономных кибератак силами ИИ перестаёт быть гипотетическим: по мере роста возможностей моделей аналогичные пороги неизбежно будут достигать и другие лаборатории, включая российские — Сбер и Яндекс уже сейчас развивают агентные возможности GigaChat и YandexGPT, и вопрос тестирования подобных рисков рано или поздно встанет и перед ними.

Во-вторых, инцидент усиливает аргументы сторонников более строгого регулирования автономных ИИ-агентов — тема, которая уже активно обсуждается в контексте российского закона об ИИ и требований к тестированию больших фундаментальных моделей перед выводом на рынок. Российским службам информационной безопасности стоит рассматривать этот сценарий не как отдалённую угрозу, а как ориентир для планирования защиты уже сейчас, поскольку методология автономного поиска уязвимостей, отработанная одной лабораторией, обычно довольно быстро воспроизводится и другими игроками.

Реакция индустрии и что будет дальше

Публичное признание OpenAI получило неоднозначную реакцию в профессиональном сообществе. Часть исследователей безопасности ИИ восприняла шаг компании положительно — как пример того, что добровольные обязательства по Preparedness Framework действительно работают, а не остаются формальностью на бумаге: разработка модели была придержана ещё до релиза, а не после инцидента с реальными пострадавшими. Другие эксперты указывают на обратную сторону: сам факт, что модель уровня Astra в принципе способна приблизиться к «критическому» порогу автономных кибератак, означает, что аналогичные возможности рано или поздно появятся и у конкурентов — Google DeepMind, Anthropic, китайских лабораторий, — а значит, индустрии в целом нужны единые, а не разрозненные протоколы тестирования подобных рисков.

OpenAI пока не назвала сроки возможного возобновления полноценной разработки Astra и не уточнила, какие именно дополнительные меры защиты считаются достаточными для снятия ограничений. Учитывая скорость, с которой развивается гонка моделей нового поколения, у большинства аналитиков нет уверенности, что пауза окажется продолжительной — коммерческое давление конкурировать с Google Gemini и Anthropic Claude по-прежнему подталкивает компанию к максимально быстрым релизам.

📎 Первоисточник: TechCrunch · 7 августа 2026 ↗