3 августа Ассоциация больших данных (АБД) направила в Минцифры официальное предложение разрешить компаниям обрабатывать персональные данные граждан без их согласия — но только для узкой цели: разработки, обучения и использования моделей искусственного интеллекта, и только при условии применения технологий повышения приватности, так называемых privacy-enhancing technologies (PET). По замыслу авторов, такие технологии должны гарантировать, что риск деанонимизации конкретного человека по итоговому датасету равен нулю или не превышает «малые доли процента».
Формально предложение — это поправки к 152-ФЗ «О персональных данных», одному из ключевых регуляторных документов в этой сфере. Публикацию новости синхронно подтвердили сразу несколько отраслевых изданий — CNews, SecurityLab и Anti-Malware.ru — со ссылкой на документ, направленный в министерство.
Ассоциация больших данных объединяет порядка полутора десятков крупнейших компаний страны, работающих с большими объёмами пользовательских данных: Сбербанк, Яндекс, VK, HeadHunter, Ростелеком, Билайн, МТС, Авито, Т-Банк, банк «Точка», Газпромбанк и другие. Это одни из главных инвесторов в разработку собственных больших языковых моделей в России — от GigaChat и YandexGPT до внутренних ИИ-агентов финтех- и телеком-компаний, — и именно нехватка данных для обучения на русском языке в промышленных масштабах остаётся одним из главных узких мест отрасли.
Логика инициативы прозрачна: чем больше реальных, разнообразных данных о поведении и запросах пользователей доступно для обучения, тем выше качество и релевантность моделей — особенно на фоне того, что качественных открытых русскоязычных корпусов для обучения LLM объективно меньше, чем англоязычных.
Ключевой элемент предложения — новый институт: аккредитованный «доверенный посредник», отдельная организация, которая будет эксплуатировать информационную систему для хранения обезличенных персональных данных и предоставлять к ним доступ разработчикам ИИ по регламентированным правилам, не раскрывая исходные, «сырые» данные напрямую компаниям-разработчикам моделей. Обработка данных, по предложению АБД, должна происходить исключительно на территории России и исключительно российскими компаниями.
Сами privacy-enhancing технологии — это набор методов (от дифференциальной приватности до синтетических данных и федеративного обучения), которые в теории позволяют извлекать статистические закономерности из массивов данных, не давая возможности восстановить информацию о конкретном человеке. Именно на надёжность этих гарантий и будет обращено основное внимание регулятора при рассмотрении инициативы.
Сторонники инициативы указывают, что действующий режим обязательного согласия на обработку данных не поспевает за темпами развития ИИ-индустрии и создаёт барьер для конкурентоспособности российских моделей относительно зарубежных аналогов. Кроме того, обезличенные данные, обработанные через посредника, по замыслу авторов инициативы, несут для граждан минимальный риск по сравнению с прямым доступом компаний к их персональным данным.
Критики же обращают внимание на главную уязвимость подобных схем: любые заявления о «нулевом» или «минимальном» риске деанонимизации на практике сложно проверить независимо, а история показывает, что «анонимизированные» датасеты неоднократно удавалось повторно идентифицировать при сопоставлении с другими источниками данных. Ключевым вопросом для регулятора станет то, кто и как будет контролировать реальную эффективность PET-технологий и полномочия «доверенного посредника» — без прозрачного независимого аудита инициатива рискует стать формальностью, снимающей с компаний обязанность спрашивать согласие, но не гарантирующей реальную защиту приватности.
Инициатива АБД появляется в момент, когда в России уже действует свежеподписанный закон о больших фундаментальных моделях ИИ, вводящий статусы «суверенной» и «национальной» модели и государственную поддержку разработчиков — включая доступ к государственным data-системам для обучения нейросетей. Предложение по 152-ФЗ логично продолжает эту линию: если государство уже готово делиться собственными данными с разработчиками ИИ ради конкурентоспособности отрасли, бизнес закономерно поднимает вопрос и о смягчении требований к данным пользователей.
Минцифры пока не опубликовало официальную позицию по предложению АБД. Учитывая масштаб компаний, стоящих за инициативой, и общий вектор государственной политики поддержки развития отечественного ИИ, эксперты не исключают, что дискуссия о смягчении требований 152-ФЗ именно для целей обучения моделей в ближайшие месяцы выйдет на уровень профильных ведомств.
Показательно, что инициатива исходит не от одной компании, а от отраслевого объединения, включающего прямых конкурентов на рынке данных — Сбер и Яндекс, ВК и HeadHunter. Это усиливает переговорную позицию бизнеса перед регулятором, но одновременно поднимает вопрос, не приведёт ли согласованная позиция крупнейших держателей данных страны к формированию де-факто закрытого клуба компаний, имеющих привилегированный доступ к обезличенным датасетам граждан, тогда как более мелкие ИИ-стартапы вне АБД останутся без такого доступа.