Архитектура генеративной модели, создающая изображение путём постепенного «очищения» случайного шума до итоговой картинки.
Диффузионная модель — архитектура генеративного ИИ, которая создаёт изображение через итеративный процесс: начиная со случайного шума, модель на каждом шаге немного «очищает» изображение, приближая его к итоговому результату, соответствующему текстовому описанию. Название происходит от физического процесса диффузии — постепенного распространения и, в обратном направлении, «сборки» частиц.
Обучение диффузионной модели устроено зеркально процессу генерации: модели показывают реальные изображения, к которым постепенно добавляют шум до полного его превращения в случайный набор пикселей, и обучают модель предсказывать, как убрать шум на каждом шаге — освоив это, модель способна проделать обратный путь с нуля, от чистого шума до связного изображения, направляемая текстовым промптом.
Диффузионные модели практически полностью вытеснили более ранние архитектуры генерации изображений (GAN) благодаря более стабильному обучению и лучшему качеству итоговых изображений при сопоставимых вычислительных затратах.
От нескольких секунд до десятков секунд в зависимости от модели, разрешения и числа шагов очищения шума — современные модели оптимизированы для баланса скорости и качества.
Изначально да, но принцип применяется и для генерации видео, аудио и даже некоторых видов 3D-контента.
GAN (генеративно-состязательная сеть) обучается через соревнование двух сетей и часто менее стабильна в обучении; диффузионные модели обычно дают более качественные и разнообразные результаты при более предсказуемом процессе обучения.