Способность модели работать не только с текстом, но и с изображениями, аудио или видео в одном запросе.
Мультимодальность — свойство модели принимать на вход и генерировать на выходе информацию разных типов (модальностей): текст, изображение, звук, видео. Мультимодальная модель может, например, посмотреть на фотографию, прочитать вопрос о ней текстом и дать текстовый ответ, объединяя понимание визуального и языкового контента в одном рассуждении.
Технически это достигается за счёт того, что разные типы данных приводятся к общему представлению — эмбеддингам в едином векторном пространстве, — после чего трансформер обрабатывает их совместно так же, как обрабатывал бы только текст. Обучение таких моделей требует больших датасетов, где изображения, аудио и текст размечены и связаны друг с другом.
Мультимодальность на практике применяется в поддержке пользователей (анализ скриншотов проблем), медицине (анализ снимков вместе с историей болезни) и автономном транспорте (объединение видео с камер и данных сенсоров).
Обычная LLM работает только с текстом. Мультимодальная модель дополнительно понимает и/или генерирует изображения, аудио или видео в том же диалоге.
Да, ряд российских моделей (включая версии GigaChat) поддерживают работу с изображениями в дополнение к тексту.
Нет, генерация изображений (как в Kandinsky) — лишь один частный случай. Мультимодальность шире и включает и понимание, и генерацию нескольких типов данных одновременно.