Модель, способная понимать и/или генерировать несколько типов данных: текст, изображения, аудио, видео.
Мультимодальная модель — это модель ИИ, спроектированная для работы более чем с одним типом данных (модальностью) одновременно: например, она может проанализировать фотографию и ответить на вопрос о ней текстом, или сгенерировать изображение по текстовому описанию, или обработать видео вместе со звуковой дорожкой.
Технически это достигается объединением разных типов данных в общее векторное пространство эмбеддингов, после чего единая архитектура (обычно трансформер) обрабатывает их совместно, устанавливая связи между, например, объектом на изображении и словом, которое его описывает.
Мультимодальные модели используются в задачах вроде анализа медицинских снимков вместе с текстовой историей болезни пациента, автоматической модерации контента (текст + изображение одновременно) и создания мультимедийного контента для маркетинга.
Обычная LLM обрабатывает только текст. Мультимодальная дополнительно понимает и/или генерирует изображения, звук или видео в рамках того же диалога.
Многие ведущие модели (GPT-4o, Gemini, отдельные версии GigaChat) уже поддерживают как минимум изображения в дополнение к тексту, но не все модели на рынке мультимодальны.
Для конечного пользователя — нет, интерфейс обычно остаётся простым (можно просто прикрепить файл к сообщению); сложность скрыта на уровне архитектуры модели.