Архитектура нейросети (2017 год), лежащая в основе всех современных LLM — умеет учитывать контекст всего текста сразу, а не по словам.
Трансформер — архитектура нейросети, которая обрабатывает весь входной текст параллельно, а не последовательно, как это делали более ранние рекуррентные сети (RNN, LSTM). Вместо того чтобы «читать» текст слово за словом, трансформер одновременно вычисляет, насколько каждое слово связано с каждым другим — это и есть механизм внимания (attention).
Такая параллельная обработка дала два преимущества: во-первых, обучение стало можно эффективно распараллелить на GPU-кластерах, что позволило растить модели до огромных размеров; во-вторых, модель лучше улавливает дальние смысловые связи в тексте — например, согласование подлежащего и сказуемого через несколько предложений.
Трансформер стал настолько универсальной архитектурой, что применяется не только для текста, но и для изображений (Vision Transformer), звука и даже белковых структур (AlphaFold).
Архитектуру предложила команда исследователей Google в статье "Attention Is All You Need" в 2017 году — она легла в основу GPT, BERT и всех последующих LLM.
Трансформер обрабатывает весь текст параллельно и лучше улавливает дальние зависимости, тогда как RNN обрабатывали текст последовательно и «забывали» начало длинных последовательностей.
Нет, архитектура универсальна: применяется в компьютерном зрении, распознавании речи, генерации изображений и биоинформатике.