Максимальный объём текста (в токенах), который модель может «удержать в памяти» в рамках одного диалога.
Контекстное окно — это ограничение на объём текста (измеряемый в токенах), который языковая модель может одновременно обрабатывать при генерации ответа: сюда входит и системный промпт, и вся история диалога, и сам вопрос пользователя. Если разговор становится длиннее окна, самые старые сообщения «выпадают» из внимания модели.
Размер контекстного окна — техническое ограничение архитектуры трансформера: вычислительная сложность механизма внимания растёт квадратично с длиной последовательности, поэтому расширение окна требует значительных инженерных усилий. За последние годы окна выросли с нескольких тысяч токенов до сотен тысяч и даже миллионов у отдельных моделей.
Даже при огромном контекстном окне исследования показывают эффект «потерянного в середине» (lost in the middle) — модель хуже использует информацию, расположенную в центре очень длинного контекста, чем в начале или конце.
Не обязательно — большое окно полезно для длинных документов, но не гарантирует, что модель одинаково хорошо использует всю информацию внутри него.
Система обычно обрезает или суммирует старые сообщения, чтобы уместиться в лимит — конкретный механизм зависит от реализации продукта.
Нет, это разные вещи: контекстное окно ограничивает объём текста внутри одного запроса, а «память» между разными сессиями требует отдельных механизмов вроде внешнего хранилища.