Числовые значения (веса) внутри нейросети, которые настраиваются в процессе обучения и определяют, как модель обрабатывает входные данные — их количество часто используют как грубую оценку «размера» модели.
Параметры модели (model parameters) — это числовые значения (веса и смещения), содержащиеся внутри нейросети, которые настраиваются в процессе обучения на данных и определяют, как именно модель преобразует входные данные в выходной результат. Количество параметров часто используется как грубая оценка «размера» модели и указывается прямо в её названии — например, «7B» означает семь миллиардов параметров.
Хотя число параметров исторически коррелировало с качеством модели — крупные LLM с сотнями миллиардов параметров, как правило, показывают более богатое понимание языка и мира, чем малые модели, — прямая зависимость «больше параметров = лучше» перестала быть однозначной: качество данных, эффективность архитектуры (например, MoE) и техники обучения зачастую значат не меньше, чем чистое количество параметров, а модели меньшего размера при качественном обучении иногда превосходят более крупные аналоги на конкретных задачах.
При выборе модели для конкретной бизнес-задачи важно ориентироваться не только на заявленное число параметров, но и на результаты в независимых бенчмарках и тестах вроде Полярного теста AI Радар — модель с меньшим числом параметров может оказаться более выгодным выбором по соотношению цены, скорости и качества под конкретную задачу.
Буква B здесь означает billion (миллиард), то есть модель содержит 7 или 70 миллиардов параметров соответственно — это грубый показатель размера и вычислительных требований модели.
Не обязательно — качество данных обучения, архитектура модели и техники дообучения могут иметь не меньшее значение, чем чистое число параметров, особенно на конкретных прикладных задачах.
Как правило, чем больше параметров у плотной («dense») модели, тем больше вычислительных ресурсов требуется на инференс, что напрямую влияет на стоимость и скорость генерации ответа через API.