Объединение множества графических процессоров в единую вычислительную систему для обучения и работы больших ИИ-моделей.
GPU-кластер — это вычислительная система, объединяющая большое количество графических процессоров (GPU), которые изначально создавались для рендеринга изображений, но оказались чрезвычайно эффективны для матричных вычислений, лежащих в основе обучения нейросетей — благодаря способности выполнять тысячи простых операций параллельно.
Обучение современной большой языковой модели требует одновременной работы сотен или тысяч GPU на протяжении недель или месяцев, соединённых высокоскоростными сетями для синхронизации вычислений между узлами кластера. Стоимость такой инфраструктуры — один из главных барьеров, ограничивающих число компаний в мире, способных обучать по-настоящему крупные модели с нуля.
Дефицит и высокая стоимость доступа к GPU-мощностям — одна из причин, почему многие компании предпочитают дообучать (файнтюнить) уже готовые базовые модели вместо обучения собственной модели с нуля, что требует на порядки меньше вычислительных ресурсов.
GPU способны выполнять множество простых операций параллельно, что идеально подходит для матричных вычислений в нейросетях, тогда как CPU оптимизированы под последовательные вычисления общего назначения.
Затраты варьируются от миллионов до сотен миллионов долларов в зависимости от масштаба модели — именно поэтому обучение топовых моделей с нуля доступно ограниченному числу крупных компаний.
Да, облачные провайдеры предлагают аренду GPU-кластеров, что снижает порог входа для компаний без собственной инфраструктуры, хотя долгосрочная аренда больших мощностей также требует значительных бюджетов.