Процесс присвоения меток или аннотаций сырым данным (текстам, изображениям), необходимый для обучения моделей с учителем.
Разметка данных — это процесс присвоения меток, категорий или аннотаций сырым, необработанным данным — текстам, изображениям, аудиозаписям — чтобы модель могла обучиться на примерах с известным правильным ответом. Например, для обучения модели-классификатора спама нужен набор писем, каждое из которых размечено как «спам» или «не спам».
Разметка может выполняться вручную специально нанятыми людьми-разметчиками, полуавтоматически с использованием вспомогательных инструментов, либо с привлечением уже обученной модели для предварительной разметки с последующей проверкой человеком. Качество и последовательность разметки напрямую определяют потолок качества итоговой обученной модели — ошибки и противоречия в разметке модель унаследует как часть усвоенных закономерностей.
Специализированная разновидность разметки — сбор человеческих оценок предпочтительности разных вариантов ответа модели, используемая в RLHF для alignment языковых моделей под человеческие ценности и ожидания.
Это делают как штатные и внештатные специалисты по разметке, так и краудсорсинговые платформы, а для предварительной разметки всё чаще привлекают уже обученные ИИ-модели с последующей проверкой человеком.
Модель обучается воспроизводить закономерности из размеченных данных — если разметка содержит ошибки или противоречия, модель унаследует их как часть своего поведения.
Нет, разметка — это присвоение меток уже существующим (обычно реальным) данным. Синтетические данные — это генерация полностью новых, искусственных примеров с нуля.