Минимальный кусочек текста, который обрабатывает модель — часть слова, слово или знак препинания. Стоимость запросов к API считают в токенах.
Прежде чем передать текст в нейросеть, его нужно превратить в числа. Для этого текст разбивают на токены — небольшие фрагменты, каждому из которых соответствует число (индекс) в словаре модели. Токенизатор может разбивать слово целиком («кот» — один токен) либо дробить его на части («нейросетевой» — несколько токенов), особенно если слово редкое или составное.
Размер словаря токенов обычно составляет 50-100 тысяч уникальных токенов. Модель обучается предсказывать следующий токен, а не следующее слово или букву — это компромисс между эффективностью (меньше уникальных единиц, чем букв в комбинациях) и гибкостью (не нужно хранить каждое возможное слово целиком).
При работе с API важно учитывать лимит контекстного окна в токенах и стоимость: 1000 токенов — это примерно 700-750 слов английского текста, но для русского из-за более сложной токенизации кириллицы эта цифра обычно ниже.
У большинства провайдеров есть онлайн-токенайзеры (например, tokenizer от OpenAI) — можно вставить текст и увидеть точное число токенов для конкретной модели.
Токенизаторы чаще всего обучены преимущественно на английских текстах, из-за чего кириллические слова чаще дробятся на несколько токенов вместо одного.
Нет, один токен обычно длиннее одного символа: в среднем токен — это 3-4 символа для английского текста, для русского это соотношение обычно меньше.