Токены и цены
Теперь, когда мы в общих чертах понимаем, как работают модели ИИ, разберёмся с тем, что поможет понять и как эти модели «думают», и сколько стоит их использование: токены.
Токены можно считать «словами», которые модели ИИ реально понимают. Но есть нюанс: это не совсем те слова, которыми пользуемся мы с вами.
Как и ваш компьютер, который на самом деле не понимает букву «A», а работает с двоичным кодом (1 и 0), модели ИИ тоже не оперируют напрямую словами вроде «hello» или «world». Вместо этого они разбивают всё на более мелкие части — токены.
Например, слово «hello» может быть одним токеном, а «understanding» — несколькими: «under», «stand» и «ing». Иногда даже части слов, знаки препинания или пробелы становятся отдельными токенами.
Почему это важно? По двум причинам:
- Оплата рассчитывается по токенам. Вы платите за токены, а не за слова или символы.
- Скорость моделей измеряется в токенах. Более быстрые модели имеют более высокий TPS — tokens per second (токенов в секунду), возвращаемых пользователю.
Сначала поговорим о стоимости, поскольку это влияет на ваши расходы при использовании моделей ИИ.
Что такое токены
Если продолжить аналогию с API, то токены — это единицы, которыми мы измеряем и тарифицируем входящий и исходящий трафик.
Модели ИИ тарифицируют по двум типам токенов:
- Входные токены — всё, что вы отправляете модели: ваш запрос и предыдущий контекст беседы.
- Выходные токены — всё, что модель возвращает вам в ответ.
Выходные токены обычно стоят в 2–4 раза дороже входных, потому что генерация нового содержимого требует больше вычислительных ресурсов, чем просто обработка того, что вы отправили.
Поскольку модели ИИ тарифицируют по токенам, их понимание — ключ к управлению затратами. Это как знать, сколько стоит ваш сервер.
Важно осознанно выбирать объём информации в исходном контексте (к этому мы вернёмся далее) и то, как направлять модель, чтобы ответы были либо лаконичными, либо подробными.
Потоковая выдача ответов
Вы когда-нибудь замечали, как ChatGPT или другие ИИ-чат-боты будто «печатают» свои ответы в реальном времени? Это не просто визуальный эффект — именно так модель ИИ работает «под капотом».
Модели ИИ генерируют токены по одному, последовательно. Они предсказывают следующий токен, затем используют это предсказание, чтобы помочь предсказать следующий токен после него, и так далее. Поэтому вы видите, как ответы появляются слово за словом (или, точнее, токен за токеном).
Затем ответы могут передаваться вам потоково. Это отлично, потому что вам не нужно ждать, пока завершится весь ответ, а это может занять минуты, и вы можете прервать модель, если она начнет уходить не туда.
Какое утверждение о потоковой выдаче верно?
Оптимизация использования токенов
Инструменты ИИ часто применяют методы для сокращения числа токенов, отправляемых в базовые модели. Например, автоматически кэшируют части вашего запроса, которые вы используете неоднократно, или помогают управлять контекстом, включаемым в каждый запрос.
Перейдём к контексту в следующем уроке.