Токены: за что вы платите при работе с ИИ
Токен — это единица, в которой модель измеряет текст и в которой вам выставляют счёт. Не буква и не слово: кусок слова. Понимание этого объясняет две вещи, которые удивляют новичков сильнее всего: почему русский текст дороже английского и почему счёт вырос, хотя вы «ничего не делали».
- Что это
- кусок текста, единица счёта модели
- Английский
- примерно 4 символа на токен
- Русский
- примерно 2 символа на токен
- Практическое следствие
- тот же смысл по-русски дороже вдвое
листайте схему вбок
Что такое токен
Модель не работает с буквами и не работает со словами. Перед обработкой текст разбивается на куски по статистике: частые слова становятся одним токеном, редкие рассыпаются на части.
Как режется текст
Слово «дом» — скорее всего один токен. Слово «домовладение» — три-четыре. Знаки препинания и пробелы тоже считаются. Числа часто разбиваются по цифрам, из-за чего длинные таблицы с числами расходуют токены неожиданно щедро.
Почему русский дороже
Словари токенизации собирались преимущественно на английских текстах, поэтому английские слова чаще укладываются в один токен, а русские разбиваются на два-четыре куска.
На практике это означает: одинаковый по смыслу текст на русском стоит примерно вдвое дороже английского. Для разовых вопросов разница незаметна, для потока запросов — существенна.
Когда это стоит учитывать
Если система обрабатывает тысячи документов, перевод служебных инструкций на английский при русском ответе даёт экономию без потери качества. Для человеческого диалога овчинка выделки не стоит.
Быстрый пересчёт в уме
Страница русского текста — примерно 1 200–1 500 токенов. Обычное письмо — 200–400. Договор на десять страниц — около 15 тысяч. Часовая расшифровка разговора — 20–30 тысяч.
Вход и выход считаются по-разному
В прайсах всегда две цены за миллион токенов, и они отличаются в разы. Понимание, какая из них важнее в вашей задаче, меняет выбор модели.
Вход — всё, что вы отправили
Вопрос, история диалога, приложенные файлы, системные инструкции, найденные фрагменты документов, описания подключённых источников. Дешевле выхода, но объём здесь обычно на порядок больше.
Выход — то, что модель написала
Дороже входа в три-пять раз. Поэтому просьба «отвечай кратко» — не вежливость, а экономия: на потоке запросов она заметна в счёте.
Рассуждения тоже оплачиваются
У моделей с режимом размышления внутренние рассуждения тарифицируются как выходные токены, даже если вы их не видите. Разница со скрытым рассуждением бывает кратной, и это главный источник неожиданных счетов.
Дешёвые модели по цене входа за миллион токенов
| Семейство | Минимум, $ | Максимум, $ |
|---|---|---|
| GPT и ChatGPT | 0.02 | 150.0 |
| Mistral | 0.02 | 2.0 |
| Qwen | 0.03 | 2.0 |
| Llama | 0.03 | 0.4 |
| Gemini | 0.05 | 2.0 |
Как считать стоимость своей задачи
Формула простая, но в ней две ловушки: забывают про историю диалога и про повторные попытки.
Базовый расчёт
Токены входа делим на миллион и умножаем на цену входа. То же для выхода. Складываем и умножаем на число запросов в месяц. Это нижняя граница.
Первая ловушка: история
В диалоге каждый следующий запрос везёт всю предыдущую переписку. Разговор из двадцати реплик стоит не в двадцать раз дороже одной, а существенно больше — подробнее в разборе контекстного окна.
Вторая ловушка: повторы
Автоматические системы переспрашивают: не тот формат ответа, ошибка разбора, неудачный вызов инструмента. Реальный расход обычно в полтора-два раза выше расчётного, и закладывать этот запас надо сразу.
Пять приёмов, которые реально снижают счёт
- Кэшировать неизменное начало запросаСистемные инструкции и справочники, которые повторяются в каждом вызове, провайдеры считают по сниженной цене. Самый крупный рычаг из доступных.
- Разделить задачи по моделямКлассификация и извлечение полей отлично работают на дешёвых моделях. Дорогую оставить там, где нужна сложная логика.
- Ограничить длину ответаПрямое указание объёма и предел на выходные токены. Выход дороже входа в разы.
- Не класть в контекст всё подрядПять релевантных фрагментов вместо всей базы. Дешевле и точнее.
- Выключить лишнее рассуждениеРежим размышления оправдан на сложных задачах и бессмысленно дорог на извлечении данных из формы.
Частые вопросы
Что такое токен простыми словами
Сколько токенов в странице текста
Почему русский язык расходует больше токенов
Почему выход дороже входа
Считаются ли токены в подписке
Как узнать, сколько токенов в моём тексте
Оплачиваются ли невидимые рассуждения модели
Считаются ли картинки в токенах
Связанные страницы
- OpenRouter: что это, сколько стоит и как получить доступ из России
- Как пополнить баланс OpenRouter из России в 2026 году
- Модели ИИ: каталог с ценами, контекстом и сравнением
- Промпт: что это такое и чем отличается от запроса
- Технологии ИИ: как это устроено внутри — без формул
- Контекстное окно: сколько модель удерживает за раз
- RAG: как заставить модель отвечать по вашим документам
Последняя проверка фактов: 13.08.2026. Нашли неточность — напишите редакции.