Qwen из России: чат, ключ API и локальный запуск
У Qwen нет подписки: вы платите за токены по факту или не платите вовсе, если запустили модель у себя. Из России работают три способа — чат, ключ через шлюз и локальный запуск. Ниже разбор каждого с ценами на 30 августа 2026 года.
- Вендор
- Alibaba
- Веса моделей
- открыты
- Способов доступа из России
- 3
- Цена за 1M входных токенов
- от $0.03 до $2.00
- Максимальный контекст
- 1.0M токенов
- Память для локального запуска
- от 16 ГБ
- Проверено
- 30.08.2026
Три дороги к Qwen и чем они отличаются
Qwen — семейство моделей Alibaba с открытыми весами. Из России к нему ведут три дороги, и отличаются они не качеством ответа, а тем, что вы отдаёте: деньги, время или собственное железо.
Главное отличие от Claude и ChatGPT в этом разговоре: у Qwen нет подписки. Нечего продлевать каждый месяц и нечего терять при блокировке карты — вы платите за фактические токены или не платите вовсе.
Кому какой способ подходит
Чат подходит, чтобы задать пару вопросов и посмотреть, как модель отвечает на ваших задачах. Ключ через шлюз нужен, когда модель работает внутри вашего кода, бота или агента. Локальный запуск берут те, кому нельзя отдавать данные наружу или кто гоняет большие объёмы каждый день.
листайте схему вбок
Три способа получить Qwen из России
| способ | что нужно | сколько стоит | сколько времени на запуск |
|---|---|---|---|
| Официальный чатchat.qwen.ai | аккаунт Alibaba | 0 ₽ | минута |
| Ключ API через шлюзOpenRouter | баланс в долларах | от $0.03 за 1M токенов | полчаса |
| Локальный запускOllama или LM Studio | 16 ГБ памяти и больше | стоимость железа или сервера | вечер |
Проверено 30.08.2026. Курс ЦБ на 29.08.2026 — 85,60 ₽ за доллар.
За что списываются деньги, если подписки нет
Оплата идёт за токены — куски слов, которыми модель измеряет и вопрос, и ответ. Миллион токенов — это примерно семьсот тысяч слов, пять-шесть томов средней книги. Активный рабочий день с моделью — десятки тысяч токенов, а не миллионы.
Цена всегда указывается двумя числами: отдельно за входные токены (то, что вы отправили) и отдельно за выходные (то, что модель написала). Выходные дороже входных в три-пять раз, поэтому длинные ответы стоят заметно больше длинных вопросов.
Почему цена внутри линейки различается в шестьдесят раз
Flash-версии рассчитаны на объём: они дешевле и быстрее, их берут на массовую обработку текста, разбор документов и черновики. Max-версии считают дольше и стоят дороже — их держат для сложных многошаговых задач, где ошибка обходится дороже разницы в цене.
Сколько стоят модели Qwen через шлюз
| модель | контекст | вход $/1M | выход $/1M | на что берут |
|---|---|---|---|---|
| Qwen3.7 Flashqwen/qwen3.7-flash | 1.0M | $0.03 | $0.13 | массовая обработка текста |
| Qwen3.5-9Bqwen/qwen3.5-9b | 262K | $0.10 | $0.15 | дешёвый диалог |
| Qwen3.8 Flashqwen/qwen3.8-flash | 1.0M | $0.15 | $0.47 | повседневные задачи |
| Qwen3 Coder Flashqwen/qwen3-coder-flash | 1.0M | $0.195 | $0.975 | код |
| Qwen3 Maxqwen/qwen3-max | 262K | $0.78 | $3.90 | сложные рассуждения |
| Qwen3.8 Maxqwen/qwen3.8-max | 1.0M | $2.00 | $6.00 | верх линейки |
| Qwen3 Embedding 8Bqwen/qwen3-embedding-8b | 33K | $0.01 | — | поиск по своим документам |
Каталог шлюза OpenRouter на 30.08.2026. У вендора напрямую цена такая же.
Сколько это в рублях за месяц работы
Возьмём реальный объём небольшого проекта: два миллиона входных токенов и полмиллиона выходных за месяц. На Qwen3.7 Flash это $0.125 — около одиннадцати рублей. Тот же объём на Qwen3.8 Max стоит $7, примерно шестьсот рублей.
Почему выходные токены дороже входных
Модель тратит вычисления на генерацию, а не на чтение: прочитать ваш вопрос дешевле, чем написать ответ. Отсюда практическое следствие — просить короткий ответ выгоднее, чем короткий вопрос. Ограничение длины ответа в настройках запроса срезает счёт заметнее, чем сокращение промпта.
Когда переплата за старшую модель оправдана
Разница между Flash и Max — пятьдесят раз в деньгах и один-два процента качества на простых задачах. Max берут там, где цена ошибки выше разницы в счёте: юридические тексты, финансовые расчёты, многошаговые агенты, где ошибка на третьем шаге ломает всю цепочку.
листайте схему вбок
Как подключить Qwen по API из России
- Заведите аккаунт на шлюзе OpenRouter: он принимает пополнение из России и выдаёт один ключ сразу ко всем моделям Qwen.
- Пополните баланс. Российская карта у вендора не проходит, рабочие способы разобраны отдельно: как пополнить OpenRouter.
- Создайте ключ в разделе Keys и сразу поставьте лимит расхода — он защищает баланс при ошибке в коде.
- Укажите модель в формате
qwen/qwen3.7-flash: названия — в таблице выше. - Проверьте первый запрос на маленьком объёме и посмотрите расход в разделе Activity — он показывает стоимость каждого вызова отдельно.
Локальный запуск: что нужно из железа
Веса Qwen открыты, поэтому модель можно поднять у себя и не платить за токены вовсе. Считать здесь нужно не деньги, а память: модель целиком загружается в оперативную или видеопамять, и её объём определяет доступный размер.
Как оценить нужный объём
Ориентир для четырёхбитной квантизации — примерно половина гигабайта на каждый миллиард параметров, плюс запас на контекст. Модель на девять миллиардов параметров укладывается в 16 ГБ, на двадцать семь — требует уже 24 ГБ видеопамяти.
Чем запускать
Без командной строки берут LM Studio: он показывает список моделей и сам подбирает подходящую квантизацию. Для сервера ставят Ollama — она поднимает модель как службу с обычным HTTP-адресом, к которому подключаются приложения. Разбор — на странице Ollama.
Что нужно для локального запуска
| размер модели | квантизация | нужно памяти | где запускается |
|---|---|---|---|
| 3–4B | Q5_K_M | 8–16 ГБ | обычный ноутбук |
| 9B | Q5_K_M | 16 ГБ | ноутбук с запасом или VPS |
| 27–30B | Q4 | 24 ГБ видеопамяти | видеокарта уровня RTX 3090 |
| 72B и выше | Q4 | 48 ГБ и больше | две видеокарты или аренда |
Ориентиры для квантизованных версий. Точный объём зависит от длины контекста: чем он больше, тем больше запас сверх модели.
Когда своё железо дешевле ключа
Арендованный сервер с 16 ГБ памяти стоит около пяти с половиной тысяч рублей в месяц. Чтобы столько же потратить на Qwen3.7 Flash через шлюз, нужно прогнать примерно миллиард входных токенов — объём, которого у небольшого проекта не бывает.
Два случая, когда локальный запуск оправдан
Первый: данные нельзя отдавать во внешний сервис — персональные, медицинские, коммерческая тайна. Второй: нагрузка постоянная и большая, и нужна предсказуемая стоимость вместо счётчика, который растёт вместе с использованием.
Скрытая стоимость своего сервера
К аренде добавляется время: обновления, перезапуск после сбоя, подбор квантизации под память. Первый вечер уходит на установку, дальше — часы в месяц. На маленьком проекте это дороже одиннадцати рублей за ключ, и об этом честнее думать заранее.
Qwen против DeepSeek и Claude
| что сравниваем | Qwen | DeepSeek | Claude |
|---|---|---|---|
| Подписка | нет | нет | от $20 в месяц |
| Цена входа за 1M | $0.03 | $0.03 | $0.25 и выше |
| Открытые веса | да | да | нет |
| Локальный запуск | да | да | нет |
| Оплата из России | через шлюз | через шлюз | через продавца |
Цены младших моделей линейки за миллион входных токенов, каталог OpenRouter на 30.08.2026.
Что выбрать: Qwen или DeepSeek
Практики описывают разницу одинаково: Qwen ровнее правит код и реже переписывает лишнее, DeepSeek сильнее в длинных рассуждениях и разборе текста. Цена входа у младших моделей одинаковая, поэтому решает задача, а не бюджет.
На фоне Claude обе линейки выигрывают в цене на порядок и уступают в предсказуемости на сложных многошаговых задачах. Рабочая схема — один ключ шлюза и переключение модели под задачу. Сравнение по цифрам — в карточке Qwen и в карточке DeepSeek.
Что говорят те, кто работает с обеими
Повторяющееся наблюдение практиков: на правке существующего кода Qwen аккуратнее — он меняет то, что попросили, и не переписывает соседние функции. DeepSeek чаще предлагает переработать логику целиком, что полезно на этапе идеи и мешает на этапе правки.
Как не привязываться к одному вендору
Оба семейства доступны по одному ключу шлюза, и переключение между ними — это замена строки с названием модели. Держать в приложении жёстко зашитое имя модели не стоит: выносите его в настройки, тогда смена вендора займёт минуту, а не день.
Частые вопросы
Нужен ли VPN, чтобы пользоваться Qwen из России?
Можно ли оплатить Qwen российской картой?
Сколько стоит месяц работы с Qwen?
Что лучше для кода — Qwen или DeepSeek?
Какая видеокарта нужна, чтобы запустить Qwen дома?
Чем Qwen отличается от ChatGPT по деньгам?
Что будет, если шлюз перестанет работать?
Подходит ли Qwen для работы с русским языком?
Связанные страницы
Последняя проверка фактов: 30.08.2026. Нашли неточность — напишите редакции.