aibot.

Qwen из России: чат, ключ API и локальный запуск

Обновлено 30 августа 2026 · проверено редакцией

У Qwen нет подписки: вы платите за токены по факту или не платите вовсе, если запустили модель у себя. Из России работают три способа — чат, ключ через шлюз и локальный запуск. Ниже разбор каждого с ценами на 30 августа 2026 года.

Вендор
Alibaba
Веса моделей
открыты
Способов доступа из России
3
Цена за 1M входных токенов
от $0.03 до $2.00
Максимальный контекст
1.0M токенов
Память для локального запуска
от 16 ГБ
Проверено
30.08.2026

Три дороги к Qwen и чем они отличаются

Qwen — семейство моделей Alibaba с открытыми весами. Из России к нему ведут три дороги, и отличаются они не качеством ответа, а тем, что вы отдаёте: деньги, время или собственное железо.

Главное отличие от Claude и ChatGPT в этом разговоре: у Qwen нет подписки. Нечего продлевать каждый месяц и нечего терять при блокировке карты — вы платите за фактические токены или не платите вовсе.

Кому какой способ подходит

Чат подходит, чтобы задать пару вопросов и посмотреть, как модель отвечает на ваших задачах. Ключ через шлюз нужен, когда модель работает внутри вашего кода, бота или агента. Локальный запуск берут те, кому нельзя отдавать данные наружу или кто гоняет большие объёмы каждый день.

листайте схему вбок

Что вам нужно от модели Задать пару вопросов официальный чат · 0 ₽ Работать из кода ключ шлюза · от $0.03 за 1M Не отдавать данные наружу свой сервер · от 16 ГБ памяти регистрация баланс в долларах железо или аренда минута полчаса вечер

Три способа получить Qwen из России

способчто нужносколько стоитсколько времени на запуск
Официальный чатchat.qwen.aiаккаунт Alibaba0 ₽минута
Ключ API через шлюзOpenRouterбаланс в долларахот $0.03 за 1M токеновполчаса
Локальный запускOllama или LM Studio16 ГБ памяти и большестоимость железа или серверавечер

Проверено 30.08.2026. Курс ЦБ на 29.08.2026 — 85,60 ₽ за доллар.

За что списываются деньги, если подписки нет

Оплата идёт за токены — куски слов, которыми модель измеряет и вопрос, и ответ. Миллион токенов — это примерно семьсот тысяч слов, пять-шесть томов средней книги. Активный рабочий день с моделью — десятки тысяч токенов, а не миллионы.

Цена всегда указывается двумя числами: отдельно за входные токены (то, что вы отправили) и отдельно за выходные (то, что модель написала). Выходные дороже входных в три-пять раз, поэтому длинные ответы стоят заметно больше длинных вопросов.

Почему цена внутри линейки различается в шестьдесят раз

Flash-версии рассчитаны на объём: они дешевле и быстрее, их берут на массовую обработку текста, разбор документов и черновики. Max-версии считают дольше и стоят дороже — их держат для сложных многошаговых задач, где ошибка обходится дороже разницы в цене.

Сколько стоят модели Qwen через шлюз

модельконтекствход $/1Mвыход $/1Mна что берут
Qwen3.7 Flashqwen/qwen3.7-flash1.0M$0.03$0.13массовая обработка текста
Qwen3.5-9Bqwen/qwen3.5-9b262K$0.10$0.15дешёвый диалог
Qwen3.8 Flashqwen/qwen3.8-flash1.0M$0.15$0.47повседневные задачи
Qwen3 Coder Flashqwen/qwen3-coder-flash1.0M$0.195$0.975код
Qwen3 Maxqwen/qwen3-max262K$0.78$3.90сложные рассуждения
Qwen3.8 Maxqwen/qwen3.8-max1.0M$2.00$6.00верх линейки
Qwen3 Embedding 8Bqwen/qwen3-embedding-8b33K$0.01—поиск по своим документам

Каталог шлюза OpenRouter на 30.08.2026. У вендора напрямую цена такая же.

Сколько это в рублях за месяц работы

Возьмём реальный объём небольшого проекта: два миллиона входных токенов и полмиллиона выходных за месяц. На Qwen3.7 Flash это $0.125 — около одиннадцати рублей. Тот же объём на Qwen3.8 Max стоит $7, примерно шестьсот рублей.

Почему выходные токены дороже входных

Модель тратит вычисления на генерацию, а не на чтение: прочитать ваш вопрос дешевле, чем написать ответ. Отсюда практическое следствие — просить короткий ответ выгоднее, чем короткий вопрос. Ограничение длины ответа в настройках запроса срезает счёт заметнее, чем сокращение промпта.

Когда переплата за старшую модель оправдана

Разница между Flash и Max — пятьдесят раз в деньгах и один-два процента качества на простых задачах. Max берут там, где цена ошибки выше разницы в счёте: юридические тексты, финансовые расчёты, многошаговые агенты, где ошибка на третьем шаге ломает всю цепочку.

листайте схему вбок

Месяц работы: 2M входных и 0,5M выходных токенов Qwen3.7 Flash11 ₽ Qwen3.8 Flash46 ₽ Qwen3.5-9B62 ₽ Qwen3 Coder Flash75 ₽ Qwen3.8 Max599 ₽

Как подключить Qwen по API из России

  1. Заведите аккаунт на шлюзе OpenRouter: он принимает пополнение из России и выдаёт один ключ сразу ко всем моделям Qwen.
  2. Пополните баланс. Российская карта у вендора не проходит, рабочие способы разобраны отдельно: как пополнить OpenRouter.
  3. Создайте ключ в разделе Keys и сразу поставьте лимит расхода — он защищает баланс при ошибке в коде.
  4. Укажите модель в формате qwen/qwen3.7-flash: названия — в таблице выше.
  5. Проверьте первый запрос на маленьком объёме и посмотрите расход в разделе Activity — он показывает стоимость каждого вызова отдельно.
Ошибка, которая стоит денег. Ключ без лимита расхода в коде, который циклично дёргает модель, опустошает баланс за часы. Лимит ставится в том же окне, где создаётся ключ, и меняется в любой момент.

Локальный запуск: что нужно из железа

Веса Qwen открыты, поэтому модель можно поднять у себя и не платить за токены вовсе. Считать здесь нужно не деньги, а память: модель целиком загружается в оперативную или видеопамять, и её объём определяет доступный размер.

Как оценить нужный объём

Ориентир для четырёхбитной квантизации — примерно половина гигабайта на каждый миллиард параметров, плюс запас на контекст. Модель на девять миллиардов параметров укладывается в 16 ГБ, на двадцать семь — требует уже 24 ГБ видеопамяти.

Чем запускать

Без командной строки берут LM Studio: он показывает список моделей и сам подбирает подходящую квантизацию. Для сервера ставят Ollama — она поднимает модель как службу с обычным HTTP-адресом, к которому подключаются приложения. Разбор — на странице Ollama.

Что нужно для локального запуска

размер моделиквантизациянужно памятигде запускается
3–4BQ5_K_M8–16 ГБобычный ноутбук
9BQ5_K_M16 ГБноутбук с запасом или VPS
27–30BQ424 ГБ видеопамятивидеокарта уровня RTX 3090
72B и вышеQ448 ГБ и большедве видеокарты или аренда

Ориентиры для квантизованных версий. Точный объём зависит от длины контекста: чем он больше, тем больше запас сверх модели.

Когда своё железо дешевле ключа

Арендованный сервер с 16 ГБ памяти стоит около пяти с половиной тысяч рублей в месяц. Чтобы столько же потратить на Qwen3.7 Flash через шлюз, нужно прогнать примерно миллиард входных токенов — объём, которого у небольшого проекта не бывает.

Два случая, когда локальный запуск оправдан

Первый: данные нельзя отдавать во внешний сервис — персональные, медицинские, коммерческая тайна. Второй: нагрузка постоянная и большая, и нужна предсказуемая стоимость вместо счётчика, который растёт вместе с использованием.

Скрытая стоимость своего сервера

К аренде добавляется время: обновления, перезапуск после сбоя, подбор квантизации под память. Первый вечер уходит на установку, дальше — часы в месяц. На маленьком проекте это дороже одиннадцати рублей за ключ, и об этом честнее думать заранее.

Qwen против DeepSeek и Claude

что сравниваемQwenDeepSeekClaude
Подписканетнетот $20 в месяц
Цена входа за 1M$0.03$0.03$0.25 и выше
Открытые весададанет
Локальный запускдаданет
Оплата из Россиичерез шлюзчерез шлюзчерез продавца

Цены младших моделей линейки за миллион входных токенов, каталог OpenRouter на 30.08.2026.

Что выбрать: Qwen или DeepSeek

Практики описывают разницу одинаково: Qwen ровнее правит код и реже переписывает лишнее, DeepSeek сильнее в длинных рассуждениях и разборе текста. Цена входа у младших моделей одинаковая, поэтому решает задача, а не бюджет.

На фоне Claude обе линейки выигрывают в цене на порядок и уступают в предсказуемости на сложных многошаговых задачах. Рабочая схема — один ключ шлюза и переключение модели под задачу. Сравнение по цифрам — в карточке Qwen и в карточке DeepSeek.

Что говорят те, кто работает с обеими

Повторяющееся наблюдение практиков: на правке существующего кода Qwen аккуратнее — он меняет то, что попросили, и не переписывает соседние функции. DeepSeek чаще предлагает переработать логику целиком, что полезно на этапе идеи и мешает на этапе правки.

Как не привязываться к одному вендору

Оба семейства доступны по одному ключу шлюза, и переключение между ними — это замена строки с названием модели. Держать в приложении жёстко зашитое имя модели не стоит: выносите его в настройки, тогда смена вендора займёт минуту, а не день.

Частые вопросы

Нужен ли VPN, чтобы пользоваться Qwen из России?
Для работы по API через шлюз — нет: запросы уходят на его адрес, а не напрямую к Alibaba. Официальный веб-чат открывается не у всех, и это проверяется за минуту — если chat.qwen.ai не пускает, остаются два других способа.
Можно ли оплатить Qwen российской картой?
Напрямую у вендора — нет. Через шлюз баланс пополняется рабочими способами, они разобраны на отдельной странице. Подписки у Qwen нет вообще: списывается только за израсходованные токены.
Сколько стоит месяц работы с Qwen?
На Qwen3.7 Flash два миллиона входных и полмиллиона выходных токенов обходятся примерно в одиннадцать рублей. На Qwen3.8 Max тот же объём — около шестисот рублей.
Что лучше для кода — Qwen или DeepSeek?
Для кода чаще берут Qwen, в частности Coder Flash: он ровнее правит существующий файл. DeepSeek сильнее в разборе текста и длинных рассуждениях.
Какая видеокарта нужна, чтобы запустить Qwen дома?
Для моделей 27–30B в четырёхбитной квантизации нужно 24 ГБ видеопамяти — это уровень RTX 3090. Модели 4–9B запускаются на ноутбуке с 16 ГБ оперативной памяти через LM Studio.
Чем Qwen отличается от ChatGPT по деньгам?
У ChatGPT подписка, которую оплачивают каждый месяц независимо от использования. У Qwen подписки нет: не пользовались — не заплатили, а веса можно скачать и работать без оплаты вовсе.
Что будет, если шлюз перестанет работать?
Модель останется доступна: веса открыты, её можно запустить локально или через другой шлюз. В приложении меняется адрес и название модели, остальной код не трогается.
Подходит ли Qwen для работы с русским языком?
Да, линейка отвечает по-русски без отдельной настройки. На длинных текстах старшие версии держат смысл ровнее младших — это заметно на переводах и редактуре.

Связанные страницы

Последняя проверка фактов: 30.08.2026. Нашли неточность — напишите редакции.