Llama: модели, контекст, цены и доступ из России
Llama — линейка Meta с открытыми весами, остановившаяся на четвёртом поколении: дальше вендор ушёл в закрытые модели Muse. Ниже: полная таблица моделей семейства с окном контекста и ценой за миллион токенов, разбор того, какую выбрать под задачу, и способы получить доступ из России.
- Вендор
- Meta
- Моделей в каталоге
- 8
- Максимальное окно контекста
- 1.3M
- Цена за 1M входных
- от $0.03 до $0.4
- Доступ из России
- через шлюз без обхода
- Проверено
- 13.08.2026
Что такое Llama и чем отличается
Llama — линейка Meta с открытыми весами, остановившаяся на четвёртом поколении: дальше вендор ушёл в закрытые модели Muse.
В каталоге доступно 8 вариантов этого семейства: от лёгких моделей для потоковых задач до флагманов. Разброс цены внутри семейства — от $0.03 до $0.4 за миллион токенов, то есть в 13 раз.
Что происходит с линейкой Llama
Llama годами была стандартом открытых моделей, но линейка остановилась: последнее поколение вышло в апреле 2025 года, анонсированная старшая модель Behemoth публично так и не появилась, а в 2026 году Meta сменила курс и выпустила закрытую модель Muse под новым подразделением.
Практический вывод: ждать «Llama 5» не стоит — её не существует, несмотря на обилие статей с подробными характеристиками. Актуальные модели семейства — четвёртого поколения, и они по-прежнему одни из лучших среди открытых по соотношению окна контекста и цены.
Что известно про Muse
Первая модель линейки закрытая, доступна только через сервисы Meta. Следом вышла меньшая мультимодальная модель с открытыми весами под свободной лицензией.
Стоит ли начинать с Llama сейчас
Для локального запуска — да, экосистема и инструменты вокруг неё самые зрелые. Для флагманских задач конкуренты ушли вперёд.
Модели Llama: контекст и цены
| модель | контекст | вход $/1M | выход $/1M | рассуждение |
|---|---|---|---|---|
| Llama 4 Scoutmeta-llama/llama-4-scout | 1.3M | $0.1 | $0.3 | нет |
| Llama Guard 4 12Bmeta-llama/llama-guard-4-12b | 1.0M | $0.18 | $0.18 | нет |
| Llama 4 Maverickmeta-llama/llama-4-maverick | 1.0M | $0.2 | $0.7 | нет |
| Llama 3.1 70B Instructmeta-llama/llama-3.1-70b-instruct | 131K | $0.4 | $0.4 | нет |
| Llama 3.1 8B Instructmeta-llama/llama-3.1-8b-instruct | 131K | $0.05 | $0.08 | нет |
| Llama 3.2 3B Instructmeta-llama/llama-3.2-3b-instruct | 131K | $0.05 | $0.33 | нет |
| Llama 3.3 70B Instructmeta-llama/llama-3.3-70b-instruct | 131K | $0.1 | $0.32 | нет |
| Llama 3.2 1B Instructmeta-llama/llama-3.2-1b-instruct | 60K | $0.03 | $0.2 | нет |
Данные каталога OpenRouter на 13.08.2026: цена указана за миллион токенов, отдельно за входные и выходные. У вендора напрямую цена та же. Показаны 8 моделей из 8 — по величине контекста.
листайте схему вбок
Сколько это стоит на практике
Чтобы перевести цену за миллион токенов в понятные величины: типичный запрос с историей диалога — это несколько тысяч токенов на входе и несколько сотен на выходе.
При цене $0.03 за миллион токенов сотня таких запросов обойдётся в доли цента. На флагмане за $0.4 те же сто запросов будут стоить уже заметных денег — именно поэтому выбор модели под задачу важнее любых оптимизаций.
Где деньги уходят незаметно
- Длинная история диалога отправляется заново с каждым сообщением
- Режим рассуждения тратит токены на внутренние размышления
- Повторные прогоны одной задачи после неудачного результата
Что умеют модели Llama
Семейство работает с такими типами данных: изображения, текст. Это не значит, что каждая модель линейки умеет всё — набор отличается от версии к версии, поэтому проверяйте конкретную модель по таблице выше.
Режима рассуждения в семействе нет.
Окно контекста: что в него помещается
Максимум в семействе — 1.3M токенов. Для ориентира: сто тысяч токенов — это примерно семьдесят тысяч слов, то есть средний роман или репозиторий среднего проекта целиком.
Модели семейства с самым большим окном
- Llama 4 Scout — 1.3M
- Llama Guard 4 12B — 1.0M
- Llama 4 Maverick — 1.0M
История линейки Llama: что и когда вышло
| модель | дата релиза | контекст | вход $/1M |
|---|---|---|---|
| Llama 4 Scoutmeta-llama/llama-4-scout | 05.04.2025 | 1.3M | $0.1 |
| Llama 4 Maverickmeta-llama/llama-4-maverick | 05.04.2025 | 1.0M | $0.2 |
| Llama 3.3 70B Instructmeta-llama/llama-3.3-70b-instruct | 07.12.2024 | 131K | $0.1 |
| Llama 3.2 3B Instructmeta-llama/llama-3.2-3b-instruct | 25.09.2024 | 131K | $0.05 |
| Llama 3.2 1B Instructmeta-llama/llama-3.2-1b-instruct | 25.09.2024 | 60K | $0.03 |
| Llama 3.1 70B Instructmeta-llama/llama-3.1-70b-instruct | 23.07.2024 | 131K | $0.4 |
| Llama 3.1 8B Instructmeta-llama/llama-3.1-8b-instruct | 23.07.2024 | 131K | $0.05 |
Даты подтверждены по каталогу и первоисточникам вендора. Версии без подтверждённой даты в таблицу не включены — гадать не будем.
листайте схему вбок
Модели Llama по одной
В каталоге 8 вариантов этого семейства, и разница между ними определяется не названием, а окном контекста и ценой. Ниже разобраны все: что представляет собой каждая и когда её берут.
Llama 4 Scout
Окно контекста 1.3m токенов. вход $0.1, выход $0.3 за миллион токенов. выход дороже входа в 3 раза — длинные ответы обходятся заметно дороже длинных вопросов. принимает текст, изображения. знания до 2024-08-31. вышла 05.04.2025.
Llama Guard 4 12B
Окно контекста 1.0m токенов. вход $0.18, выход $0.18 за миллион токенов. принимает изображения, текст. знания до 2024-08-31.
Llama 4 Maverick
Окно контекста 1.0m токенов. вход $0.2, выход $0.7 за миллион токенов. выход дороже входа в 3 раза — длинные ответы обходятся заметно дороже длинных вопросов. принимает текст, изображения. знания до 2024-08-31. вышла 05.04.2025.
Llama 3.1 70B Instruct
Окно контекста 131k токенов. вход $0.4, выход $0.4 за миллион токенов. самая дорогая модель семейства. принимает текст. знания до 2023-12-31. вышла 23.07.2024.
Llama 3.1 8B Instruct
Окно контекста 131k токенов. вход $0.05, выход $0.08 за миллион токенов. принимает текст. знания до 2023-12-31. вышла 23.07.2024.
Llama 3.2 3B Instruct
Окно контекста 131k токенов. вход $0.05, выход $0.33 за миллион токенов. выход дороже входа в 7 раза — длинные ответы обходятся заметно дороже длинных вопросов. принимает текст. знания до 2023-12-31. вышла 25.09.2024.
Llama 3.3 70B Instruct
Окно контекста 131k токенов. вход $0.1, выход $0.32 за миллион токенов. выход дороже входа в 3 раза — длинные ответы обходятся заметно дороже длинных вопросов. принимает текст. знания до 2023-12-31. вышла 07.12.2024.
Llama 3.2 1B Instruct
Окно контекста 60k токенов. вход $0.03, выход $0.2 за миллион токенов. выход дороже входа в 7 раза — длинные ответы обходятся заметно дороже длинных вопросов. самая дешёвая модель семейства. принимает текст. знания до 2023-12-31. вышла 25.09.2024.
Llama и Qwen: чем отличаются по цифрам
| параметр | Llama | Qwen |
|---|---|---|
| моделей в каталоге | 8 | 50 |
| максимальное окно | 1.3M | 1.0M |
| минимальная цена входа | $0.03 | $0.03 |
| открытые веса | да | да |
Сравнение с ближайшим конкурентом по позиционированию. По минимальной цене входа дешевле Qwen: $0.03 против $0.03. Сравнивать стоит конкретные модели под задачу, а не семейства целиком.
Что вызывает больше всего вопросов на практике
Вся практическая дискуссия вокруг Llama — про железо, а не про качество. Ролики про локальный запуск собирают комментарии в духе «это видео для миллионеров»: под серьёзные модели просят сто двадцать восемь гигабайт оперативной памяти или сборку из нескольких топовых видеокарт.
Второе разочарование — когда «локальное решение» на поверку требует облачных сервисов для поиска и хранения. Настоящая автономность заканчивается там, где начинается внешний API, и это стоит проверять до вложений в оборудование.
Что происходит после скачивания
Типичный отзыв: модель скачали, запустили, а она плохо понимает русский. Младшие версии линейки заметно слабее в русском, и это главный источник разочарования у тех, кто начинает с самых маленьких моделей.
Как проверить без вложений
Сначала арендовать мощность на час или прогнать модель через шлюз, оценить качество на своих задачах и только потом считать бюджет на железо.
Можно ли запустить Llama у себя
Да, у части моделей семейства открытые веса: их разрешено скачать и запустить на своём оборудовании. Это меняет экономику целиком — вместо платы за токены вы платите за железо и электричество, а данные никуда не уходят.
Порог входа — видеопамять. Младшие модели линейки запускаются на одной потребительской карте, флагманы требуют серверных решений и в большинстве случаев дешевле работать через API, чем содержать их у себя.
С чего начать
Проще всего проверить модель локально через Ollama: она ставится в одну команду и позволяет оценить качество на своих задачах до любых вложений.
Как пользоваться Llama из России
Модели этого семейства доступны через шлюз без обхода и без подписки: оплата идёт за использованные токены с общего баланса. Инструкция — на странице пополнения баланса.
Часть моделей семейства имеет открытые веса и может запускаться на собственном оборудовании.
Частые вопросы
Какое железо нужно для локального запуска
Выйдет ли Llama 5
Сколько моделей в семействе Llama
Какая модель Llama самая дешёвая
Какое окно контекста у Llama
Можно ли скачать и запустить Llama на своём сервере
Что выгоднее — подписка или оплата за токены
Насколько свежие знания у моделей Llama
Связанные страницы
- Модели ИИ: каталог с ценами, контекстом и сравнением
- Как пополнить баланс OpenRouter из России в 2026 году
- GigaChat: модели, контекст, цены и доступ из России
- Kimi: модели, контекст, цены и доступ из России
- MiniMax: модели, контекст, цены и доступ из России
- Mistral: модели, контекст, цены и доступ из России
Последняя проверка фактов: 16.08.2026. Нашли неточность — напишите редакции.