aibot.

Llama: модели, контекст, цены и доступ из России

Обновлено 16 августа 2026 · проверено редакцией

Llama — линейка Meta с открытыми весами, остановившаяся на четвёртом поколении: дальше вендор ушёл в закрытые модели Muse. Ниже: полная таблица моделей семейства с окном контекста и ценой за миллион токенов, разбор того, какую выбрать под задачу, и способы получить доступ из России.

Вендор
Meta
Моделей в каталоге
8
Максимальное окно контекста
1.3M
Цена за 1M входных
от $0.03 до $0.4
Доступ из России
через шлюз без обхода
Проверено
13.08.2026

Что такое Llama и чем отличается

Llama — линейка Meta с открытыми весами, остановившаяся на четвёртом поколении: дальше вендор ушёл в закрытые модели Muse.

В каталоге доступно 8 вариантов этого семейства: от лёгких моделей для потоковых задач до флагманов. Разброс цены внутри семейства — от $0.03 до $0.4 за миллион токенов, то есть в 13 раз.

Что происходит с линейкой Llama

Llama годами была стандартом открытых моделей, но линейка остановилась: последнее поколение вышло в апреле 2025 года, анонсированная старшая модель Behemoth публично так и не появилась, а в 2026 году Meta сменила курс и выпустила закрытую модель Muse под новым подразделением.

Практический вывод: ждать «Llama 5» не стоит — её не существует, несмотря на обилие статей с подробными характеристиками. Актуальные модели семейства — четвёртого поколения, и они по-прежнему одни из лучших среди открытых по соотношению окна контекста и цены.

Что известно про Muse

Первая модель линейки закрытая, доступна только через сервисы Meta. Следом вышла меньшая мультимодальная модель с открытыми весами под свободной лицензией.

Стоит ли начинать с Llama сейчас

Для локального запуска — да, экосистема и инструменты вокруг неё самые зрелые. Для флагманских задач конкуренты ушли вперёд.

Модели Llama: контекст и цены

модельконтекствход $/1Mвыход $/1Mрассуждение
Llama 4 Scoutmeta-llama/llama-4-scout1.3M$0.1$0.3нет
Llama Guard 4 12Bmeta-llama/llama-guard-4-12b1.0M$0.18$0.18нет
Llama 4 Maverickmeta-llama/llama-4-maverick1.0M$0.2$0.7нет
Llama 3.1 70B Instructmeta-llama/llama-3.1-70b-instruct131K$0.4$0.4нет
Llama 3.1 8B Instructmeta-llama/llama-3.1-8b-instruct131K$0.05$0.08нет
Llama 3.2 3B Instructmeta-llama/llama-3.2-3b-instruct131K$0.05$0.33нет
Llama 3.3 70B Instructmeta-llama/llama-3.3-70b-instruct131K$0.1$0.32нет
Llama 3.2 1B Instructmeta-llama/llama-3.2-1b-instruct60K$0.03$0.2нет

Данные каталога OpenRouter на 13.08.2026: цена указана за миллион токенов, отдельно за входные и выходные. У вендора напрямую цена та же. Показаны 8 моделей из 8 — по величине контекста.

листайте схему вбок

Сколько текста модель удерживает за разокно контекста в токенах · 1M токенов ≈ 700 тысяч словLlama 4 Scout1.3MLlama Guard 4 12B1.0MLlama 4 Maverick1.0MLlama 3.1 70B Instruct131KLlama 3.1 8B Instruct131K
Окна контекста внутри семейства Llama. Разница между младшими и старшими моделями бывает кратной.

Сколько это стоит на практике

Чтобы перевести цену за миллион токенов в понятные величины: типичный запрос с историей диалога — это несколько тысяч токенов на входе и несколько сотен на выходе.

При цене $0.03 за миллион токенов сотня таких запросов обойдётся в доли цента. На флагмане за $0.4 те же сто запросов будут стоить уже заметных денег — именно поэтому выбор модели под задачу важнее любых оптимизаций.

Где деньги уходят незаметно

Что умеют модели Llama

Семейство работает с такими типами данных: изображения, текст. Это не значит, что каждая модель линейки умеет всё — набор отличается от версии к версии, поэтому проверяйте конкретную модель по таблице выше.

Режима рассуждения в семействе нет.

Окно контекста: что в него помещается

Максимум в семействе — 1.3M токенов. Для ориентира: сто тысяч токенов — это примерно семьдесят тысяч слов, то есть средний роман или репозиторий среднего проекта целиком.

Модели семейства с самым большим окном

История линейки Llama: что и когда вышло

модельдата релизаконтекствход $/1M
Llama 4 Scoutmeta-llama/llama-4-scout05.04.20251.3M$0.1
Llama 4 Maverickmeta-llama/llama-4-maverick05.04.20251.0M$0.2
Llama 3.3 70B Instructmeta-llama/llama-3.3-70b-instruct07.12.2024131K$0.1
Llama 3.2 3B Instructmeta-llama/llama-3.2-3b-instruct25.09.2024131K$0.05
Llama 3.2 1B Instructmeta-llama/llama-3.2-1b-instruct25.09.202460K$0.03
Llama 3.1 70B Instructmeta-llama/llama-3.1-70b-instruct23.07.2024131K$0.4
Llama 3.1 8B Instructmeta-llama/llama-3.1-8b-instruct23.07.2024131K$0.05

Даты подтверждены по каталогу и первоисточникам вендора. Версии без подтверждённой даты в таблицу не включены — гадать не будем.

листайте схему вбок

Llama на фоне остальных семейств$ за 1M входных токенов · логарифмическая шкалаClaude0.25 — 30.0GPT0.02 — 150.0Gemini0.05 — 2.0DeepSeek0.08 — 1.17Qwen0.03 — 2.0Grok1.0 — 2.0Perplexity Sonar1.0 — 3.0Kimi0.47 — 3.0Mistral0.02 — 2.0Llama0.03 — 0.4MiniMax0.15 — 0.55
Разброс цен внутри каждого семейства. Llama выделено — видно, что дешёвые и дорогие модели есть у всех вендоров.

Модели Llama по одной

В каталоге 8 вариантов этого семейства, и разница между ними определяется не названием, а окном контекста и ценой. Ниже разобраны все: что представляет собой каждая и когда её берут.

Llama 4 Scout

Окно контекста 1.3m токенов. вход $0.1, выход $0.3 за миллион токенов. выход дороже входа в 3 раза — длинные ответы обходятся заметно дороже длинных вопросов. принимает текст, изображения. знания до 2024-08-31. вышла 05.04.2025.

Llama Guard 4 12B

Окно контекста 1.0m токенов. вход $0.18, выход $0.18 за миллион токенов. принимает изображения, текст. знания до 2024-08-31.

Llama 4 Maverick

Окно контекста 1.0m токенов. вход $0.2, выход $0.7 за миллион токенов. выход дороже входа в 3 раза — длинные ответы обходятся заметно дороже длинных вопросов. принимает текст, изображения. знания до 2024-08-31. вышла 05.04.2025.

Llama 3.1 70B Instruct

Окно контекста 131k токенов. вход $0.4, выход $0.4 за миллион токенов. самая дорогая модель семейства. принимает текст. знания до 2023-12-31. вышла 23.07.2024.

Llama 3.1 8B Instruct

Окно контекста 131k токенов. вход $0.05, выход $0.08 за миллион токенов. принимает текст. знания до 2023-12-31. вышла 23.07.2024.

Llama 3.2 3B Instruct

Окно контекста 131k токенов. вход $0.05, выход $0.33 за миллион токенов. выход дороже входа в 7 раза — длинные ответы обходятся заметно дороже длинных вопросов. принимает текст. знания до 2023-12-31. вышла 25.09.2024.

Llama 3.3 70B Instruct

Окно контекста 131k токенов. вход $0.1, выход $0.32 за миллион токенов. выход дороже входа в 3 раза — длинные ответы обходятся заметно дороже длинных вопросов. принимает текст. знания до 2023-12-31. вышла 07.12.2024.

Llama 3.2 1B Instruct

Окно контекста 60k токенов. вход $0.03, выход $0.2 за миллион токенов. выход дороже входа в 7 раза — длинные ответы обходятся заметно дороже длинных вопросов. самая дешёвая модель семейства. принимает текст. знания до 2023-12-31. вышла 25.09.2024.

Llama и Qwen: чем отличаются по цифрам

параметрLlamaQwen
моделей в каталоге850
максимальное окно1.3M1.0M
минимальная цена входа$0.03$0.03
открытые весадада

Сравнение с ближайшим конкурентом по позиционированию. По минимальной цене входа дешевле Qwen: $0.03 против $0.03. Сравнивать стоит конкретные модели под задачу, а не семейства целиком.

Что вызывает больше всего вопросов на практике

Вся практическая дискуссия вокруг Llama — про железо, а не про качество. Ролики про локальный запуск собирают комментарии в духе «это видео для миллионеров»: под серьёзные модели просят сто двадцать восемь гигабайт оперативной памяти или сборку из нескольких топовых видеокарт.

Второе разочарование — когда «локальное решение» на поверку требует облачных сервисов для поиска и хранения. Настоящая автономность заканчивается там, где начинается внешний API, и это стоит проверять до вложений в оборудование.

Что происходит после скачивания

Типичный отзыв: модель скачали, запустили, а она плохо понимает русский. Младшие версии линейки заметно слабее в русском, и это главный источник разочарования у тех, кто начинает с самых маленьких моделей.

Как проверить без вложений

Сначала арендовать мощность на час или прогнать модель через шлюз, оценить качество на своих задачах и только потом считать бюджет на железо.

Можно ли запустить Llama у себя

Да, у части моделей семейства открытые веса: их разрешено скачать и запустить на своём оборудовании. Это меняет экономику целиком — вместо платы за токены вы платите за железо и электричество, а данные никуда не уходят.

Порог входа — видеопамять. Младшие модели линейки запускаются на одной потребительской карте, флагманы требуют серверных решений и в большинстве случаев дешевле работать через API, чем содержать их у себя.

С чего начать

Проще всего проверить модель локально через Ollama: она ставится в одну команду и позволяет оценить качество на своих задачах до любых вложений.

Как пользоваться Llama из России

Модели этого семейства доступны через шлюз без обхода и без подписки: оплата идёт за использованные токены с общего баланса. Инструкция — на странице пополнения баланса.

Часть моделей семейства имеет открытые веса и может запускаться на собственном оборудовании.

Частые вопросы

Какое железо нужно для локального запуска
Для серьёзных моделей линейки речь о десятках гигабайт видеопамяти или сборке из нескольких топовых карт. Младшие версии запускаются проще, но заметно слабее в русском.
Выйдет ли Llama 5
Нет. Линейка остановилась на четвёртом поколении, а Meta перешла к закрытым моделям Muse. Статьи с характеристиками «Llama 5» описывают модель, которой не существует.
Сколько моделей в семействе Llama
В каталоге шлюза сейчас 8 вариантов, включая специализированные и устаревшие версии.
Какая модель Llama самая дешёвая
Минимальная цена в семействе — $0.03 за миллион токенов. Полная таблица приведена выше.
Какое окно контекста у Llama
Максимум в семействе — 1.3M токенов. У разных моделей линейки окно отличается, смотрите таблицу.
Можно ли скачать и запустить Llama на своём сервере
Да, у части моделей семейства открытые веса — запуск возможен, упирается в объём видеопамяти. Проверить качество на своих задачах проще всего через Ollama.
Что выгоднее — подписка или оплата за токены
При ежедневной работе в интерфейсе выгоднее подписка. При обращениях из кода несколько раз в неделю — оплата по факту: она не списывается, когда вы ничего не делаете.
Насколько свежие знания у моделей Llama
Дата отсечки знаний в семействе — 2023-12-31, 2024-08-31. События после неё модель не знает и может их выдумать, поэтому свежие факты проверяйте отдельно.

Связанные страницы

Последняя проверка фактов: 16.08.2026. Нашли неточность — напишите редакции.