aibot.

Контекстное окно: сколько модель удерживает за раз

Обновлено 13 августа 2026 · проверено редакцией

Контекстное окно — это всё, что модель видит в момент ответа: ваш вопрос, историю разговора, инструкции и приложенные файлы. Не память, а именно поле зрения. Как только что-то выходит за его край, для модели этого больше не существует — и она об этом не предупреждает.

Что это
объём текста, видимый модели за один ответ
В чём измеряется
в <a href="/tehnologii/tokeny">токенах</a>
Типичный размер
от 128 тысяч до 1–2 миллионов токенов
Главное заблуждение
что это память между сессиями

листайте схему вбок

Что занимает контекстное окноСистемный промптИнструкции и правилаИстория диалогаВаш вопроссвободноИстория растёт с каждым сообщением и вытесняет всё остальное.Когда места не хватает, модель теряет начало разговора — а не сообщает об этом.Детали в середине длинного контекста удерживаются хуже, чем в начале и в конце
Что занимает окно и что вытесняется первым

Окно — это не память

Самая частая путаница: люди говорят «модель запомнила» про то, что лежит в контексте текущего разговора. Между сессиями модель не помнит ничего — каждый новый разговор начинается с чистого листа.

Как на самом деле работает диалог

При каждом сообщении инструмент заново отправляет модели всю историю разговора целиком. Ощущение памяти создаётся тем, что переписка прикладывается к каждому запросу.

Отсюда неочевидное следствие: длинный разговор дорожает с каждым сообщением, потому что каждый раз оплачивается вся история заново.

Что такое «память» в интерфейсах

Когда сервис обещает, что помнит вас между сессиями, он хранит выжимку отдельно и подкладывает её в начало нового разговора. Это надстройка инструмента, а не свойство модели.

Почему разговор вдруг «глупеет»

Когда история перестаёт помещаться, инструмент обрезает старое или сжимает его в краткий пересказ. Модель продолжает отвечать уверенно, но деталь из начала разговора уже потеряна — и предупреждения об этом обычно нет.

листайте схему вбок

Сколько текста модель удерживает за разокно контекста в токенах · 1M токенов ≈ 700 тысяч словGrok2.0MLlama1.3MGPT и ChatGPT1.1MMiniMax1.0MGemini1.0MGLM1.0M
Порядки размеров окна в привычных единицах

Сколько окна нужно на самом деле

Гонка за миллионами токенов в описаниях моделей создаёт впечатление, что больше всегда лучше. На практике размер окна перестаёт быть узким местом гораздо раньше, чем кажется.

Обычные задачи: до 32 тысяч

Переписка, тексты, разбор документа на несколько страниц. Здесь окно не ограничивает вообще ничего, и переплачивать за размер бессмысленно.

Работа с кодом и документами: 128–200 тысяч

Несколько файлов проекта, договор целиком, долгая рабочая сессия. Это рабочий диапазон для большинства профессиональных задач.

Большие своды: от миллиона

Кодовая база целиком, объёмный архив, длинное видео. Здесь окно действительно решает — но встаёт вопрос цены и качества удержания.

Провал в середине

Детали в середине длинного контекста воспроизводятся хуже, чем в начале и в конце. Это устойчивое свойство, и оно не лечится увеличением окна: положив миллион токенов, вы получите высокую вероятность, что нужное оказалось ровно посередине.

Точечный поиск вместо всего сразу

Поэтому RAG не умер с приходом больших окон: пять релевантных фрагментов работают точнее и дешевле, чем вся база, вываленная в запрос.

Заявленный размер окна и размер, на котором модель работает хорошо, — разные числа. Первое пишут в описании, второе выясняется на своих задачах. Проверять просто: положите длинный документ и спросите про факт из середины.

Окно и деньги

Размер окна влияет на счёт не сам по себе, а через то, чем вы его заполняете: оплачивается фактически отправленное, а не потенциальный максимум.

Почему длинные диалоги дорожают

Двадцатое сообщение в разговоре везёт с собой все девятнадцать предыдущих. При равной длине сообщений стоимость сессии растёт не линейно, а примерно как квадрат числа реплик.

Что с этим делают

Начинают новый разговор под новую задачу вместо бесконечной ленты; выносят постоянные инструкции туда, где они кэшируются; убирают из контекста то, что уже не нужно.

Кэширование неизменной части

Если начало запроса повторяется от вызова к вызову — системные инструкции, справочник, правила, — провайдеры считают его дешевле. Экономия достигает кратной, и это самый доступный рычаг.

Что делать, когда контекст переполнен

  1. Начать новый разговорСамое дешёвое действие. Перенесите в первое сообщение только выводы, а не всю переписку.
  2. Сжать историю осознанноПопросить выжимку из разговора и начать заново с неё лучше, чем позволить инструменту обрезать начало вслепую.
  3. Убрать лишние подключенияКаждый подключённый источник тратит контекст на описание своих действий, даже если не используется.
  4. Заменить «всё сразу» поискомВместо целого свода — найденные фрагменты. Точнее и дешевле.
  5. Проверить, не тот ли это случайЕсли задача требует держать в голове действительно большой объём, стоит смотреть модели с большим окном в каталоге.

Частые вопросы

Что такое контекстное окно простыми словами
Объём текста, который модель видит одновременно при формировании ответа: вопрос, история диалога, инструкции и файлы вместе.
Помнит ли модель прошлые разговоры
Сама модель — нет. Ощущение памяти создаёт инструмент, прикладывая историю к каждому запросу, а «память между сессиями» — это отдельно сохранённая выжимка.
Сколько это в страницах текста
Ориентировочно: 128 тысяч токенов — около 300–400 страниц русского текста, миллион — несколько тысяч страниц. Русский текст расходует токены щедрее английского, точный расчёт — в разборе токенов.
Почему модель забыла то, что я писал в начале
История перестала помещаться в окно, и старая часть была обрезана или сжата. Предупреждения об этом чаще всего нет.
Всегда ли больше окно — лучше
Нет. Качество удержания деталей в середине длинного контекста падает, а стоимость запроса растёт вместе с объёмом отправленного.
Влияет ли размер окна на цену, если я его не заполняю
Нет. Платите за фактически отправленные и полученные токены. Модели с большими окнами бывают дороже за токен, но это отдельное свойство.
Как узнать, сколько контекста я уже занял
Профессиональные инструменты показывают счётчик. В обычных чатах ориентир косвенный: ответы стали терять детали из начала — значит, обрезка уже была.
Как уместить в окно большую базу документов
Не умещать. Подключить поиск по документам и подкладывать только релевантные фрагменты.

Связанные страницы

Последняя проверка фактов: 13.08.2026. Нашли неточность — напишите редакции.