Контекстное окно: сколько модель удерживает за раз
Контекстное окно — это всё, что модель видит в момент ответа: ваш вопрос, историю разговора, инструкции и приложенные файлы. Не память, а именно поле зрения. Как только что-то выходит за его край, для модели этого больше не существует — и она об этом не предупреждает.
- Что это
- объём текста, видимый модели за один ответ
- В чём измеряется
- в <a href="/tehnologii/tokeny">токенах</a>
- Типичный размер
- от 128 тысяч до 1–2 миллионов токенов
- Главное заблуждение
- что это память между сессиями
листайте схему вбок
Окно — это не память
Самая частая путаница: люди говорят «модель запомнила» про то, что лежит в контексте текущего разговора. Между сессиями модель не помнит ничего — каждый новый разговор начинается с чистого листа.
Как на самом деле работает диалог
При каждом сообщении инструмент заново отправляет модели всю историю разговора целиком. Ощущение памяти создаётся тем, что переписка прикладывается к каждому запросу.
Отсюда неочевидное следствие: длинный разговор дорожает с каждым сообщением, потому что каждый раз оплачивается вся история заново.
Что такое «память» в интерфейсах
Когда сервис обещает, что помнит вас между сессиями, он хранит выжимку отдельно и подкладывает её в начало нового разговора. Это надстройка инструмента, а не свойство модели.
Почему разговор вдруг «глупеет»
Когда история перестаёт помещаться, инструмент обрезает старое или сжимает его в краткий пересказ. Модель продолжает отвечать уверенно, но деталь из начала разговора уже потеряна — и предупреждения об этом обычно нет.
листайте схему вбок
Сколько окна нужно на самом деле
Гонка за миллионами токенов в описаниях моделей создаёт впечатление, что больше всегда лучше. На практике размер окна перестаёт быть узким местом гораздо раньше, чем кажется.
Обычные задачи: до 32 тысяч
Переписка, тексты, разбор документа на несколько страниц. Здесь окно не ограничивает вообще ничего, и переплачивать за размер бессмысленно.
Работа с кодом и документами: 128–200 тысяч
Несколько файлов проекта, договор целиком, долгая рабочая сессия. Это рабочий диапазон для большинства профессиональных задач.
Большие своды: от миллиона
Кодовая база целиком, объёмный архив, длинное видео. Здесь окно действительно решает — но встаёт вопрос цены и качества удержания.
Провал в середине
Детали в середине длинного контекста воспроизводятся хуже, чем в начале и в конце. Это устойчивое свойство, и оно не лечится увеличением окна: положив миллион токенов, вы получите высокую вероятность, что нужное оказалось ровно посередине.
Точечный поиск вместо всего сразу
Поэтому RAG не умер с приходом больших окон: пять релевантных фрагментов работают точнее и дешевле, чем вся база, вываленная в запрос.
Окно и деньги
Размер окна влияет на счёт не сам по себе, а через то, чем вы его заполняете: оплачивается фактически отправленное, а не потенциальный максимум.
Почему длинные диалоги дорожают
Двадцатое сообщение в разговоре везёт с собой все девятнадцать предыдущих. При равной длине сообщений стоимость сессии растёт не линейно, а примерно как квадрат числа реплик.
Что с этим делают
Начинают новый разговор под новую задачу вместо бесконечной ленты; выносят постоянные инструкции туда, где они кэшируются; убирают из контекста то, что уже не нужно.
Кэширование неизменной части
Если начало запроса повторяется от вызова к вызову — системные инструкции, справочник, правила, — провайдеры считают его дешевле. Экономия достигает кратной, и это самый доступный рычаг.
Что делать, когда контекст переполнен
- Начать новый разговорСамое дешёвое действие. Перенесите в первое сообщение только выводы, а не всю переписку.
- Сжать историю осознанноПопросить выжимку из разговора и начать заново с неё лучше, чем позволить инструменту обрезать начало вслепую.
- Убрать лишние подключенияКаждый подключённый источник тратит контекст на описание своих действий, даже если не используется.
- Заменить «всё сразу» поискомВместо целого свода — найденные фрагменты. Точнее и дешевле.
- Проверить, не тот ли это случайЕсли задача требует держать в голове действительно большой объём, стоит смотреть модели с большим окном в каталоге.
Частые вопросы
Что такое контекстное окно простыми словами
Помнит ли модель прошлые разговоры
Сколько это в страницах текста
Почему модель забыла то, что я писал в начале
Всегда ли больше окно — лучше
Влияет ли размер окна на цену, если я его не заполняю
Как узнать, сколько контекста я уже занял
Как уместить в окно большую базу документов
Связанные страницы
Последняя проверка фактов: 13.08.2026. Нашли неточность — напишите редакции.