Миллион токенов — и ИИ всё равно забыл важное. Как так?
Вы загрузили целую папку документов, а помощник пропустил единственную строчку, ради которой всё затевалось. Большое окно контекста — почему оно не спасло?
Контекст — объём информации, доступной модели в текущей обработке, а не обещание помнить всё навсегда или одинаково точно использовать каждую деталь. Большой лимит помогает вместить материалы, но не заменяет ясную задачу, проверку источников и отдельную организацию долговременной памяти.

Большой стол — ещё не внимательный читатель
Представьте стол, на котором помещаются сотни распечаток. Это удобно: не нужно каждый раз бежать к шкафу. Но сам размер стола не говорит, найдёте ли вы нужную сноску, отличите ли старую редакцию договора от новой и заметите ли противоречие на последней странице.
У контекста похожая роль. В документации OpenAI он описывается как ограниченный объём одной обработки: место требуется входным материалам, ответу и, в соответствующих моделях, токенам рассуждения. Токены — единицы представления информации, а не точное количество русских слов или страниц.
У GPT-6 Astra официально указано окно в 1 050 000 токенов. Это конкретная характеристика модели, не обещание, что любой интерфейс позволит загрузить столько текста. И тем более не гарантия, что ни одно важное условие не будет упущено.
Подробнее: OpenAI: характеристики GPT-6 Astra, OpenAI: состояние разговора и контекст.
Мы называем «памятью» три разные вещи
Из-за одного слова ожидания легко съезжают. Человек видит старый разговор в боковой панели и решает, что все его детали прямо сейчас участвуют в ответе. Или включил персонализацию и ожидает дословного воспроизведения огромного файла через месяц.
Полезнее разделять эти понятия. В справке ChatGPT персонализация описана отдельно: она может переносить полезный контекст и предпочтения между разговорами. Это другой механизм, не синоним размера окна конкретной модели.
| Что имеем в виду | Бытовая аналогия | Чего не следует предполагать |
|---|---|---|
| История переписки | Папка с прошлыми разговорами | Что весь архив целиком используется в каждом ответе |
| Текущий контекст | Материалы на рабочем столе | Что всё на столе будет учтено без ошибок |
| Персонализация и память | Записанные привычки и важные сведения | Что сохранён каждый абзац каждого документа |
Подробнее: ChatGPT Learn: персонализация и память.
Пример: в проекте ремонта потерялось одно «нельзя»
Возьмём условную историю. Вы обсуждаете ремонт кухни, прикладываете замеры, сметы и фотографии. В первом сообщении написали: холодильник переставлять нельзя. Через длинный разговор получаете красивый план, в котором холодильник переехал к другой стене.
Причину нельзя определить по одной картинке. Возможно, ограничение не попало в текущий набор материалов. Возможно, помощник увидел противоречащий ему новый эскиз. А возможно, просто ошибся при построении ответа. Фраза «закончилась память» не является готовым диагнозом.
Для проверки задайте узкий вопрос: «Найди исходное ограничение о холодильнике, покажи источник и объясни, соблюдает ли его этот вариант». Если помощник не находит подтверждение, верните нужный фрагмент. Если находит и всё равно нарушает условие, проблема не решается одной покупкой более длинного контекста.
Важный момент: не просите модель угадать, что она забыла. Дайте проверяемый ориентир. В нашем примере это конкретный предмет и конкретное запрещённое действие, а не общее «ты опять невнимательный».
Что происходит, когда разговор становится слишком длинным
Бесконечно наращивать одну рабочую пачку материалов неудобно. В OpenAI API есть compaction — механизм сокращения контекста с переносом состояния, необходимого для продолжения. В документации отдельно указано, что получающийся компактный элемент не предназначен для чтения человеком.
Это не означает, что каждый разговор в любом приложении обрабатывается одинаково. Способ продолжения зависит от продукта и его реализации. Но сама идея объясняет, почему «мы это когда-то обсуждали» и «все исходные слова сейчас перед моделью» — не одно утверждение.
Для важного проекта полезно иметь и собственную короткую карточку решений. Она не заменяет исходники, зато её можете прочитать вы сами: что согласовано, что запрещено, какие вопросы пока открыты. Если помощник ведёт такую карточку, проверяйте её после существенных изменений.
Подробнее: OpenAI: сокращение контекста — compaction.
Шесть строк, которые полезнее ещё ста вложений
Для нашей кухни рабочая карточка могла бы выглядеть так. Это редакционный пример организации задачи, а не специальная обязательная команда для конкретного сервиса.
- Цель: сравнить два варианта кухни, не создавать третий.
- Актуальные данные: замер от 5 сентября; старый эскиз использовать только как справку.
- Неизменяемое условие: холодильник остаётся на прежнем месте.
- Расчёт бюджета: считать мебель отдельно от техники и доставки.
- Неизвестное: точная цена монтажа ещё не получена, не подставлять выдуманную сумму.
- Ответ: короткое сравнение с указанием, откуда взяты размеры и цены.
Как понять, что большой контекст вам действительно нужен
Он особенно интересен, когда нужно сопоставить много взаимосвязанных материалов: несколько версий инструкции, длинную переписку по одному проекту, взаимозависимые части кода. Здесь возможность держать больше информации рядом имеет понятную ценность.
Если вопрос касается одного пункта, начните с нужного раздела и его окружения. Меньшая подборка не гарантирует правильность, но вам легче проверить, что модель вообще получила правильные документы. Перед отправкой уберите дубли и явно подпишите актуальные версии.
В конце просите не «всё ли учтено?», а проверку по вашему списку ограничений. Для кухни это холодильник, проходы, размеры и бюджет. Для документа — нужные разделы и источники. Главное преимущество такого подхода: ошибку можно увидеть и назвать, а не спорить с расплывчатым ощущением забывчивости.
Вывод простой: длинный контекст расширяет рабочее пространство. Порядок в нём всё ещё приходится организовывать. Хорошо сформулированная задача и проверяемые ссылки на исходники полезны и маленькой модели, и той, которой доступен миллион токенов.
Источники и уточнения
Фактическая часть сверена 7 сентября 2026 года с публикациями разработчиков. Условные сценарии и прогнозы — редакционные предположения, а не результаты тестов или анонсы компаний.
Ещё два важных вопроса
Миллион токенов — это сколько страниц?
Единого точного перевода нет: результат зависит от языка, содержимого и его обработки. Таблицы, код и обычный текст расходуют объём по-разному. Не стоит оценивать лимит только количеством страниц PDF.
Если я открою новый чат, ИИ получит весь предыдущий?
Не следует этого предполагать. История, персонализация и переданные материалы — разные вещи. Для продолжения важной работы приложите проверенную карточку проекта и нужные исходники, а не полагайтесь на догадку о переносе контекста.
По теме
НейросетиКак работает ChatGPT и языковые модели: на пальцах
Как работает ChatGPT простыми словами: что такое языковая модель, токены и предсказание следующего слова, зачем нужен трансформер, RLHF и температу…
НейросетиКак писать промпты для нейросетей: гайд для новичка
Как писать промпты для нейросетей: гайд для новичка. Анатомия хорошего запроса — конкретика, контекст, роль, примеры (few-shot), ограничения и итер…