РУКОВОДСТВО · ОБНОВЛЕНО 2026-09-15
Контекстное окно нейросети: токены, память и ограничения
Контекстное окно ограничивает объём данных, доступный модели в одном запросе: инструкции, историю, документы, tool results и будущий ответ.
Контекстное окно — максимальный объём токенов, который модель может учитывать в одном вызове. В него входят системная инструкция, сообщения, вложенный текст, описания tools, результаты инструментов и обычно генерируемый ответ. Большое окно позволяет передать больше материала, но не гарантирует одинаковое внимание к каждой детали.
1. Что занимает место в окне
Разработчики часто считают только документ или историю пользователя и забывают системный prompt, схемы tools и служебные сообщения. При каждом новом запросе API модель видит только то, что приложение отправило снова. Если сумма превышает предел route, запрос будет отклонён, обрезан инфраструктурой или потребует сокращения; точное поведение проверяется заранее.
2. Почему контекст не равен долговременной памяти
Обычный API-вызов не хранит факты навсегда. Историю поддерживает приложение: передаёт прошлые сообщения, summary, записи базы или результаты поиска. Даже когда платформа предлагает conversation state, нужно понимать срок хранения и правила данных. Подтверждённые решения лучше хранить структурно, а не надеяться, что модель восстановит их из длинного диалога.
3. Как передавать длинные документы
Сохраните номера страниц, заголовки, версии и идентификаторы фрагментов. Сначала попросите модель составить карту документа, затем извлекайте факты с цитатами и проверяйте их по оригиналу. Несколько файлов не следует склеивать без границ. Если важны таблицы или изображения, выбирайте маршрут с соответствующей modality и проверяйте качество распознавания отдельно.
4. Когда использовать RAG, а когда большое окно
Большое окно удобно для связного анализа ограниченного корпуса, когда отношения между частями важны. RAG подходит для большой или часто обновляемой базы: поиск выбирает релевантные фрагменты перед генерацией. На практике полезен гибрид — retrieval сокращает кандидатов, а достаточный контекст позволяет сопоставить найденные материалы. Выбор проверяется по recall, цитатам, задержке и цене.
5. Как тестировать заявленную длину
Не ограничивайтесь запросом, который технически вернул HTTP 200. Разместите проверяемые факты в начале, середине и конце, добавьте похожие отвлекающие сведения и попросите точные ссылки. Измерьте полноту, ложные совпадения и стоимость. Рабочий лимит может быть ниже максимального, если длинный запрос ухудшает качество или не укладывается в бюджет.
Частые вопросы
Контекстное окно — это память нейросети?
Нет. Это объём одного вызова; сохранение между запросами обеспечивает приложение или отдельная функция платформы.
Ответ тоже входит в лимит?
Во многих API общий предел делится между входом и ответом, но точный контракт зависит от route.
Чем больше контекст, тем выше качество?
Не обязательно: лишние данные создают шум, повышают стоимость и могут скрывать важные фрагменты.
Можно загрузить книгу целиком?
Если формат и объём поддерживаются, технически возможно, но качество поиска деталей нужно проверить на контрольных вопросах.
Как уменьшить историю чата?
Храните подтверждённые факты структурно, сжимайте завершённые ветви и возвращайте только релевантные сообщения.