Ваш AI забывает не потому, что запутался, - у него заканчивается место. У каждой модели есть фиксированное «контекстное окно» - общий объём текста, который она может одновременно удерживать и анализировать. Когда это окно заполняется, чем-то приходится пожертвовать: старые сообщения вытесняются, погребаются под новыми или удаляются полностью.
Последнее обновление: июль 2026 г. · Команда KissMySkills
Что на самом деле представляет собой контекстное окно
Каждый раз, когда вы отправляете сообщение Claude, ChatGPT или Gemini, модель видит не только это сообщение. Она видит весь разговор на данный момент - всё, что вы написали, всё, что она ответила, а также любые прикреплённые документы, изображения или файлы, - объединённые в один ввод. Весь этот набор и есть «контекст». «Окно» - это предел того, какой объём этого контекста модель может обработать за один проход.
Контекстные окна измеряются в токенах - небольших фрагментах текста, составляющих примерно ¾ слова каждый. Модель с окном в 100 000 токенов может вместить около 75 000 слов, включая разговор, документы и инструкции, прежде чем упрётся в ограничение. Звучит немало, пока не вспомнишь, что один 40-страничный PDF-файл, экспорт таблицы или длинная расшифровка встречи могут сами по себе занять десятки тысяч токенов - ещё до того, как вы зададите свой вопрос.
Важно понимать: контекстное окно - это не база данных, в которой модель что-то ищет. Оно скорее похоже на кратковременную память. Для модели вообще не существует ничего за пределами этого окна, а всё, что находится внутри, конкурирует за её ограниченное внимание.
Почему кажется, что AI «забывает»
Люди описывают это как то, что AI «забывает» начало длинного чата или теряет детали из загруженного документа. Это разумный способ описать наблюдаемое явление, но не совсем то, что происходит внутри. Здесь действуют два разных процесса, которые усиливают друг друга.
1. Мягкое забывание: размывание
По мере роста разговора старое содержимое не исчезает - оно лишь составляет всё меньшую долю того, что видит модель. Ранние инструкции, решения или факты получают пропорционально меньший «вес» по сравнению со всем, что было сказано с тех пор. Технически модель по-прежнему имеет доступ к этому содержимому, но ей приходится прилагать больше усилий, чтобы найти его и расставить приоритеты среди всего остального, что втиснуто в окно, и на практике качество в длинных ветках заметно ухудшается: модель противоречит своим прежним ответам, повторяет вопросы, на которые вы уже ответили, или теряет нить сложной инструкции, данной десятью сообщениями ранее.
2. Жёсткое забывание: усечение
Как только разговор фактически превышает жёсткий лимит окна, что-то приходится вырезать, чтобы освободить место для нового ввода. Большинство чат-продуктов решают это, незаметно удаляя или суммируя самые старые сообщения. На этом этапе содержимое не просто размывается - оно действительно исчезает. Модель буквально больше не может его видеть, каким бы важным оно ни было.
Нельзя сказать, что что-либо из этого является именно ошибкой. Это физическое следствие заполнения окна фиксированного размера. Но это означает, что две обычные привычки - вставлять огромный документ и позволять чату становиться длинным и бессвязным - быстрее всего снижают качество результата, часто оставляя вас в недоумении, почему ответы стали хуже.
Скрытая цена «просто загрузить документ»
Загрузка большого файла кажется бесплатной. Но это не так. Большой контракт, исследовательский отчёт или полный набор данных могут занять огромную долю доступного окна ещё до того, как модель обработает хоть одно слово из вашего запроса. Если, например, окно вашей модели вмещает 150 000 токенов, а документ занимает 90 000 из них, у вас остаётся 60 000 для системных инструкций, истории разговора, а также собственных рассуждений и ответа модели - и всё это для задачи, которая действительно может требовать синтеза информации по всему документу.
Именно такая ситуация часто ставит людей в тупик при сложной аналитической работе: маркетинговые отчёты, полные таблиц, финансовые модели, большие массивы исследовательских материалов. Чем больше и запутаннее входные данные, тем меньше места остаётся у AI, чтобы по-настоящему хорошо обдумать, что вы просите сделать с этими данными.
Rafa превращает Claude в старшего специалиста по маркетинговой аналитике именно для такой задачи - разбирает плотные отчёты, дашборды и данные кампаний, не позволяя постоянным инструкциям занимать место, необходимое вашему документу.
Посмотреть Rafa - специалист по маркетинговой аналитике →Почему длинные, бессвязные чаты тоже ухудшают результат
Другая ловушка - марафонский чат: ветка, которую вы никогда не закрываете, потому что в ней «уже есть весь контекст». Каждый обмен сообщениями, каждое заброшенное отступление, каждое «на самом деле, давайте попробуем иначе» остаётся в окне, занимая место и размывая то, что действительно важно. К пятидесятому сообщению модель хранит кучу лишь частично релевантной истории наряду с вашим текущим настоящим запросом - и примерно одинаково учитывает всё это.
Решение не в том, чтобы «никогда не вести долгие разговоры». Нужно осознанно следить за тем, что именно занимает место в этом окне, и убеждаться, что вещи, которым вы хотите придать больший вес, - ваша текущая задача, ваш текущий документ - не тонут среди того, что больше не имеет значения.
Когда нужны файлы Skill
Это практическая причина существования файлов Skill (или системных prompts, пользовательских инструкций, инструкций проекта - одна и та же идея, но разные названия в зависимости от платформы). Файл Skill разделяет два очень разных типа содержимого, которые обычно смешиваются в контекстном окне:
- Постоянные инструкции - кем должна выступать AI, какие стандарты применять и в каком формате выдавать результат. Это не меняется от задачи к задаче.
- Содержание задачи - документ, который вы анализируете, данные, с которыми вы работаете, и реальный разговор о реальной проблеме. Оно меняется каждый раз.
Когда вы вставляете в сам чат длинное, написанное в свободной форме объяснение вроде «веди себя как старший аналитик, следуй этой структуре, используй этот тон, всегда делай X и никогда не делай Y», это объяснение занимает место в окне и конкурирует за пространство и внимание с вашим документом и вопросами - каждый раз, в каждом разговоре. Файл Skill загружает тот же набор инструкций один раз, в компактном виде, как определённую роль, которую принимает на себя модель. Он сформулирован лаконичнее, чем обычное объяснение в ходе переписки, и его не приходится заново обсуждать или объяснять в середине разговора, как это часто бывает со специально составленными инструкциями.
Результат прост: большая часть окна остаётся для того, что действительно меняется, - загруженного вами отчёта, данных, о которых вы спрашиваете, и двадцати дополнительных вопросов в этой сессии. Качество дольше остаётся высоким, потому что модель не делит своё ограниченное внимание между «вспоминанием о том, как ей следует себя вести» и «пониманием того, о чём вы прямо сейчас спрашиваете».
Ryan настраивает Claude для конкретного типа долгосрочной работы руководителя с большим объёмом контекста - подготовки материалов для совета директоров, брифингов и служебных записок с решениями, - где компактная постоянная роль становится всё важнее по мере роста разговора.
Посмотреть Ryan - Chief of Staff →Практические привычки, которые действительно помогают
- Начинайте новые ветки для новых задач. Новый разговор означает чистое окно - никакая размытая история не конкурирует с вашим текущим запросом.
- Храните постоянные инструкции отдельно и в компактном виде. Один раз загруженный файл Skill лучше, чем повторное объяснение ваших ожиданий в каждом чате.
- Сократите объём загружаемых материалов. Если вам нужны только главы 3 и 4, не загружайте всю книгу - каждая ненужная страница отнимает токены, которые модель могла бы потратить на ваш вопрос.
- Суммируйте, прежде чем продолжить. В долгосрочном проекте периодически просите модель (или делайте это сами) сжать ключевые решения на данный момент в краткое резюме, а затем начинайте новую ветку с этим резюме и вашим файлом Skill.
- Следите за тревожными признаками. Повторяющиеся вопросы, противоречащие предыдущим ответам или расплывчатые ответы на конкретные запросы часто указывают на переполненное или усечённое контекстное окно - а не на проблему с prompt.
В итоге:
У каждой модели AI есть фиксированное контекстное окно, и после его заполнения более старое содержимое размывается или отбрасывается - именно это «забывание» вы замечаете, а не растерянность. Большие загружаемые документы и разросшиеся истории чатов используют то же ограниченное пространство. Если ваши постоянные инструкции остаются компактными и отделёнными, как в Rafa (специалист по маркетинговой аналитике) или Ryan (начальник штаба), освобождается место для содержимого документа и задачи, которому оно действительно нужно, - поэтому ответы дольше остаются точными.
Укажите, как именно вы (или ваша команда) используете чаты с AI, и получите реальную оценку ежемесячных потерь токенов и расходов в долларах при повторном вводе prompt по сравнению с постоянным файлом навыка. Регистрация и электронная почта не нужны - только расчёт на основе этого поста и ваших данных.
Попробуйте калькулятор →Часто задаваемые вопросы
Что именно учитывается в контекстном окне?
Всё, что есть в текущем разговоре: ваши сообщения, ответы модели, любые системные prompt или инструкции файла навыка, а также полный текст, извлечённый из прикреплённых файлов или документов. Всё это вместе измеряется в токенах и учитывается в рамках одного общего ограничения.
Действительно ли новый чат решает проблему?
Да, в том смысле, что оно полностью очищает окно - в нём не остаётся размытой истории и риска усечения из-за более раннего фрагмента разговора. Компромисс в том, что вы теряете контекст старой ветки, который не перенесли в новый чат, поэтому лучше добавить в новый чат краткое резюме и файл навыка, а не начинать с нуля.
Почему бы просто не использовать модель с большим контекстным окном?
Большее окно помогает, но не устраняет лежащие в основе этого процессы - размывание и расстановка приоритетов всё ещё происходят при масштабировании, а большие объёмы входных данных по-прежнему требуют реальных токенов, независимо от того, составляет ли предел 100 000 или 1 000 000. Большее окно даёт вам больше места, но не модель, которая автоматически знает, чему отдавать приоритет в этом пространстве.
Чем файл навыка отличается от просто хорошо составленных инструкций в чате?
Оба варианта могут работать, но инструкции, введённые непосредственно в чат, находятся в том же переполненном окне, что и всё остальное, и по мере развития разговора их часто повторяют, им противоречат или они теряются среди другой информации. Файл навыка загружается один раз как определённая роль - компактная и отделённая от содержания задачи, поэтому он не конкурирует за место с документом или данными, с которыми вы фактически работаете.
Связанные материалы: Лучшие навыки Claude для руководителей и начальников штабов · Лучшие маркетплейсы навыков Claude (сравнение)


