Claude Средний

Контекстное окно Claude: сколько помнит и что делать, если забыл

Опубликовано 6 сентября 2026 г. · 20 мин чтения

Контекстное окно Claude - это объём текста, который модель держит перед глазами в одном разговоре: у актуальных моделей порядка 200 тысяч токенов, а в отдельных режимах и планах до миллиона. На русском 200 тысяч токенов - это примерно 70-100 тысяч слов, то есть небольшая книга: договор, три отчёта и часовая переписка туда влезут, а полугодовой рабочий диалог с файлами уже нет. Когда разговор перерастает окно, начало из него вытесняется, и модель отвечает так, будто первых договорённостей не было. Уговоры и «вспомни, я же тебе говорил» тут бесполезны, помогает только внешняя память: свод разговора, Projects и база знаний дела, которая живёт вне чата.

Каждый день в закрытом канале ИИмперии - что нового в работе с ИИ: разборы, готовые промпты и связки, шаблоны ролей цифровых сотрудников. Заходи, если тебе нужны вещи, которые ставятся в работу в тот же день, без новостной ленты про нейросети.

Что такое контекстное окно простыми словами?

Модель каждый раз входит в разговор как актёр, которому перед самым выходом дают прочитать всю пьесу целиком. Он читает, произносит одну реплику и всё забывает, а к следующей реплике ему снова несут пьесу с первой страницы, только теперь она на страницу длиннее. Контекстное окно - максимальная толщина пьесы, которую успевают вложить ему в руки. Между твоими сообщениями за кулисами никто не сидит и ничего не обдумывает.

Цена такого устройства понятна: с каждым шагом перечитывать приходится больше, поэтому длинный чат отвечает медленнее короткого и обходится дороже. Из той же механики следует обрыв - выпавшее из пьесы уже не вернуть, архива за кулисами у модели нет. Если ты только знакомишься с моделью и хочешь понять, чем Claude отличается от других по устройству и характеру, начни оттуда, а сюда вернись за механикой памяти.

Токен - кусок текста, на которые модель режет входящее, и с буквой или словом он совпадает редко. Для английского считают примерно три четверти слова на токен; кириллица режется мельче, и одно русское слово часто стоит два-три токена. Практический вывод простой: русский текст съедает примерно вдвое больше окна, чем английский того же смысла.

Сколько текста реально влезает в окно на русском?

Грубый ориентир: 200 тысяч токенов - это порядка 70-100 тысяч русских слов, или 400-600 страниц обычного текста. Звучит бесконечно, пока ты не начнёшь грузить туда PDF, таблицы и скриншоты. Пара крупных документов уносит половину запаса ещё до того, как ты задал первый содержательный вопрос.

Вот приземлённая прикидка, сколько стоит то, что ты обычно кидаешь в чат. Цифры порядковые: конкретный текст может отличаться в полтора раза в любую сторону.

Что грузишьПримерный расходЧто это значит на практике
Абзац текста (100 слов, рус.)200-300 токеновНезаметно, можно не считать
Часовой созвон в расшифровке8-15 тыс. токенов10-15 таких - и окно кончилось
PDF на 50 страниц25-40 тыс. токеновОдин документ съедает пятую часть окна
Выгрузка продаж, CSV на 2000 строк30-60 тыс. токеновПодавай посчитанные итоги
Скриншот дашборда1-2 тыс. токеновПоштучно мелочь, но десяток уже заметен
Длинная переписка с правками артефактадесятки тысячКаждая версия текста остаётся в контексте

Отдельная ловушка ждёт в итеративной правке: ты просишь переписать лендинг, через пять заходов у тебя пять вариантов, и все они лежат в контексте целиком. Пятнадцать заходов на текст в полторы тысячи слов весят примерно как небольшая книга, и модель начинает подмешивать в свежий вариант формулировки из второго.

Если нужна точная цифра вместо прикидки, у Anthropic есть отдельный метод подсчёта токенов в API - можно прогнать свой реальный документ и увидеть настоящий вес. Для повседневной работы это избыточно, но когда ты собираешь регламент для цифрового сотрудника и хочешь понять, влезет ли он в системную инструкцию вместе с базой, посчитать стоит.

Чем контекстное окно отличается от памяти?

Окно встроено в саму модель, упирается в размер и показывает ей то, что происходит прямо сейчас, в этом чате. Поверх него сервис достраивает кросс-чатовую память, и работает она ближе к заметкам, которые кто-то ведёт за тебя, чем к человеческой памяти.

Дословная картина есть только внутри одного разговора, и умирает она вместе с чатом. Выжимки, которые сервис копит между чатами, лежат в аккаунте, пока ты сам их не сотрёшь, - точности исходного текста там уже нет. Project instructions подставляются в каждый новый чат и каждый раз откусывают кусок окна. База знаний проекта ведёт себя иначе: как только она перерастает размер, при котором её подставляют целиком, включается поиск, и до модели доезжают отдельные найденные фрагменты. Дольше всех живут твои собственные файлы и системы, они переживут смену модели, хотя видит из них модель ровно то, что ты подал.

Размен получается такой, из которого не выпрыгнуть: дословную точность даёт только окно и только на один разговор, а служащая годами база знаний доходит до модели через мутное стекло поиска. Рабочая система держится на обеих сразу.

Эта же логика лежит в основе того, как собирается база знаний для нейросети - там разобрано, что писать в файлы и как их резать, чтобы поиск попадал.

Тут разобран один вопрос: как не терять контекст в работе с Claude. Сам контекст - фундамент под всё остальное: без него цифровые сотрудники каждый раз начинают с нуля, а регламенты живут в твоей голове. Если хочешь увидеть картину целиком, как из отдельных чатов собирается рабочая машина, можно забрать бесплатное обучение.

Почему Claude забывает начало разговора?

Новое вытесняет старое: когда сумма всех сообщений подходит к пределу окна, самые ранние реплики перестают попадать в то, что модель перечитывает перед ответом. Инструкция из первого сообщения физически исчезает из поля зрения, и никакого сигнала об этом ты не получаешь.

Честного «я не помню» не будет, потеря выглядит как тихая подмена: уверенность в ответах прежняя, а твоих правил в них уже нет. Возвращаются восклицательные знаки, от которых ты отказался, где-то всплывает старое название продукта, а отчёт приходит уже не по той структуре, что вы согласовали.

Как это выглядит вживую: разговор на полсотни сообщений, где сначала утвердили список запретных слов для рассылки, потом два часа перебирали заголовки, потом правили абзацы. К письму номер шесть модель выдаёт бодрый заголовок с одним из тех самых слов. Ты пишешь «мы же договорились», получаешь извинение и следующий вариант, снова мимо, потому что самого списка перед глазами у неё уже нет - есть только твоё напоминание в одну строку. Пока список не вернётся в контекст целиком, претензию можно повторять бесконечно.

Есть и второй механизм, он работает даже когда всё формально влезает. Летом 2023-го Нельсон Лью с коллегами из Стэнфорда прогнали языковые модели через простой тест: нужный факт прятали то в начале длинного текста, то в середине, то в конце, и смотрели, вытащит ли модель его обратно. У всех моделей точность держалась по краям текста и заметно падала ближе к середине, отчего работу и назвали «Lost in the Middle». Окна с тех пор выросли в разы, а провал в середине никуда не делся. Поэтому важное держи в начале - системная инструкция, проект - и повторяй в конце, вместо того чтобы закапывать в середину сорока реплик.

Ещё одна причина потерь - мусор, который вытесняет сигнал. Если половина контекста состоит из твоих «ага», «нет, не так», «давай ещё раз» и трёх забракованных версий текста, модель тратит внимание на них наравне с инструкцией, и заполненное под завязку окно почти не содержит полезного.

Как понять, что окно вот-вот кончится?

Интерфейс предупредит поздно, поэтому ориентироваться приходится на поведение модели: признаки видны в самих ответах на десяток реплик раньше любого уведомления.

  1. Формат поплыл. Ты просил маркированный список без вводных - пришёл текст с «Итак, давайте разберём».
  2. Вернулось старое. В новой версии текста всплыла формулировка, которую вы забраковали десять сообщений назад.
  3. Переспрашивает известное. «Уточни, какая у вас целевая аудитория» - при том, что ты описал её в третьем сообщении.
  4. Ответы стали общими. Вместо конкретики про твой бизнес пошли универсальные советы, которые подошли бы кому угодно.
  5. Сервис жалуется на длину. Появилось предупреждение, что длинный разговор быстрее расходует лимиты.

У пятого пункта есть денежная сторона. Раз модель перечитывает всё заново каждый раз, разросшийся чат жжёт лимит кратно быстрее короткого. Пять коротких чатов по делу обходятся дешевле одного марафона на сто сообщений, и результат в них чище.

В Claude Code, где работа идёт с кодовой базой, расход контекста видно напрямую в проценте заполнения, и там же есть команда сжатия истории. В веб-чате такого счётчика нет, ориентируйся на поведение.

Что делать прямо сейчас, если чат начал терять нить?

Уговаривать и спорить с моделью бессмысленно, это только дожигает окно. Сними свод разговора, открой новый чат и начни его со свода. Две минуты работы, и качество ответов возвращается примерно на уровень первых сообщений: все договорённости снова у модели перед глазами.

  1. Попроси свод, пока чат ещё жив. Формулировка, которая работает: «Собери итог этого разговора так, чтобы я мог вставить его в начало нового чата и продолжить без потерь. Разделы: принятые решения, факты о моём бизнесе, договорённости о формате и тоне, что мы уже отбросили и почему, открытые вопросы. Без воды, списком, до 500 слов.»
  2. Проверь свод глазами. Модель на исходе окна уже подвирает, и в свод может не попасть решение, принятое в начале. Прочитай, дополни руками.
  3. Отдельно попроси отметить пробелы. «Что из моего контекста ты сейчас не помнишь точно и хочешь, чтобы я повторил?» Ответ бывает неожиданно честным и показывает, что именно выпало.
  4. Открой новый чат и вставь свод первым сообщением. Начало контекста держится надёжнее всего, туда и идут правила.
  5. Повторяющееся из чата в чат вынеси наружу. Описание бизнеса, тон, стоп-слова, структура отчёта - это постоянная настройка, ей место в Project instructions или в файле, который ты подкладываешь.

Задай в новом чате контрольный вопрос, ответ на который звучал только в старом разговоре. Точный ответ означает, что свод рабочий; если модель начинает гадать, в своде дыра, дополни его руками.

Окно на миллион токенов снимает проблему?

Соблазн понятный: взять режим с окном побольше и забыть про своды. Граница действительно отодвигается, а всё остальное остаётся как было.

Счёт при этом идёт по-старому: перечитывание истории никуда не делось, поэтому чат, разбухший до сотен тысяч токенов, съедает лимит соразмерно своему объёму. Расширенные режимы вдобавок тарифицируются отдельно и открыты не на каждом плане, так что платить приходится с двух сторон одновременно.

С качеством ситуация ещё менее приятная. Провисающая середина при росте контекста становится только глубже: чем больше текста лежит вокруг нужной строки, тем выше шанс, что модель скользнёт мимо неё. Двадцать тысяч токенов отобранного материала обычно дают ответ точнее, чем миллион токенов всего подряд.

Последнее ограничение упирается уже в тебя: разговор на триста сообщений человек проверить не в состоянии, ты сам перестаёшь помнить, что успел согласовать, и начинаешь принимать ответы на веру. Свод возвращает картину договорённостей заодно и тебе, а не одной только модели.

Зачем нужны Projects и что туда класть?

Projects решают ровно одну задачу: убирают необходимость каждый раз объяснять модели, кто ты и как с тобой работать. Инструкции проекта подставляются в каждый чат автоматически, база знаний лежит рядом и подтягивается по делу. Это первый уровень внешней памяти - простой и бесплатный по усилиям.

Что стоит класть в инструкции проекта:

  • кто ты, что за бизнес, кому продаёшь, в двух абзацах без воды;
  • продукты и как они называются - точные названия, чтобы модель не изобретала свои;
  • тон и запреты: обращение, длина предложений, слова-табу;
  • формат по умолчанию для типовых задач;
  • чего не делать никогда - это работает лучше, чем длинные описания идеала.

В базу знаний проекта идут регламенты, примеры удачных текстов, описания процессов, прайс, типовые возражения клиентов, разбор аудитории. Мимо неё - сырые выгрузки на тысячи строк, скан-копии без текстового слоя и всё, что берётся «на всякий случай».

Есть нюанс в том, как эта база подаётся модели. Небольшая уезжает в контекст целиком, и модель читает её дословно, а после роста включается поиск и до модели доходят только найденные куски. Значит, каждый кусок должен быть самодостаточным. Файл «Регламент_финал_v3.docx», где ключевое условие описано на четвёртой странице через отсылку к первой, поиском не соберётся: приедет четвёртая страница без первой. Разбивай по темам, давай осмысленные заголовки, дублируй важное в каждом файле, где оно нужно.

Проверить базу проще всего вопросом, ответ на который лежит ровно в одном файле и сформулирован там другими словами. Общий ответ вместо цитаты из файла означает, что документ слишком длинный либо ключевое условие спрятано за отсылкой к соседнему, и его пора переписать.

Отдельные проекты под направления работают лучше одной свалки: контент, продажи и аналитика требуют разного тона и разных файлов. Общий проект тянет в контекст лишнее из соседних задач и портит поиск. Та же логика действует при разделении зон ответственности, когда ты собираешь ИИ-сотрудника с нуля: у роли должен быть очерченный участок работы вместо всего бизнеса сразу.

Как работает память между чатами и можно ли на неё положиться?

Кросс-чатовая память запоминает выжимки: предпочтения, повторяющиеся факты, стиль работы. Она удобна и заметно снижает трение, но опираться на неё как на систему хранения нельзя - ты не контролируешь, что именно туда попало и в какой формулировке.

Файл в базе знаний написан твоими руками, лежит на виду и правится за минуту, а память набирается сама и без спроса. Туда с равной вероятностью попадёт важное правило и случайная реплика, брошенная в раздражении: однажды буркнул «убери эту таблицу» - и полгода получаешь ответы сплошным текстом, не понимая, откуда это взялось.

Разделение выходит такое: цены, условия договоров, обещания клиентам, юридические формулировки, всё, что стоит денег и репутации, держи в файлах под своим контролем, а памяти оставь мелочь, которая просто экономит время на объяснениях.

Периодически память стоит просматривать и чистить, особенно после того, как ты снял продукт с продажи, поменял цены или перестроил позиционирование. Устаревший факт хуже отсутствующего, потому что модель произносит его уверенно. Такая же беда бывает с цифровым двойником сотрудника, которого один раз настроили и забыли: он продолжает работать по прошлогодней картине мира.

Как писать промпты, чтобы окно не забивалось зря?

Хитрых приёмов тут нет, всё сводится к гигиене: не тащи в чат то, что модели не нужно для этой задачи, выноси повторяющееся в инструкции, а вместо длинных споров переформулируй задание заново.

  1. Одна задача - один чат. Не смешивай разбор рекламы, черновик статьи и разговор про найм. Каждый лишний слой контекста снижает точность по всем трём.
  2. Формулируй правку как новое задание. Вместо «нет, не так, теперь сделай короче, но оставь первый абзац, и убери то, что я просил раньше» выдай чистое ТЗ на следующую версию. Дешевле в токенах и понятнее по смыслу.
  3. Грузи выжимку вместо сырья. Сводная таблица заменяет целую CSV, решения и цитаты заменяют полную расшифровку созвона. Обработку до модели делай сам или отдельным чатом.
  4. Ставь правила в начало. Формат, тон и ограничения перечисляй в первом сообщении - оно доживает до конца разговора надёжнее остальных.
  5. Повтори критичное в конце. Если у задачи есть жёсткое условие, продублируй его в последнем сообщении: «Напомню: без обещаний результата, без цифр, которых нет в моих данных».
  6. Убивай чат вовремя. Как только пошли симптомы из чек-листа - свод и новый чат. Тянуть означает платить лимитом за ухудшающееся качество.

С большими текстами порядок другой: сначала структура и оглавление, потом главы по частям в разных чатах, в каждый подаёшь только нужный кусок и общий свод. Книгу в одном разговоре не написать, к середине модель забудет, о чём была первая глава, и начнёт спорить сама с собой.

Что делать с большими файлами: грузить целиком или резать?

Резать стоит почти всегда, а целиком грузить имеет смысл, когда нужна работа с документом как с целым: найти противоречия в договоре, сверить две версии. Для остальных случаев лучше подать нужный фрагмент и короткое описание, что это за документ и откуда он взялся.

Договор на тридцать страниц, где ищут риски, - как раз тот случай, когда нужен весь текст сразу, и такому разговору лучше не мешать ничем посторонним. Год клиентской переписки, из которой нужны частые возражения, целиком не влезет и не понадобится - собери выборку, попроси разметить по категориям, дальше работай с категориями. Выгрузку продаж на десятки тысяч строк модель считать не должна вовсе: посчитай агрегаты в таблице или скриптом, подай итоги. Что именно спрашивать у модели по цифрам, разложено в материале про ИИ в бизнес-аналитике. Десяток регламентов компании тянет уже на постоянную базу, и место им в Project knowledge. Скан без текстового слоя сначала распознают, а потом работают: иначе модель читает картинку, тратит токены и всё равно врёт в цифрах.

Регулярную обработку файлов вообще стоит выносить из чата в сценарий: когда одно и то же происходит каждую неделю, руками это делать бессмысленно. Как ставится такая обвязка, показано в разборе n8n с нуля, и там же видно, где кончается чат и начинается система.

Где всё это ломается на практике?

Ломается обычно в трёх местах: окно принимают за память, база знаний собрана как архив без внутренней нарезки, а условия сделок так и остались в переписке. Все три ошибки выглядят безобидно ровно до ответа, который ушёл клиенту.

ГраблиКак выглядитЧто делать
«Он же помнит»Новый чат отвечает как незнакомецПравила держать в Project instructions
Свалка вместо базыПоиск по проекту не находит нужноеРезать по темам, самодостаточные куски, внятные заголовки
Отсылки внутри файлов«Согласно п. 1» - а п. 1 не подтянулсяДублировать условие там, где оно применяется
Устаревшие фактыМодель называет прошлогоднюю ценуДата актуальности в каждом файле, ревизия раз в квартал
Марафон на 100 сообщенийОтветы теряют формат при растущем расходе лимитаСвод и новый чат по первым симптомам
Сырьё вместо выжимкиОкно забито, ответ общийАгрегировать до подачи
Одна общая база на всёВ ответ про продажи лезет контент-планРазделить проекты по направлениям

Тише всего ломается доверие к своду. Модель делает выжимку, ты вставляешь её в новый чат и работаешь дальше, а в выжимке потерялось ограничение, которое ты озвучил на двадцатом сообщении. Дальше разговор идёт связно и убедительно, а вылезает пропажа через неделю в письме клиенту. Свод остаётся черновиком, который человек обязан перечитать перед использованием.

И отдельно про доступ: когда разговор рвётся по вине соединения, симптомы похожи на переполненное окно, а лечение совсем другое. Что именно ломается при работе из России и как это обходится, разобрано в инструкции по доступу к Claude.

Чем внешняя память дела отличается от Projects?

Projects запоминают то, что нужно одному инструменту, а внешняя память дела описывает бизнес и не зависит от того, каким сервисом ты пользуешься в этом году. Разница чувствуется в тот момент, когда ты решаешь сменить модель или добавить вторую: знания, запертые внутри одного сервиса, придётся собирать заново.

Внешняя память - это описанное дело: аудитория с её болями, продукты с ценами, реальные цифры вместо желаемых, образцы твоего голоса, разбор сработавших и провалившихся текстов, перечень уже опробованного с пометками, почему брошено. Всё это лежит в файлах, которые ты отдаёшь новой модели, сценарию автоматизации или подрядчику без переделки. В ИИмперии этот слой называется Empire Brain.

Из него же питаются ИИ-агенты: агент без описанного дела быстро совершает бессмысленные действия. Модель снимает рутину - перечитать, свести, переписать, разметить, - и в этой рутине инструменты меняются местами каждые полгода, а файл с описанием твоей аудитории переживёт их все.

С чего начать на этой неделе?

Начни с одного файла и одного проекта, а архитектуру оставь на потом: сначала опиши своё дело на двух страницах и заведи один проект в Claude под это описание. Дальше система наращивается сама, по мере того как ловишь себя на повторных объяснениях одного и того же.

  1. Заведи файл «О деле». Кто аудитория, что продаёшь, названия продуктов, цены, тон, стоп-слова. Уложись в две страницы и пиши живым языком, без корпоративщины.
  2. Создай проект под самую частую задачу. Контент, переписка с клиентами, аналитика - что чаще. Положи туда файл и инструкцию.
  3. Неделю фиксируй повторы. Каждый раз, когда объясняешь модели то, что уже объяснял, записывай в отдельный список. Это твой план по базе знаний.
  4. Отработай ритуал свода. Первый же длинный чат закрой сводом и продолжи в новом, чтобы почувствовать разницу в качестве ответов.
  5. Разнеси по проектам. К концу недели будет видно, где один проект превратился в свалку, - его и разрежь.
  6. Поставь дату ревизии. Раз в квартал перечитать файлы, обновить цены и цифры, выкинуть мёртвое.

Начинать лучше с той рутины, которая жрёт больше всего времени и меньше всего требует твоего вкуса - как выбираются такие задачи, разобрано в материале про автоматизацию рутины и первые задачи. А если хочется сразу понять, что вообще можно снять с себя моделью, есть отдельный разбор задач для ИИ-ассистента в бизнесе.

Свой подход к работе с контекстом Anthropic описывает в документации и инженерном блоге - ссылки ниже, читаются за вечер. Разница между моделями по тому, как они держат контекст, тоже не мелочь: что выбрать под какую задачу - Claude или ChatGPT, зависит в том числе от длины документов, с которыми ты работаешь.

Источники

Частые вопросы

Сколько токенов помнит Claude?

У актуальных моделей стандартное окно - порядка 200 тысяч токенов, у части моделей в API и на отдельных планах доступен режим до миллиона. Точную цифру для своей модели смотри в документации Anthropic, она меняется.

Claude помнит прошлые разговоры?

По умолчанию каждый новый чат стартует чистым. Кросс-чатовая память и Projects добавляют преемственность, но обе эти механики сервис достраивает поверх модели.

Почему модель забыла инструкцию, которую я дал в начале?

Скорее всего, разговор перерос окно и начало из него вытеснено. Вторая частая причина - инструкция утонула в середине длинного контекста среди мусора. Лечится сводом и переносом инструкции в Project instructions.

Длинный чат ест лимиты быстрее?

Да, и заметно: с каждым сообщением модель заново перечитывает всю историю, поэтому один разросшийся чат расходует лимит быстрее, чем пять коротких по делу.

Что лучше: один большой проект или несколько маленьких?

Лучше несколько проектов по направлениям работы. Общая свалка ухудшает поиск по базе и тянет в контекст лишнее из соседних задач.