Нейросети с памятью 2026: какая помнит контекст лучше

Опубликовано 26 августа 2026 г. · 19 мин чтения

Если считать по чистому объёму, в 2026 году больше всех за раз держат Gemini и GPT последних версий: миллион токенов. У Claude в базе двести тысяч, а миллион включается отдельной опцией под тяжёлые задачи. Я месяцев шесть выбирал инструмент по этой строчке в таблице и в какой-то момент обнаружил, что она отвечает совсем на другой вопрос. Когда мне нужно, чтобы ассистент через неделю помнил мои цифры, мои продукты и мою манеру писать, размер окна почти ничего для этого не даёт. Работают тут две другие вещи: функция памяти между сессиями и собственная база знаний, которую я собрал один раз и теперь подключаю к любой модели.

Ниже я собрал то, во что упирался сам: как устроено окно, сколько в него реально влезает русского текста, почему модель теряет середину длинного документа, что умеет встроенная память у трёх основных сервисов и как выглядит база знаний, которая переживает и смену чата, и переезд на другой инструмент.

Какая нейросеть держит больше контекста прямо сейчас?

По размеру окна фронт держат три семейства. Gemini и GPT в актуальных версиях дают миллион токенов. У Claude базовое окно - двести тысяч, а миллионное подключается как отдельная опция для длинных задач.

Модель (семейство)Окно контекстаГде неудобно
Gemini (2.5 Pro/Flash)1 млн токеновРусский текст «съедает» больше токенов, чем кажется по объёму файла
GPT (4.1)1 млн токеновУ версий постарше окно заметно меньше, смотри карточку конкретной модели
Claude (Sonnet)200К, до 1 млн опциейМиллионное окно включается отдельно, по умолчанию его нет

Цифры в этой таблице меняются каждые несколько месяцев, поэтому относись к ней как к снимку, а не к вечной истине. Проверяй окно у той конкретной версии, которую тебе выдаёт интерфейс: внутри одного семейства разброс бывает в разы, и «GPT» в приложении и «GPT» в API - часто разные модели с разными лимитами.

Я проверял всю тройку на одной и той же задаче: загрузить объёмный документ и задать по нему десяток вопросов. Разницы, которую я бы почувствовал руками, там не было. Окно начинает играть роль, когда в него отправляешь действительно большие массивы: весь код проекта целиком, сотни писем из выгрузки почты, многочасовые стенограммы созвонов. В повседневной работе я упирался в другое - в то, как модель помнит меня между разговорами. Для типовых сценариев автоматизации мне и среднего окна хватало с запасом, тут полезнее разобраться, с каких задач начать автоматизацию рутины, чем гнаться за строчкой в спецификации.

Окно контекста и память - это одно и то же?

Я сам путал эти вещи месяца три, пока не наступил на грабли несколько раз подряд.

Окно контекста работает как оперативная память внутри одного диалога. Всё, что ты написал в этом чате, модель видит и учитывает, пока чат жив. Открыл новый - и там пусто, история предыдущего разговора туда не переезжает.

Мне помогает картинка с рабочим столом. Пока разговор идёт, на столе лежат все бумаги: твой вопрос, загруженные файлы, предыдущие ответы модели. Она пользуется тем, что видит перед собой. Как только чат закрыт, стол вытирают начисто. Широкое окно делает стол шире, а вот привычку вытирать его в конце оно никак не отменяет.

Память устроена по-другому принципу. Модель откладывает в отдельное хранилище устойчивые факты о тебе: чем ты занимаешься, как тебя зовут, какой тон предпочитаешь в ответах, каких формулировок просил избегать. Это хранилище живёт вне конкретного чата и подтягивается в новые разговоры.

Мне никогда не требовалось, чтобы модель держала в окне всю переписку за год. Требовалось другое: чтобы она знала цены, продукты и внутренние правила в любом новом чате, включая тот, который я открою через месяц. Эту задачу закрывает база знаний для нейросети, собранная руками, а окно контекста к ней отношения почти не имеет.

Сколько русского текста реально влезает в миллион токенов?

Токен - это кусок слова. Для кириллицы он обычно занимает примерно три-четыре символа, для английского получается длиннее, потому что словари токенизаторов собирали в основном на английских корпусах. Практический вывод простой: один и тот же текст на русском займёт в окне в полтора-два раза больше токенов, чем его английский перевод.

Прикидка, которой я пользуюсь на глаз. Страница А4 с обычным кеглем - это около 1800 знаков с пробелами, то есть примерно 500-700 токенов на русском. Значит, в миллион токенов помещается порядка полутора тысяч страниц. Двести тысяч токенов - это уже около трёхсот страниц, чего для большинства рабочих документов хватает за глаза.

Отсюда пара следствий, которые экономят время:

  • Договор на сорок страниц займёт тысяч тридцать токенов. Такое влезает даже в базовое окно Claude с огромным запасом, и гнаться за миллионом ради него бессмысленно.
  • Выгрузка переписки за год - другой разговор. Там счёт идёт на сотни тысяч токенов, и вот тут разница между семействами становится осязаемой.
  • Таблицы и код токенизируются хуже прозы. Куча служебных символов, отступов и повторяющихся заголовков раздувает объём в разы против того, что показывает счётчик слов.

Прикидку на глаз я держу для быстрых решений, а когда речь про регулярную работу через API, объём считается точно: у провайдеров есть отдельный метод подсчёта токенов, который прогоняет твой текст через тот же токенизатор, что и сама модель. Разница между «мне кажется, тут тысяч сорок» и реальной цифрой доходила у меня до полутора раз, причём всегда в сторону увеличения.

Ещё один момент, который сбивает новичков: изображения и PDF со сканами тоже тратят токены, иногда прилично. Загрузил в чат десяток скриншотов - и половина окна ушла, хотя текста ты вроде бы не добавлял.

Почему большое окно не значит, что модель всё помнит?

Широкое окно отвечает за вместимость. Внимание модели оно распределяет неравномерно: даже когда весь текст физически помещается, середина длинного документа обрабатывается заметно хуже, чем начало и конец. У эффекта есть название - lost in the middle, «потеряно в середине». Факт, зашитый в середину стостраничного файла, модель находит реже, чем тот же факт в первом или последнем абзаце.

Я обжёгся на этом достаточно, чтобы выработать три привычки, которые теперь включаю каждый раз при работе с большими объёмами.

  1. Ключевое кладу ближе к запросу. Цифры, ограничения и инструкции я дублирую прямо перед своим вопросом, даже если они уже были в загруженном файле. Хвост диалога модель отрабатывает лучше всего, и это дешёвый способ поднять точность.
  2. Развожу «влезло» и «прочитано внимательно». Загрузил длинный договор, спросил про пункт из середины, получил уверенный и подробный ответ про соседний пункт. Уверенность в тоне никак не связана с попаданием в нужное место, поэтому по оригиналу я теперь перепроверяю всегда.
  3. Режу на куски, где это возможно. Вместо одного гигантского файла отдаю три коротких, собранных по теме вопроса. Точность растёт, ответ приходит быстрее, токенов уходит меньше.

Есть и четвёртый приём, который я подсмотрел у разработчиков: просить модель сначала процитировать те фрагменты, на которые она опирается, и только потом делать вывод. Цитаты сразу показывают, откуда взялся ответ, и ошибка вылезает до того, как ты успел на ней что-то построить.

Что умеет встроенная память у Claude, ChatGPT и Gemini?

Своя память есть у всех троих, но реализована она по-разному, и от этого зависит, что тебе придётся достраивать руками.

ChatGPT запоминает факты о пользователе и ссылается на прошлые чаты. Записи видно в настройках, их можно править и удалять поштучно, а для разовых задач есть временный чат, который в память ничего не кладёт. Мне нравится, что хранилище открыто для просмотра: понятно, что именно модель о тебе «знает».

Claude держит контекст на уровне проекта. Ты создаёшь проект, кладёшь в него файлы и инструкции, и все чаты внутри проекта стартуют уже с этим багажом. Логика получается не «аккаунт помнит меня», а «рабочая папка помнит задачу», и для командной работы это удобнее. Если ты только присматриваешься к инструменту, начни с обзора, что такое Claude и чем он полезен, а по доступу из России есть отдельный разбор - как пользоваться Claude из России.

Gemini опирается на персонализацию через аккаунт Google и подтягивает контекст оттуда. Плюс в том, что он живёт рядом с твоей почтой и документами, минус - в том же самом, если ты не хочешь смешивать личное и рабочее.

Детали у всех трёх меняются от обновления к обновлению, поэтому перед тем как строить на памяти рабочий процесс, зайди в настройки своего аккаунта и посмотри, что там включено прямо сейчас. Выбор между двумя основными сервисами я подробно разбирал в материале Claude или ChatGPT: что выбрать под задачу.

Общая слабость встроенной памяти в том, что она принадлежит сервису. Уходишь на другую модель - и начинаешь заново. Именно поэтому я держу основной контекст снаружи, в обычном документе, который принадлежит мне.

Как заставить любую модель помнить контекст твоего бизнеса?

Встроенной памяти мне не хватило ни в одном инструменте. Я собрал внешнюю базу знаний обычным текстовым документом и подключаю её руками, поэтому контекст переживает и смену чата, и переезд на другой сервис.

  1. Описываю бизнес одним документом. Кто я, что продаю, кому, каким тоном общаюсь, что делать нельзя ни при каких условиях. Мне хватило пары тысяч слов. Фактически это системный промпт: то, что живому сотруднику пришлось бы объяснять голосом в первую неделю, модели ты один раз пишешь текстом.
  2. Выношу факты и цифры в отдельные блоки. Продукты, цены, метрики, типовые ситуации - каждая тема отдельным коротким куском с заголовком. Одна тема - один блок, чтобы модель доставала нужное, а не листала простыню.
  3. Подключаю базу ко всем ролям сразу. Один и тот же контекст получает и «маркетолог», и «продавец», и «аналитик». Каждый цифровой сотрудник начинает разговор уже в курсе дела, и мне не нужно пересказывать одно и то же по три раза.
  4. Обновляю точечно. Поменялась цена - правлю один блок и оставляю остальное как есть. База растёт годами, и целиком она при этом не протухает.

При старте задачи я пишу дословно так: «Вот описание моего бизнеса и база фактов. Держи их как контекст. Если чего-то не хватает, спроси, не выдумывай». Последняя фраза оказалась самой полезной за всё время: без неё модель аккуратно дорисовывает недостающее и выдаёт правдоподобную чушь. У меня она однажды сочинила тариф, которого в прайсе никогда не было, и сочинила очень убедительно.

Ломается конструкция на противоречиях внутри самой базы. Я какое-то время жил с двумя разными ценами на один пакет: поправил блок про продукты, а блок с частыми вопросами забыл. Модель отвечала то одно, то другое в зависимости от формулировки вопроса, и заметил это в итоге клиент. Теперь я раз в месяц вычитываю базу целиком, и часть этой работы отдаю самой модели: прошу найти несостыковки между блоками, а решение по каждой принимаю сам. Какие вопросы тут задавать, я разбирал в материале про ИИ для бизнес-аналитики.

Как выглядит база знаний внутри?

Чтобы это не звучало абстрактно, покажу структуру, к которой я пришёл после нескольких переделок. Это обычный markdown-файл с заголовками, никакой специальной системы.

  • Кто мы. Три-четыре абзаца: чем занимаемся, для кого, чем отличаемся от соседей по рынку. Отсюда модель берёт общий угол зрения.
  • Голос и запреты. Как разговариваем с клиентом, какие слова не используем, где проходит граница обещаний. Раздел с запретами у меня длиннее раздела с рекомендациями, и это себя оправдало.
  • Продукты. По блоку на продукт: название, что входит, для кого, цена, типовые сроки.
  • Цифры. Метрики, на которые я смотрю, и их актуальные значения с датой обновления. Дата тут обязательна, иначе через полгода непонятно, свежий это факт или ископаемое.
  • Частые ситуации. Клиент просит скидку, клиент пропал, клиент недоволен сроком. Короткий сценарий на каждую.
  • Шаблоны. Структура коммерческого предложения, структура письма после созвона, чек-лист перед публикацией.

Каждый блок я стараюсь держать в пределах экрана. Длинные полотна модель читает хуже, да и мне самому проще править короткий кусок, чем выискивать нужную строку в двадцати страницах.

Отдельно веду файл с формулировками, которые сработали. Когда какой-то промпт выдал результат, который я взял в работу без правок, он отправляется туда. Через несколько месяцев такой файл начинает экономить больше времени, чем сама база.

Разборы готовых связок «база плюс роль плюс промпт» мы выкладываем в закрытом канале ИИмперии: там рабочие промпты и шаблоны ролей цифровых сотрудников, чтобы не собирать каждую с нуля.

Как проверить, что модель действительно держит контекст?

Ощущение «вроде всё помнит» обманывает, поэтому у меня есть короткая процедура проверки. Прогоняю её после смены модели, после крупного обновления сервиса и после того, как переношу базу в новый проект.

Первое - десяток контрольных вопросов, ответы на которые лежат в базе однозначно: цена конкретного пакета, срок типовой работы, что мы отвечаем на просьбу о рассрочке. Открываю чистый чат, подключаю базу, задаю их подряд без наводящих уточнений. Пока промахов нет, конструкция меня устраивает. Как только модель мажет на простом факте, иду смотреть, в каком блоке этот факт лежит и почему он не нашёлся.

Второе - контрольная метка в длинном документе. Перед загрузкой я вставляю примерно в середину короткую строчку с редким словом и потом спрашиваю про неё. Ответ показывает, дотягивается ли модель до середины файла именно такого размера, и дальше я уже понимаю, резать документ на части или можно грузить целиком.

Третье - пересказ правил своими словами. В начале работы прошу перечислить, что ей запрещено и каким тоном она должна отвечать. Пересказ отлично вскрывает пропуски: то, чего она не назвала, она и применять не будет, сколько это ни пиши в базе.

Четвёртое - журнал промахов. Каждый неверный ответ я записываю вместе с формулировкой вопроса, и через месяц по этому списку видно, какой раздел базы дырявый. У меня так вылезло, что блок с частыми ситуациями закрывал претензии по срокам и молчал про возвраты. Заодно этот журнал подсказывает, какие задачи вообще стоит отдавать ИИ-ассистенту, а какие пока держать на себе.

Вся проверка занимает минут двадцать. Против получаса разбирательств с клиентом, которому ассистент назвал неверную цену, обмен выгодный.

Сколько это стоит по токенам и времени?

Про деньги думают в последнюю очередь, а зря. Ты платишь за токены на входе, и привычка вываливать в каждый запрос всё подряд бьёт по счёту вполне ощутимо. Забитое до краёв миллионное окно на каждом сообщении - это дорого и медленно, потому что вместе с ценой растёт и время ответа.

Компактная база из главного обходится дешевле и работает быстрее. У меня основной документ занимает несколько тысяч токенов, и этого хватает для девяноста процентов задач. Большие файлы я подгружаю адресно, под конкретный разбор, и после него закрываю чат.

Пара вещей, которые снижают расход:

  • Кэширование контекста. У основных провайдеров есть механизм, при котором повторяющаяся часть промпта считается по льготному тарифу. Если ты гоняешь одну и ту же базу через API десятки раз в день, это заметная экономия.
  • Разные модели под разные задачи. Черновик, классификация писем, разбор коротких заявок отлично отрабатывает младшая быстрая модель. Старшую я включаю там, где нужна сложная логика или чистовой текст.
  • Отказ от «на всякий случай». Каждый файл, который ты добавил в контекст без конкретного вопроса к нему, оплачен и при этом бесполезен.

Со временем работает та же арифметика. Длинный контекст модель обрабатывает дольше, и в интерактивной работе задержка ощущается сильнее счёта: когда ответ идёт полминуты, ты перестаёшь задавать уточняющие вопросы и начинаешь мириться с первым же вариантом. Короткая база возвращает нормальный темп диалога.

Если ты собираешься гонять эти запросы регулярно и по расписанию, имеет смысл сразу смотреть в сторону сценариев: как освоить n8n с нуля - нормальная точка входа, оттуда база подключается к процессу один раз и работает без твоего участия.

Что выбрать под конкретную задачу?

Под разовый разбор большого документа я беру модель с широким окном. Под ежедневную работу - ту, у которой удобнее устроены память и проекты. Поверх обеих ложится моя база знаний, и именно она определяет качество ответов сильнее, чем выбор сервиса.

ЗадачаЧто решаетЧто не поможет
Разобрать длинный договор или стенограммуШирокое окно (Gemini, GPT, Claude-опция)Встроенная память, она тут ни при чём
Ассистент, который знает бизнес каждый деньФункция памяти плюс внешняя база знанийБольшое окно само по себе
Команда ролей с общим контекстомПроекты и база, подключённая ко всем ролямОтдельные чаты без общего источника фактов
Работа с чувствительными даннымиОбезличенная база, человек на контролеЗагрузка клиентской базы прямо в чат
Повторяющиеся операции по расписаниюСценарий в автоматизации с базой на входеРучной чат, который надо каждый раз открывать

Если ты только собираешь свою ИИ-команду, начни с базы и регламентов, а сервис выбирай следом. Порядок сборки я расписывал в материале как собрать ИИ-сотрудника с нуля, а карту того, что вообще имеет смысл автоматизировать первым, - в разборе автоматизации бизнес-процессов с ИИ. Я менял основную модель дважды. Промпты оба раза приходилось переписывать под её манеру, зато факты и регламенты переехали как есть, без единой правки. Эту часть работы я сделал один раз за всё время.

Частые возражения, которые я слышу

«Зачем база, если у ChatGPT есть память?» Встроенная память хорошо держит бытовые предпочтения: как к тебе обращаться, в каком формате давать ответы. Структурированные факты вроде прайса из двенадцати позиций она хранит хуже и подтягивает выборочно. Плюс всё это остаётся внутри одного сервиса, а база в твоём документе работает где угодно, включая тот инструмент, которого ещё нет.

«Модель всё равно выдумывает». Выдумывает она в основном там, где у неё нет фактов. Чем плотнее закрыты типовые вопросы в базе и чем чётче стоит запрет на домысливание, тем реже она уходит в фантазии. Полностью это не лечится, поэтому цифры в исходящих документах я проверяю глазами всегда.

«Долго собирать». Первую рабочую версию я собрал за вечер: описание бизнеса, пять продуктов, десяток частых ситуаций. Всё остальное дописывалось по ходу, когда очередной ответ выходил мимо. Ждать идеальной базы перед запуском смысла нет, она дописывается только в работе.

«У меня маленький бизнес, документов почти нет». Тем быстрее соберётся. Половина ценности такой базы - в том, что ты сам впервые формулируешь письменно, кому и что продаёшь. Хороший стартовый список задач для одного человека есть в подборке ИИ-ассистент для малого бизнеса: 7 задач.

«А если сервис обновится и всё сломается?» Обновления действительно ломают привычные формулировки: та же инструкция после смены версии начинает отрабатывать чуть иначе, где-то меняется длина ответа, где-то модель перестаёт держать формат. Страдают от этого промпты, а факты и регламенты в текстовом файле переживают любое обновление, потому что сервис до них не дотягивается. Мой порядок действий после каждого крупного апдейта: прогнать контрольные вопросы, поправить те промпты, которые поехали, базу не трогать. Тем, кто взвешивает вариант отдать эту возню на сторону, полезен разбор ИИ-агенты под ключ или собрать самому.

«Не хочу, чтобы данные утекли». Разумная позиция. Держи в базе обезличенное: сценарии, регламенты, описания продуктов. Фамилии, телефоны и договорные условия конкретных клиентов туда не попадают вообще.

Где всё равно нужен человек?

Память и широкое окно сняли с меня понятную рутину: держать факты в голове, искать нужный абзац, объяснять одно и то же в каждом новом чате. Дальше начинается зона, где я сижу руками.

Модель дважды предлагала мне дать скидку клиенту, который просил её третий раз подряд. Формально всё сходилось: база разрешает скидку до определённого процента, запрос в лимит укладывался. По-человечески это был момент, когда следовало сказать «нет», и такое решение база за меня не примет никогда, сколько её ни допиливай.

Второй случай проще и обиднее. Я загрузил в чат таблицу с фамилиями клиентов, чтобы быстро посчитать, потом чистил историю и настройки. С тех пор персональные данные в базу и в чаты не попадают вообще, только обезличенные сценарии. Правило звучит скучно, зато его легко проверить.

Есть и третья зона - оценка тона. Модель уверенно пишет вежливо и гладко, но не чувствует, когда клиенту нужна не вежливость, а прямой ответ. Финальную вычитку писем, от которых зависят отношения, я делаю сам.

С чего начать на этой неделе

Порядок, который я бы предложил, если ты читаешь это и пока ничего не собирал.

  1. Открой пустой документ и опиши бизнес на страницу: что продаёшь, кому, чем отличаешься, как разговариваешь с клиентом.
  2. Добавь блоки по продуктам с ценами и сроками. Каждый продукт - отдельный кусок с заголовком.
  3. Выпиши пять ситуаций, которые повторяются чаще всего, и короткий сценарий на каждую.
  4. Загрузи документ в проект или прикрепи к чату, добавь фразу про запрет на домысливание и прогони три реальные рабочие задачи.
  5. Всё, что модель поняла неверно, дописывай в базу тем же вечером. Через пару недель поток правок заметно сходит на нет.

Когда база начнёт работать, следующий логичный шаг - раздать её нескольким ролям и собрать из них связку. Как это устроено, разобрано в материале про ИИ-агентов для бизнеса.

Если хочется пройти этот путь по шагам с проверкой на своих задачах, у нас есть бесплатный курс в личном кабинете: забирай бесплатное обучение - внутри разбор базы знаний, промптов и сборки первых ролей.

А ты на чём сидишь - на встроенной памяти сервиса или на своей базе?

Источники

Частые вопросы

Какая нейросеть держит больше всего контекста в 2026?

По объёму окна впереди Gemini и GPT с миллионом токенов, у Claude миллион включается отдельной опцией. Для работы, растянутой на дни и недели, важнее оказывается функция памяти вместе с твоей базой знаний, размер окна там уходит на второй план.

Окно контекста и память - это одно и то же?

Это разные механизмы. Окно контекста держит переписку внутри одного диалога и обнуляется при открытии нового чата. Память - отдельная функция, которая переносит факты между сессиями.

Сколько текста помещается в миллион токенов?

Грубо это сотни страниц: книги, договоры, годовая переписка. Точный объём зависит от языка, русский текст в токенах тяжелее английского примерно в полтора-два раза.

Почему модель забывает то, что я писал в начале длинного чата?

Даже при большом окне модель хуже использует середину длинного текста, эффект известен как lost in the middle. Ключевые факты лучше дублировать ближе к запросу.

Можно ли доверять ИИ хранить клиентскую базу и цифры?

Хранить персональные данные в чате рискованно. Держи в базе знаний обезличенные факты и регламенты, а чувствительное оставляй в защищённых системах под контролем человека.