Нейросети с памятью 2026: какая помнит контекст лучше
Если считать по чистому объёму, в 2026 году больше всех за раз держат Gemini и GPT последних версий: миллион токенов. У Claude в базе двести тысяч, а миллион включается отдельной опцией под тяжёлые задачи. Я месяцев шесть выбирал инструмент по этой строчке в таблице и в какой-то момент обнаружил, что она отвечает совсем на другой вопрос. Когда мне нужно, чтобы ассистент через неделю помнил мои цифры, мои продукты и мою манеру писать, размер окна почти ничего для этого не даёт. Работают тут две другие вещи: функция памяти между сессиями и собственная база знаний, которую я собрал один раз и теперь подключаю к любой модели.
Ниже я собрал то, во что упирался сам: как устроено окно, сколько в него реально влезает русского текста, почему модель теряет середину длинного документа, что умеет встроенная память у трёх основных сервисов и как выглядит база знаний, которая переживает и смену чата, и переезд на другой инструмент.
Какая нейросеть держит больше контекста прямо сейчас?
По размеру окна фронт держат три семейства. Gemini и GPT в актуальных версиях дают миллион токенов. У Claude базовое окно - двести тысяч, а миллионное подключается как отдельная опция для длинных задач.
| Модель (семейство) | Окно контекста | Где неудобно |
|---|---|---|
| Gemini (2.5 Pro/Flash) | 1 млн токенов | Русский текст «съедает» больше токенов, чем кажется по объёму файла |
| GPT (4.1) | 1 млн токенов | У версий постарше окно заметно меньше, смотри карточку конкретной модели |
| Claude (Sonnet) | 200К, до 1 млн опцией | Миллионное окно включается отдельно, по умолчанию его нет |
Цифры в этой таблице меняются каждые несколько месяцев, поэтому относись к ней как к снимку, а не к вечной истине. Проверяй окно у той конкретной версии, которую тебе выдаёт интерфейс: внутри одного семейства разброс бывает в разы, и «GPT» в приложении и «GPT» в API - часто разные модели с разными лимитами.
Я проверял всю тройку на одной и той же задаче: загрузить объёмный документ и задать по нему десяток вопросов. Разницы, которую я бы почувствовал руками, там не было. Окно начинает играть роль, когда в него отправляешь действительно большие массивы: весь код проекта целиком, сотни писем из выгрузки почты, многочасовые стенограммы созвонов. В повседневной работе я упирался в другое - в то, как модель помнит меня между разговорами. Для типовых сценариев автоматизации мне и среднего окна хватало с запасом, тут полезнее разобраться, с каких задач начать автоматизацию рутины, чем гнаться за строчкой в спецификации.
Окно контекста и память - это одно и то же?
Я сам путал эти вещи месяца три, пока не наступил на грабли несколько раз подряд.
Окно контекста работает как оперативная память внутри одного диалога. Всё, что ты написал в этом чате, модель видит и учитывает, пока чат жив. Открыл новый - и там пусто, история предыдущего разговора туда не переезжает.
Мне помогает картинка с рабочим столом. Пока разговор идёт, на столе лежат все бумаги: твой вопрос, загруженные файлы, предыдущие ответы модели. Она пользуется тем, что видит перед собой. Как только чат закрыт, стол вытирают начисто. Широкое окно делает стол шире, а вот привычку вытирать его в конце оно никак не отменяет.
Память устроена по-другому принципу. Модель откладывает в отдельное хранилище устойчивые факты о тебе: чем ты занимаешься, как тебя зовут, какой тон предпочитаешь в ответах, каких формулировок просил избегать. Это хранилище живёт вне конкретного чата и подтягивается в новые разговоры.
Мне никогда не требовалось, чтобы модель держала в окне всю переписку за год. Требовалось другое: чтобы она знала цены, продукты и внутренние правила в любом новом чате, включая тот, который я открою через месяц. Эту задачу закрывает база знаний для нейросети, собранная руками, а окно контекста к ней отношения почти не имеет.
Сколько русского текста реально влезает в миллион токенов?
Токен - это кусок слова. Для кириллицы он обычно занимает примерно три-четыре символа, для английского получается длиннее, потому что словари токенизаторов собирали в основном на английских корпусах. Практический вывод простой: один и тот же текст на русском займёт в окне в полтора-два раза больше токенов, чем его английский перевод.
Прикидка, которой я пользуюсь на глаз. Страница А4 с обычным кеглем - это около 1800 знаков с пробелами, то есть примерно 500-700 токенов на русском. Значит, в миллион токенов помещается порядка полутора тысяч страниц. Двести тысяч токенов - это уже около трёхсот страниц, чего для большинства рабочих документов хватает за глаза.
Отсюда пара следствий, которые экономят время:
- Договор на сорок страниц займёт тысяч тридцать токенов. Такое влезает даже в базовое окно Claude с огромным запасом, и гнаться за миллионом ради него бессмысленно.
- Выгрузка переписки за год - другой разговор. Там счёт идёт на сотни тысяч токенов, и вот тут разница между семействами становится осязаемой.
- Таблицы и код токенизируются хуже прозы. Куча служебных символов, отступов и повторяющихся заголовков раздувает объём в разы против того, что показывает счётчик слов.
Прикидку на глаз я держу для быстрых решений, а когда речь про регулярную работу через API, объём считается точно: у провайдеров есть отдельный метод подсчёта токенов, который прогоняет твой текст через тот же токенизатор, что и сама модель. Разница между «мне кажется, тут тысяч сорок» и реальной цифрой доходила у меня до полутора раз, причём всегда в сторону увеличения.
Ещё один момент, который сбивает новичков: изображения и PDF со сканами тоже тратят токены, иногда прилично. Загрузил в чат десяток скриншотов - и половина окна ушла, хотя текста ты вроде бы не добавлял.
Почему большое окно не значит, что модель всё помнит?
Широкое окно отвечает за вместимость. Внимание модели оно распределяет неравномерно: даже когда весь текст физически помещается, середина длинного документа обрабатывается заметно хуже, чем начало и конец. У эффекта есть название - lost in the middle, «потеряно в середине». Факт, зашитый в середину стостраничного файла, модель находит реже, чем тот же факт в первом или последнем абзаце.
Я обжёгся на этом достаточно, чтобы выработать три привычки, которые теперь включаю каждый раз при работе с большими объёмами.
- Ключевое кладу ближе к запросу. Цифры, ограничения и инструкции я дублирую прямо перед своим вопросом, даже если они уже были в загруженном файле. Хвост диалога модель отрабатывает лучше всего, и это дешёвый способ поднять точность.
- Развожу «влезло» и «прочитано внимательно». Загрузил длинный договор, спросил про пункт из середины, получил уверенный и подробный ответ про соседний пункт. Уверенность в тоне никак не связана с попаданием в нужное место, поэтому по оригиналу я теперь перепроверяю всегда.
- Режу на куски, где это возможно. Вместо одного гигантского файла отдаю три коротких, собранных по теме вопроса. Точность растёт, ответ приходит быстрее, токенов уходит меньше.
Есть и четвёртый приём, который я подсмотрел у разработчиков: просить модель сначала процитировать те фрагменты, на которые она опирается, и только потом делать вывод. Цитаты сразу показывают, откуда взялся ответ, и ошибка вылезает до того, как ты успел на ней что-то построить.
Что умеет встроенная память у Claude, ChatGPT и Gemini?
Своя память есть у всех троих, но реализована она по-разному, и от этого зависит, что тебе придётся достраивать руками.
ChatGPT запоминает факты о пользователе и ссылается на прошлые чаты. Записи видно в настройках, их можно править и удалять поштучно, а для разовых задач есть временный чат, который в память ничего не кладёт. Мне нравится, что хранилище открыто для просмотра: понятно, что именно модель о тебе «знает».
Claude держит контекст на уровне проекта. Ты создаёшь проект, кладёшь в него файлы и инструкции, и все чаты внутри проекта стартуют уже с этим багажом. Логика получается не «аккаунт помнит меня», а «рабочая папка помнит задачу», и для командной работы это удобнее. Если ты только присматриваешься к инструменту, начни с обзора, что такое Claude и чем он полезен, а по доступу из России есть отдельный разбор - как пользоваться Claude из России.
Gemini опирается на персонализацию через аккаунт Google и подтягивает контекст оттуда. Плюс в том, что он живёт рядом с твоей почтой и документами, минус - в том же самом, если ты не хочешь смешивать личное и рабочее.
Детали у всех трёх меняются от обновления к обновлению, поэтому перед тем как строить на памяти рабочий процесс, зайди в настройки своего аккаунта и посмотри, что там включено прямо сейчас. Выбор между двумя основными сервисами я подробно разбирал в материале Claude или ChatGPT: что выбрать под задачу.
Общая слабость встроенной памяти в том, что она принадлежит сервису. Уходишь на другую модель - и начинаешь заново. Именно поэтому я держу основной контекст снаружи, в обычном документе, который принадлежит мне.
Как заставить любую модель помнить контекст твоего бизнеса?
Встроенной памяти мне не хватило ни в одном инструменте. Я собрал внешнюю базу знаний обычным текстовым документом и подключаю её руками, поэтому контекст переживает и смену чата, и переезд на другой сервис.
- Описываю бизнес одним документом. Кто я, что продаю, кому, каким тоном общаюсь, что делать нельзя ни при каких условиях. Мне хватило пары тысяч слов. Фактически это системный промпт: то, что живому сотруднику пришлось бы объяснять голосом в первую неделю, модели ты один раз пишешь текстом.
- Выношу факты и цифры в отдельные блоки. Продукты, цены, метрики, типовые ситуации - каждая тема отдельным коротким куском с заголовком. Одна тема - один блок, чтобы модель доставала нужное, а не листала простыню.
- Подключаю базу ко всем ролям сразу. Один и тот же контекст получает и «маркетолог», и «продавец», и «аналитик». Каждый цифровой сотрудник начинает разговор уже в курсе дела, и мне не нужно пересказывать одно и то же по три раза.
- Обновляю точечно. Поменялась цена - правлю один блок и оставляю остальное как есть. База растёт годами, и целиком она при этом не протухает.
При старте задачи я пишу дословно так: «Вот описание моего бизнеса и база фактов. Держи их как контекст. Если чего-то не хватает, спроси, не выдумывай». Последняя фраза оказалась самой полезной за всё время: без неё модель аккуратно дорисовывает недостающее и выдаёт правдоподобную чушь. У меня она однажды сочинила тариф, которого в прайсе никогда не было, и сочинила очень убедительно.
Ломается конструкция на противоречиях внутри самой базы. Я какое-то время жил с двумя разными ценами на один пакет: поправил блок про продукты, а блок с частыми вопросами забыл. Модель отвечала то одно, то другое в зависимости от формулировки вопроса, и заметил это в итоге клиент. Теперь я раз в месяц вычитываю базу целиком, и часть этой работы отдаю самой модели: прошу найти несостыковки между блоками, а решение по каждой принимаю сам. Какие вопросы тут задавать, я разбирал в материале про ИИ для бизнес-аналитики.
Как выглядит база знаний внутри?
Чтобы это не звучало абстрактно, покажу структуру, к которой я пришёл после нескольких переделок. Это обычный markdown-файл с заголовками, никакой специальной системы.
- Кто мы. Три-четыре абзаца: чем занимаемся, для кого, чем отличаемся от соседей по рынку. Отсюда модель берёт общий угол зрения.
- Голос и запреты. Как разговариваем с клиентом, какие слова не используем, где проходит граница обещаний. Раздел с запретами у меня длиннее раздела с рекомендациями, и это себя оправдало.
- Продукты. По блоку на продукт: название, что входит, для кого, цена, типовые сроки.
- Цифры. Метрики, на которые я смотрю, и их актуальные значения с датой обновления. Дата тут обязательна, иначе через полгода непонятно, свежий это факт или ископаемое.
- Частые ситуации. Клиент просит скидку, клиент пропал, клиент недоволен сроком. Короткий сценарий на каждую.
- Шаблоны. Структура коммерческого предложения, структура письма после созвона, чек-лист перед публикацией.
Каждый блок я стараюсь держать в пределах экрана. Длинные полотна модель читает хуже, да и мне самому проще править короткий кусок, чем выискивать нужную строку в двадцати страницах.
Отдельно веду файл с формулировками, которые сработали. Когда какой-то промпт выдал результат, который я взял в работу без правок, он отправляется туда. Через несколько месяцев такой файл начинает экономить больше времени, чем сама база.
Разборы готовых связок «база плюс роль плюс промпт» мы выкладываем в закрытом канале ИИмперии: там рабочие промпты и шаблоны ролей цифровых сотрудников, чтобы не собирать каждую с нуля.
Как проверить, что модель действительно держит контекст?
Ощущение «вроде всё помнит» обманывает, поэтому у меня есть короткая процедура проверки. Прогоняю её после смены модели, после крупного обновления сервиса и после того, как переношу базу в новый проект.
Первое - десяток контрольных вопросов, ответы на которые лежат в базе однозначно: цена конкретного пакета, срок типовой работы, что мы отвечаем на просьбу о рассрочке. Открываю чистый чат, подключаю базу, задаю их подряд без наводящих уточнений. Пока промахов нет, конструкция меня устраивает. Как только модель мажет на простом факте, иду смотреть, в каком блоке этот факт лежит и почему он не нашёлся.
Второе - контрольная метка в длинном документе. Перед загрузкой я вставляю примерно в середину короткую строчку с редким словом и потом спрашиваю про неё. Ответ показывает, дотягивается ли модель до середины файла именно такого размера, и дальше я уже понимаю, резать документ на части или можно грузить целиком.
Третье - пересказ правил своими словами. В начале работы прошу перечислить, что ей запрещено и каким тоном она должна отвечать. Пересказ отлично вскрывает пропуски: то, чего она не назвала, она и применять не будет, сколько это ни пиши в базе.
Четвёртое - журнал промахов. Каждый неверный ответ я записываю вместе с формулировкой вопроса, и через месяц по этому списку видно, какой раздел базы дырявый. У меня так вылезло, что блок с частыми ситуациями закрывал претензии по срокам и молчал про возвраты. Заодно этот журнал подсказывает, какие задачи вообще стоит отдавать ИИ-ассистенту, а какие пока держать на себе.
Вся проверка занимает минут двадцать. Против получаса разбирательств с клиентом, которому ассистент назвал неверную цену, обмен выгодный.
Сколько это стоит по токенам и времени?
Про деньги думают в последнюю очередь, а зря. Ты платишь за токены на входе, и привычка вываливать в каждый запрос всё подряд бьёт по счёту вполне ощутимо. Забитое до краёв миллионное окно на каждом сообщении - это дорого и медленно, потому что вместе с ценой растёт и время ответа.
Компактная база из главного обходится дешевле и работает быстрее. У меня основной документ занимает несколько тысяч токенов, и этого хватает для девяноста процентов задач. Большие файлы я подгружаю адресно, под конкретный разбор, и после него закрываю чат.
Пара вещей, которые снижают расход:
- Кэширование контекста. У основных провайдеров есть механизм, при котором повторяющаяся часть промпта считается по льготному тарифу. Если ты гоняешь одну и ту же базу через API десятки раз в день, это заметная экономия.
- Разные модели под разные задачи. Черновик, классификация писем, разбор коротких заявок отлично отрабатывает младшая быстрая модель. Старшую я включаю там, где нужна сложная логика или чистовой текст.
- Отказ от «на всякий случай». Каждый файл, который ты добавил в контекст без конкретного вопроса к нему, оплачен и при этом бесполезен.
Со временем работает та же арифметика. Длинный контекст модель обрабатывает дольше, и в интерактивной работе задержка ощущается сильнее счёта: когда ответ идёт полминуты, ты перестаёшь задавать уточняющие вопросы и начинаешь мириться с первым же вариантом. Короткая база возвращает нормальный темп диалога.
Если ты собираешься гонять эти запросы регулярно и по расписанию, имеет смысл сразу смотреть в сторону сценариев: как освоить n8n с нуля - нормальная точка входа, оттуда база подключается к процессу один раз и работает без твоего участия.
Что выбрать под конкретную задачу?
Под разовый разбор большого документа я беру модель с широким окном. Под ежедневную работу - ту, у которой удобнее устроены память и проекты. Поверх обеих ложится моя база знаний, и именно она определяет качество ответов сильнее, чем выбор сервиса.
| Задача | Что решает | Что не поможет |
|---|---|---|
| Разобрать длинный договор или стенограмму | Широкое окно (Gemini, GPT, Claude-опция) | Встроенная память, она тут ни при чём |
| Ассистент, который знает бизнес каждый день | Функция памяти плюс внешняя база знаний | Большое окно само по себе |
| Команда ролей с общим контекстом | Проекты и база, подключённая ко всем ролям | Отдельные чаты без общего источника фактов |
| Работа с чувствительными данными | Обезличенная база, человек на контроле | Загрузка клиентской базы прямо в чат |
| Повторяющиеся операции по расписанию | Сценарий в автоматизации с базой на входе | Ручной чат, который надо каждый раз открывать |
Если ты только собираешь свою ИИ-команду, начни с базы и регламентов, а сервис выбирай следом. Порядок сборки я расписывал в материале как собрать ИИ-сотрудника с нуля, а карту того, что вообще имеет смысл автоматизировать первым, - в разборе автоматизации бизнес-процессов с ИИ. Я менял основную модель дважды. Промпты оба раза приходилось переписывать под её манеру, зато факты и регламенты переехали как есть, без единой правки. Эту часть работы я сделал один раз за всё время.
Частые возражения, которые я слышу
«Зачем база, если у ChatGPT есть память?» Встроенная память хорошо держит бытовые предпочтения: как к тебе обращаться, в каком формате давать ответы. Структурированные факты вроде прайса из двенадцати позиций она хранит хуже и подтягивает выборочно. Плюс всё это остаётся внутри одного сервиса, а база в твоём документе работает где угодно, включая тот инструмент, которого ещё нет.
«Модель всё равно выдумывает». Выдумывает она в основном там, где у неё нет фактов. Чем плотнее закрыты типовые вопросы в базе и чем чётче стоит запрет на домысливание, тем реже она уходит в фантазии. Полностью это не лечится, поэтому цифры в исходящих документах я проверяю глазами всегда.
«Долго собирать». Первую рабочую версию я собрал за вечер: описание бизнеса, пять продуктов, десяток частых ситуаций. Всё остальное дописывалось по ходу, когда очередной ответ выходил мимо. Ждать идеальной базы перед запуском смысла нет, она дописывается только в работе.
«У меня маленький бизнес, документов почти нет». Тем быстрее соберётся. Половина ценности такой базы - в том, что ты сам впервые формулируешь письменно, кому и что продаёшь. Хороший стартовый список задач для одного человека есть в подборке ИИ-ассистент для малого бизнеса: 7 задач.
«А если сервис обновится и всё сломается?» Обновления действительно ломают привычные формулировки: та же инструкция после смены версии начинает отрабатывать чуть иначе, где-то меняется длина ответа, где-то модель перестаёт держать формат. Страдают от этого промпты, а факты и регламенты в текстовом файле переживают любое обновление, потому что сервис до них не дотягивается. Мой порядок действий после каждого крупного апдейта: прогнать контрольные вопросы, поправить те промпты, которые поехали, базу не трогать. Тем, кто взвешивает вариант отдать эту возню на сторону, полезен разбор ИИ-агенты под ключ или собрать самому.
«Не хочу, чтобы данные утекли». Разумная позиция. Держи в базе обезличенное: сценарии, регламенты, описания продуктов. Фамилии, телефоны и договорные условия конкретных клиентов туда не попадают вообще.
Где всё равно нужен человек?
Память и широкое окно сняли с меня понятную рутину: держать факты в голове, искать нужный абзац, объяснять одно и то же в каждом новом чате. Дальше начинается зона, где я сижу руками.
Модель дважды предлагала мне дать скидку клиенту, который просил её третий раз подряд. Формально всё сходилось: база разрешает скидку до определённого процента, запрос в лимит укладывался. По-человечески это был момент, когда следовало сказать «нет», и такое решение база за меня не примет никогда, сколько её ни допиливай.
Второй случай проще и обиднее. Я загрузил в чат таблицу с фамилиями клиентов, чтобы быстро посчитать, потом чистил историю и настройки. С тех пор персональные данные в базу и в чаты не попадают вообще, только обезличенные сценарии. Правило звучит скучно, зато его легко проверить.
Есть и третья зона - оценка тона. Модель уверенно пишет вежливо и гладко, но не чувствует, когда клиенту нужна не вежливость, а прямой ответ. Финальную вычитку писем, от которых зависят отношения, я делаю сам.
С чего начать на этой неделе
Порядок, который я бы предложил, если ты читаешь это и пока ничего не собирал.
- Открой пустой документ и опиши бизнес на страницу: что продаёшь, кому, чем отличаешься, как разговариваешь с клиентом.
- Добавь блоки по продуктам с ценами и сроками. Каждый продукт - отдельный кусок с заголовком.
- Выпиши пять ситуаций, которые повторяются чаще всего, и короткий сценарий на каждую.
- Загрузи документ в проект или прикрепи к чату, добавь фразу про запрет на домысливание и прогони три реальные рабочие задачи.
- Всё, что модель поняла неверно, дописывай в базу тем же вечером. Через пару недель поток правок заметно сходит на нет.
Когда база начнёт работать, следующий логичный шаг - раздать её нескольким ролям и собрать из них связку. Как это устроено, разобрано в материале про ИИ-агентов для бизнеса.
Если хочется пройти этот путь по шагам с проверкой на своих задачах, у нас есть бесплатный курс в личном кабинете: забирай бесплатное обучение - внутри разбор базы знаний, промптов и сборки первых ролей.
А ты на чём сидишь - на встроенной памяти сервиса или на своей базе?
Источники
- Anthropic Docs - Context windows - как устроено окно контекста у Claude и опция расширенного окна.
- Google AI for Developers - Long context - лимиты окна и работа с длинным контекстом в Gemini.
- OpenAI Platform - Models - актуальные окна контекста моделей GPT.
- Liu et al. «Lost in the Middle: How Language Models Use Long Contexts» - исследование о том, почему модели хуже используют середину длинного контекста.
Частые вопросы
Какая нейросеть держит больше всего контекста в 2026?
По объёму окна впереди Gemini и GPT с миллионом токенов, у Claude миллион включается отдельной опцией. Для работы, растянутой на дни и недели, важнее оказывается функция памяти вместе с твоей базой знаний, размер окна там уходит на второй план.
Окно контекста и память - это одно и то же?
Это разные механизмы. Окно контекста держит переписку внутри одного диалога и обнуляется при открытии нового чата. Память - отдельная функция, которая переносит факты между сессиями.
Сколько текста помещается в миллион токенов?
Грубо это сотни страниц: книги, договоры, годовая переписка. Точный объём зависит от языка, русский текст в токенах тяжелее английского примерно в полтора-два раза.
Почему модель забывает то, что я писал в начале длинного чата?
Даже при большом окне модель хуже использует середину длинного текста, эффект известен как lost in the middle. Ключевые факты лучше дублировать ближе к запросу.
Можно ли доверять ИИ хранить клиентскую базу и цифры?
Хранить персональные данные в чате рискованно. Держи в базе знаний обезличенные факты и регламенты, а чувствительное оставляй в защищённых системах под контролем человека.