Claude Средний

Лимиты Claude: почему упираешься в потолок и как этого избежать

Опубликовано 6 сентября 2026 г. · 19 мин чтения

Прямой ответ: лимит в Claude считается токенами, и самый жирный источник расхода - длина чата, в котором ты сидишь. Модель ничего не помнит между репликами. На каждый твой вопрос она заново перечитывает весь диалог с самого начала, поэтому сорок пятое сообщение в длинной ветке обходится в десятки раз дороже первого. Отсюда два лекарства: отдельный чат под каждую задачу и тяжёлая модель только там, где быстрая точно не справится. Ниже разбираю механику расхода и то, как его сбить.

Каждый день в закрытом канале ИИмперии - что нового в работе с ИИ: разборы, готовые промпты и связки, шаблоны ролей цифровых сотрудников. Заходи, если нужен материал, который вставляешь в работу тем же вечером.

Как вообще устроены лимиты Claude?

Потолков два, и путают их постоянно - я сам полгода путал.

Окно контекста определяет, сколько текста модель способна держать перед глазами внутри одного диалога. Квота тарифа задаёт, сколько работы разрешено сделать за отрезок времени, и упирается в неё весь аккаунт целиком, а не отдельная ветка.

Окно контекста измеряется в токенах. Токен - кусочек текста размером обычно меньше слова: в английском примерно три четверти слова, в русском заметно мельче, потому что кириллица дробится сильнее. Базовое окно у актуальных моделей Claude - порядка двухсот тысяч токенов, у части моделей есть режим на миллион. Звучит как бездонная бочка, хотя дно я нащупываю за пару часов работы с документами, и причина этому - в следующем разделе.

Квота тарифа живёт по окнам времени: короткое окно длиной в несколько часов и недельный потолок сверху. Конкретные значения зависят от плана и периодически пересматриваются, так что сверяйся со справкой Anthropic; чужой пост полугодовой давности тут скорее навредит. Запоминать надо логику: внутри окна ты тратишь общий бюджет, и тратит его каждый токен, который уехал в модель и вернулся обратно.

Есть третий слой, про который вспоминают в последнюю очередь: доступность самого сервиса. Если работаешь из России, половина историй «модель перестала отвечать» вообще не про квоты. Что там ломается первым, я разбирал отдельно - доступ к Claude из России. Разделяй эти вещи сразу, иначе полдня уйдёт на починку того, что вообще не ломалось.

Почему длинный чат съедает лимит быстрее короткого?

Потому что памяти между репликами у модели нет. Ты жмёшь отправку, и на сервер уезжает весь диалог целиком: первый вопрос, ответ модели, второй вопрос и так далее до текущего момента. Туда же снова уходят приложенные файлы и системные инструкции, и так на каждом ходу.

Посчитай на пальцах: первое сообщение стоит одну условную порцию, второе тянет уже три (твой текст, ответ модели, новый вопрос), десятое перечитывает почти два десятка реплик, а сороковое тащит на себе тридцать девять предыдущих. Расход по чату растёт примерно как квадрат его длины: удвоил количество реплик - учетверил счёт.

Вот почему жалоба «я задал всего пятнадцать вопросов, а лимит кончился» - абсолютно нормальная картина. Пятнадцать вопросов в ветке, где на третьем ходу ты вкинул договор на сорок страниц, - это пятнадцать перечитываний договора. Он уехал в модель пятнадцать раз подряд, и за каждый заход ты заплатил.

Отсюда же понятно, почему совет «удали лишние сообщения» не даёт ничего. Пока история физически лежит в диалоге, она уходит в модель на каждом ходу. Выкинуть балласт можно единственным способом - открыть новый чат.

Перерасход тут ещё полбеды. Хуже, что внимание модели размазывается по всему содержимому окна, и середина диалога начинает проседать: она смешивает первую версию текста с четвёртой, тянет отменённые правки, путает клиентов. Простая физика: чем больше сена, тем труднее иголка.

Когда пора начинать новый чат?

Базовый ориентир: одна задача - один чат, и закрывать его вместе с задачей. Сверх этого есть четыре сигнала, по которым ветку стоит закрывать досрочно, даже когда задача формально та же. Токены считать не придётся, достаточно замечать, как ведёт себя диалог.

СигналЧто происходит на самом делеЧто делать
Ответы стали медленнее, чем в начале веткиМодель перечитывает разросшуюся историюНовый чат с выжимкой
Модель тянет отменённые правки и старые версииВ окне лежат все варианты сразу, приоритета у последнего нетНовый чат, в него только финальную версию
Ты сам листаешь вверх, чтобы вспомнить, о чём договорилисьДиалог превратился в архив, работать по нему уже неудобноВынести договорённости в файл, чат закрыть
Тема поехала: начинали с лендинга, обсуждаете наймПоловина окна занята нерелевантным грузомРазнести по двум чатам

Отдельная история - предупреждение интерфейса о том, что диалог подходит к пределу длины. Многие читают его как приглашение дожать ещё чуть-чуть, хотя это последний вагон: дальше пойдёт либо отказ, либо потеря начала разговора, причём ровно посреди работы.

Психологически закрывать чат, в который вложено два часа, тяжело - у меня каждый раз рука не поднимается. Кажется, что там накоплено что-то ценное. Ценное действительно есть, но помещается оно в два-три абзаца решений, которые переносятся за минуту. Остальное содержимое ветки работает как протокол совещания, который никто никогда не перечитает.

Эта статья закрывает один вопрос: почему упираешься в потолок и как перестать. Но без понимания, как расходуется контекст, любой цифровой сотрудник упрётся в тот же потолок на второй неделе. Хочешь разобраться системно - забрать бесплатное обучение можно на aiimperia.ru: доступ по почте, материал открывается сразу.

Что делать, чтобы не потерять контекст при переезде в новый чат?

Через границу переезжает только итог работы, вся переписка остаётся в старой ветке.

Перед закрытием диалога попроси модель собрать выжимку и вставь её первым сообщением в новый чат. Минута времени - и новый диалог стартует с чистым окном, но с полным пониманием, где вы остановились.

Формулировка, которую я копирую как есть:

Собери итог нашей работы для передачи в новый чат. Только то, что нужно для продолжения: задача, принятые решения, финальные формулировки, что осталось сделать, какие варианты мы отклонили и почему. Без пересказа обсуждения. Уложись в 15 строк.

Последний пункт про отклонённые варианты важнее, чем выглядит. Без него в новом чате модель бодро предложит ровно то, что вы забраковали час назад. И ты пойдёшь по второму кругу с ощущением дежавю.

Выжимку стоит пробежать глазами до вставки. Модель любит округлять цифры, терять имена и сокращать формулировки, которые вы полчаса вылизывали, поэтому финальные куски текста я вставляю в новый чат руками из исходника, а не из пересказа. На это уходит секунд двадцать, зато потом не выясняется, что в заголовок уехала не та версия.

Постоянный контекст лучше вообще держать снаружи чата. Тон бренда, продукты, цены, портрет аудитории, стоп-слова: всё в один файл, который прикладывается на старте нужных диалогов. Такой файл снимает половину пересказов. Как я собирал свой, чтобы модель им реально пользовалась, - в разборе про базу знаний для нейросети.

Ещё помогает развести роли по разным веткам: тексты в одной, аналитика в другой, клиентская переписка в третьей. Смешивать их в одном окне удобно ровно до момента, когда модель начинает отвечать клиенту в стиле аналитической записки. Логика та же, по которой я собирал ИИ-сотрудника с нуля: у каждой роли свой вход, свой контекст и свой результат.

Какую модель брать под какую задачу?

Правило дешёвое и рабочее: лёгкая модель идёт на объём, тяжёлая - на цену ошибки. На Haiku уходит рутина, где важны скорость и повторяемость, Sonnet вывозит большинство повседневных задач, а Opus берёт то, где надо долго думать, держать в голове длинный документ и не промахнуться в выводе. Между этими тремя и раскладывается рабочий день.

МодельЧто тянет спокойноКогда не подходит
HaikuСортировка заявок, теги, короткие ответы, извлечение полей из писем, черновики карточек, массовая переписка однотипных текстовДлинный документ, многошаговое рассуждение, финальный текст на публикацию
SonnetСтатьи и письма, разбор таблицы, скрипты продаж, правки по замечаниям, повседневный рабочий диалогЗадачи, где нужен разбор большого объёма разом и высокая цена ошибки
OpusСтратегия, аудит длинного договора, разбор кода, сведение цифр из нескольких источников, сложные многоходовкиВсё, что делается за десять секунд: жечь на этом тяжёлую модель дорого и бессмысленно

Типовая ошибка - моя любимая, потому что я делал её месяцами. Берёшь самую сильную модель «чтобы наверняка» и просишь её переформулировать заголовок. Заголовок выходит отличный, а через три часа лимит кончается, и впереди стоял разбор годового отчёта, ради которого тяжёлая модель и покупалась.

Обратная ошибка встречается реже, но стоит дороже. Лёгкая модель уверенно и быстро выдаёт правдоподобный разбор договора, ты его принимаешь, а проверить некому. Быстрая модель никогда не скажет «я не потянула» - она просто ответит. Поэтому граница проходит по цене ошибки: если за неверный ответ платишь деньгами или репутацией, работу делает тяжёлая модель, а результат всё равно смотрит человек.

Границу для конкретного типа задач проще нащупать экспериментом, чем спором с самим собой. Возьми задачу, которую делаешь регулярно, прогони её один раз на лёгкой модели и один раз на тяжёлой с тем же промптом и теми же вложениями, а результаты положи рядом. Обычно после такой проверки половина списка переезжает вниз по весу навсегда, а оставшаяся половина получает внятное обоснование, почему её нельзя отдавать быстрой модели. Повторять такое сравнение имеет смысл после каждого крупного обновления моделей: то, что год назад тянул только Opus, сегодня нередко закрывается средней моделью.

Выбираешь между экосистемами целиком - это соседний разговор, я вынес его в Claude против ChatGPT под задачи бизнеса. Здесь только внутренняя кухня Claude.

Как переключение моделей выглядит в реальной работе?

Как конвейер из двух-трёх ступеней вместо одного длинного разговора с самой умной моделью. Черновик и сортировку делает быстрая, сборку и финал - тяжёлая, между ними стоишь ты и решаешь, что вообще идёт дальше по трубе. Живой пример из моей практики: рассылка по базе клиентов после запуска нового тарифа.

  1. Разбор базы. Выгрузка клиентов раскладывается по сегментам: кто покупал, кто отвалился, кто ни разу не платил. Механическая работа с чёткими правилами, лёгкая модель справляется и делает это быстро.
  2. Черновики писем. По одному варианту на сегмент. Здесь тоже хватает лёгкой модели: тебе нужен каркас, дальше он всё равно пойдёт в переработку.
  3. Сборка и доводка. Тяжёлая модель получает три черновика, файл с тоном бренда и твои правки. Вот здесь и живёт качество.
  4. Проверка человеком. Цифры тарифа, обещания, сроки, юридические формулировки. Модель ошибётся в цене спокойно и уверенно, а отвечать за письмо будешь ты.

Четыре ступени вместо одного часового диалога с Opus. Расход падает, потому что тяжёлая модель видит только последний короткий кусок работы - всю кухню разгребли до неё. Качество у меня обычно тоже выше: у каждой ступени одна понятная задача.

Тот же принцип разложения работы на участки я расписывал в тексте про автоматизацию рутины. Начинать стоит с того, что делаешь руками каждую неделю; эффектные задачи спокойно дождутся своей очереди.

Почему файлы, картинки и скриншоты выносят окно быстрее текста?

Потому что вложение разворачивается в токены целиком и остаётся в окне до конца чата. PDF на сорок страниц весит больше, чем весь твой диалог за день. Загружаешь ты его один раз, а перечитывает модель его на каждом твоём сообщении до самого закрытия ветки.

Что сколько весит по порядку величины:

  • Скриншот таблицы. Обходится дороже той же таблицы текстом, и читает её модель при этом хуже. Копируй данные руками, фотографировать экран смысла нет.
  • PDF с вёрсткой. Помимо текста тянет структуру страниц. Нужны три пункта из договора - вставляй три пункта, договор целиком оставь на диске.
  • Выгрузка из CRM целиком. Классика жанра: человек грузит все сделки за год, чтобы спросить про один месяц. Угадай, кто так делал.
  • Длинная переписка в почте. Обычно почти целиком состоит из цитат предыдущих писем, которые и так уже лежат в окне.

Правило одно: режь до загрузки. Просить модель «не обращать внимания на лишнее» бесполезно, игнорировать содержимое окна она не умеет - оно уже там. Как готовить данные, чтобы вопрос попадал в цель с первого раза, я показывал на разборе ИИ в бизнес-аналитике.

Отдельно бесят таблицы. Excel-выгрузка на пятьсот строк почти всегда содержит десяток колонок, из которых тебе нужны две. Удали лишнее перед загрузкой, и окно похудеет в разы. Иногда таблицу вообще разумнее оставить снаружи чата - я сравнивал подходы в тексте макросы VBA против ИИ.

Когда расширенное мышление стоит своих токенов, а когда нет?

Режим долгого рассуждения тратит дополнительные токены на внутренние размышления до того, как модель начнёт отвечать. Там, где задача действительно сложная, качество заметно растёт, а на простой бюджет горит впустую и ответа приходится ждать дольше. Признак ровно один: есть ли в задаче несколько шагов.

Держи режим включённым там, где шагов много: сведение цифр, поиск противоречий в документе, разбор кода, выбор между несколькими стратегиями с обоснованием. Когда модели надо перебрать варианты и не запутаться, размышление окупается.

Одношаговые вещи в нём не нуждаются: переформулировать заголовок, перевести абзац, вытащить телефон из письма, накидать десять вариантов подписи к посту. Думать тут не над чем, а токены горят как над докторской.

Простой тест перед включением: прикинь, сможешь ли ты сам проверить ответ за десять секунд. Если да, режим лишний, а если для проверки придётся сесть и разложить задачу на шаги, включай.

Чем Projects и база знаний отличаются от «залить всё в чат»?

Проект в Claude - контейнер с общими знаниями, который подключается ко всем чатам внутри него. Главный выигрыш: контекст перестаёт объясняться заново в каждой новой ветке. Новые чаты становятся дешёвыми, они стартуют уже с нужным фоном, и ты сразу переходишь к делу.

Что имеет смысл держать в общих знаниях проекта:

  • Описание бизнеса: что продаёшь, кому, по какой цене, чем отличаешься.
  • Тон и стоп-слова: как ты пишешь и как не пишешь никогда.
  • Шаблоны: структура письма, структура поста, структура коммерческого предложения.
  • Регламент роли: что этот «сотрудник» делает, а что выносит на тебя.

Чего там быть не должно: сырых выгрузок, архивов переписки, всех документов компании «на всякий случай». Общие знания читаются в каждом чате проекта, поэтому раздутый контейнер бьёт по лимиту каждый день понемногу, и заметить такую утечку тяжелее всего - счётчик тает без единого длинного диалога.

И вот здесь обычный пользователь превращается в человека с системой. Цифровой сотрудник отличается от привычки «спрашиваю нейросеть» постоянным контекстом, регламентом и участком ответственности. Модель под таким сотрудником может смениться хоть завтра, а участок работы никуда не денется.

Как считать расход, если работаешь через API?

Через API логика другая. Никаких «сообщений в день»: есть ограничения на количество запросов и токенов в минуту плюс прямой счёт за расход. Упираешься там обычно в сумму, и растёт она по той же причине - из-за длины контекста, который ты пересылаешь на каждый вызов.

Три вещи, которые снимают большую часть боли:

  1. Кэширование промпта. Когда один и тот же большой блок инструкций и базы знаний уходит в модель сотни раз, его можно закэшировать: повторное чтение обходится сильно дешевле. В любом сценарии с постоянной системной частью это первое, что стоит включить.
  2. Пакетная обработка. Если ответ не нужен сию секунду - тысяча карточек товара, разбор архива обращений, - задачи отправляются пачкой и считаются дешевле обычного вызова.
  3. Маршрутизация по моделям. То же правило, что и в интерфейсе, только записанное в коде: лёгкая модель на классификацию, тяжёлая на финальную сборку.

Расход видно в консоли Anthropic. Загляни туда на второй день работы сценария. Один забытый цикл, который гоняет тяжёлую модель по кругу, способен съесть месячный бюджет за ночь - я такое видел, и ощущения незабываемые.

Если сценарий собирается в визуальном конструкторе, всё работает так же, только там легче не заметить, сколько раз в час срабатывает нода. Про ограничители, которые не дают автоматизации работать вхолостую, есть в разборе n8n с нуля.

Как выстроить рабочий день, чтобы не упираться в потолок?

Планируй по весу задач: тяжёлое уходит в начало окна, пока бюджет целый, а рутина расходится по коротким чатам на лёгкой модели. Одно правило держи железно: одна задача - один чат, закрыл и забыл. Ниже скелет дня, который работает у меня и у большинства, кому я его показывал.

ВремяЧто делаешьМодельФормат чата
Начало окнаОдна тяжёлая задача: разбор, стратегия, длинный документТяжёлаяОдин чат, до результата
СерединаТексты, письма, правкиСредняяНовый чат на каждый материал
ХвостМелочёвка: заголовки, теги, короткие ответыЛёгкаяКороткие чаты, не копить
ВсегдаПостоянный контекст-Файл или знания проекта на входе

Самое неочевидное здесь - последняя строка. Люди тратят колоссальную долю лимита на то, чтобы каждый раз объяснять модели, кто они и чем занимаются. Один раз собранный файл с описанием бизнеса убирает эти повторы полностью.

И держи в голове ограничитель пожёстче любых квот - твоё время на проверку. Нейросеть снимает рутину, но решение, вкус и ответственность за отправленное клиенту остаются на человеке. Какие задачи разумно ей отдавать, а какие нет, я разбирал в тексте про задачи, которые закрывает ИИ-ассистент.

Что делать, если лимит уже кончился прямо сейчас?

Первым делом не открывай второй аккаунт. Это нарушение условий использования, и выручает такой ход ровно один раз - а потом ты сидишь без основного. Нормальных ходов четыре, и порядок именно такой.

  1. Переключиться на модель полегче. Квота часто упирается именно в тяжёлую модель, а работа спокойно продолжается на быстрой. Половину задач ты, скорее всего, изначально не должен был отдавать тяжёлой.
  2. Разобрать хвосты без модели. Пока идёт ожидание, займись тем, что всё равно делаешь руками: вычитка, отправка, звонки, проверка цифр. Встал один инструмент, работа продолжается.
  3. Подготовить контекст к следующему окну. Собери файл, порежь таблицу, сформулируй задачу нормально. Когда лимит вернётся, ты войдёшь в работу с готовым входом вместо привычных препирательств с моделью.
  4. Посмотреть на тариф трезво. Если упираешься каждый день и после наведения порядка ничего не изменилось, объём работы просто перерос план. Тогда считай экономику: сколько часов это экономит против цены. Тариф подороже обычно лишь отодвигает потолок на пару недель, и продавать его тебе как решение я не буду.

Держать под рукой вторую модель другого производителя тоже разумно, но в роли страховки от простоя. Смысл страховки в том, чтобы твои регламенты и база знаний не были прибиты гвоздями к одному сервису: тогда на переезд уходит вечер вместо недели.

Какие ошибки чаще всего жгут лимит впустую?

Их немного, и повторяются они у всех примерно одинаково. Сложность самих задач тут почти ни при чём, лимит утекает от того, как организована работа. Пройдись по списку и честно отметь, сколько пунктов узнал про себя.

  • Один вечный чат на всё. Самая дорогая привычка: каждое новое сообщение оплачивает всю историю с понедельника.
  • Догрузка файла «на всякий случай». Приложил договор целиком, спросил про один пункт, дальше платишь за договор в каждом сообщении.
  • Тяжёлая модель на мелочёвке. Заголовки и теги на Opus - это как гонять фуру за хлебом.
  • Повторное объяснение контекста. Один и тот же абзац «мы студия, делаем то-то, аудитория такая-то», набитый заново в двадцатый раз.
  • Переписка вместо задачи. Пять уточняющих реплик подряд обходятся дороже одного нормально сформулированного запроса с примером желаемого результата.
  • Расширенное мышление по умолчанию. Включил один раз и забыл, дальше модель размышляет над переводом одной строки.

Отдельно про подход «спрошу-ка ещё раз, вдруг лучше получится». Иногда он срабатывает, но если ответ не устраивает трижды подряд, проблема сидит в постановке: не хватает примера, критериев или прямого запрета на то, что тебе не нужно. Основы формулировок, которые сокращают число заходов, лежат в базовом тексте о том, что такое Claude и как он устроен.

И главное: лимит перестаёт мешать в тот момент, когда работа разложена на роли с отдельными контекстами. На этом же стоят ИИ-агенты для бизнеса: каждый участок знает своё, не таскает лишнего и не мешает соседям. Собранная машина расходует ресурс экономнее, чем один гениальный чат, в который свалено всё.

Где учиться этому системно?

У Anthropic есть собственная документация и обучающие материалы, и они честно устроены: сначала устройство контекста, потом формулировки, потом выстраивание процессов. Всё на английском, но структура понятная. Начинать разумно оттуда, а дальше переносить логику на свои задачи.

Дословный пересказ курсов пользы не даст. Условия у тебя другие: команды инженеров нет, есть ты сам и, может быть, помощник. Значит, на первое место выходит дисциплина - короткие чаты, вынесенный наружу контекст, разные модели под разный вес задач, а тонкая настройка параметров подождёт до времён, когда базовые привычки перестанут течь.

Из документации на практике нужны три вещи: обзор моделей, чтобы понимать разницу в весе; руководство по промптингу, чтобы сокращать число заходов; справка по тарифам и лимитам, чтобы держать перед глазами актуальные цифры. Остальное пригодится тем, кто пишет код поверх API.

С чего начнёшь ты?

Я бы начал с самого неприятного: открой свой самый длинный чат, тот, который ведёшь с прошлой недели и куда свалено вообще всё. Посмотри, сколько там реально нужного - обычно набирается абзаца три. Остальное ты каждый день оплачиваешь заново.

Закрой его сегодня же: собери выжимку и открой новый чат с неё.

А потом напиши мне, что изменилось за неделю: ушли ли уведомления про лимит или всё осталось как было. И отдельно интересно, у кого потолок бьёт по файлам, а не по длине переписки. Если наберётся достаточно таких историй, разберу отдельно, там своя механика.

Источники

Частые вопросы

Почему лимит кончается, хотя я написал всего пятнадцать сообщений?

Счёт идёт по токенам. На каждом ответе модель заново перечитывает весь чат целиком, поэтому пятнадцать сообщений в длинном диалоге стоят дороже сотни коротких запросов, разбросанных по разным чатам.

Помогает ли удаление старых сообщений в чате?

Заметного эффекта не будет: пока история остаётся в диалоге, она уходит в модель на каждом ходу. Разгружает окно только новый чат с короткой выжимкой.

Что лучше: одна тяжёлая модель на всё или переключение?

Выгоднее переключаться. Черновики, сортировка и переписывание нормально идут на быстрой модели, а тяжёлая нужна там, где цена ошибки высокая: стратегия, длинный документ, разбор цифр.

Когда лимит сбрасывается?

По окнам: короткое окно длиной в несколько часов и недельный потолок сверху. Точные значения зависят от тарифа и меняются, проверять их нужно в справке Anthropic.

Через API лимиты те же самые?

Там устроено иначе: ограничения на запросы и токены в минуту плюс счёт за расход, и главным ограничителем работает стоимость длинного контекста.

Правда ли, что русский текст расходует лимит быстрее английского?

Да, при прочих равных кириллица дробится на большее число токенов, чем тот же смысл на английском. На коротких запросах разницы не заметишь, на длинных документах она уже ощутима.