Новые нейросети 2026: что изменилось за год и что менять в работе
Коротко, что изменилось за год: модели перестали забывать начало разговора к середине дня, научились доводить многошаговую задачу до конца без постоянных подсказок, стали читать скриншот, голосовое и PDF в одном сообщении, а YandexGPT и GigaChat дотянулись до обычной офисной рутины. Практический вывод отсюда простой: собери папку из пяти-семи своих настоящих задач и прогоняй её после каждого громкого анонса, тогда о переезде ты будешь судить по собственным прогонам.
За год я трижды менял рабочую модель, и ни один из переездов не случился после чтения обзора. Сценарий каждый раз повторялся: выходит релиз, лента гудит про то, что теперь всё изменится, а я открываю папку с прошлонедельными задачами и прогоняю их заново. Два прогона закончились ничем, и я остался там же, где был. После третьего переехал за вечер и до сих пор об этом не пожалел.
Что изменилось в больших моделях за прошедший год?
Год назад работа выглядела так: я приносил модели вопрос, получал абзац, а дальше доводил всё руками - искал недостающие данные, склеивал куски, проверял цифры. За год это поменялось: задача уходит целиком, модель сама дробит её на шаги, лезет в файлы и подключённые инструменты и возвращается с готовым результатом, который мне остаётся проверить и подписать.
Три перемены я заметил по собственному рабочему дню раньше, чем прочитал про них в релиз-ноутах. Баллы в бенчмарках тут ни при чём: разницу я увидел по количеству своих движений мышкой.
Началось с памяти внутри одной сессии, следом подтянулось умение вести многошаговую задачу до конца без понуканий, а третьей переменой стала спокойная работа с форматами вперемешку: скриншот из CRM, голосовое от коллеги и PDF с прайсом уходят одним сообщением, и никакого отдельного сервиса под распознавание я в этом году не открывал.
Есть и то, чего за год не случилось. Решения модель принимать не начала: она не знает, какой клиент для меня важнее остальных, где у меня договорённость на словах, и что нельзя писать от лица бренда ни при каких обстоятельствах. Ответственность, вкус и расстановка приоритетов остались на человеке. Ускорилось только исполнение, и оно перестало быть узким местом в моём дне.
Что длинный контекст поменял в обычном рабочем дне?
Двенадцать месяцев назад «миллион токенов» в рекламе означал ровно одно: книгу модель проглотит целиком, а к середине забудет, о чём была первая глава. Мои рабочие сессии рвались часу к третьему, и приходилось заново пересказывать утренние договорённости про формат, тон и список запретов, потому что модель начинала отвечать так, будто мы только что познакомились.
Сейчас проект спокойно живёт в одной сессии половину дня, и правило, заданное в первом сообщении, продолжает работать в двадцатом. Разница видна лучше всего на длинных документах: раньше я резал договор или выгрузку на куски, скармливал по частям и потом сшивал ответы вручную, теряя связи между разделами. Теперь документ уходит целиком, и модель отвечает на вопрос по третьей странице с оглядкой на условия из четырнадцатой.
Проверить, держит ли модель контекст на самом деле, можно за пять минут. В начале сессии я вставляю неочевидное правило - скажем, запрет на слово «уникальный» - и через час работы прошу написать очередной текст. Если запрет соблюдён без напоминания, окно работает честно. Всплывшее слово говорит о другом: паспортная цифра описывает объём загрузки, внимание внутри него распределено неравномерно, и ключевые инструкции придётся повторять в каждом длинном блоке.
Из этого вытекает довольно неочевидная вещь для практики. Чем длиннее сессия, тем дороже обходится промах в первых сообщениях. Раньше неудачная формулировка растворялась сама через полчаса, теперь она тянется через всю работу и портит каждый следующий ответ. Первые пять минут диалога стоит потратить на то, чтобы аккуратно выложить факты о бизнесе, аудиторию, тон и стоп-слова. Механику такой подготовки я подробно расписывал в материале про базу знаний для нейросети, и за год её ценность только выросла.
Ещё один побочный эффект - счета. Длинный контекст стоит денег на каждом запросе, потому что модель заново перечитывает всё, что ты накопил. Кэширование контекста снимает большую часть этой нагрузки, но привычка держать в сессии всё подряд «на всякий случай» бьёт по бюджету заметнее, чем выбор между семействами моделей.
Куда переехала агентность?
Оркестрация, когда одна модель раздаёт подзадачи другим и собирает из ответов итог, ещё недавно была моим ручным паттерном. Собирал я это в n8n: вечер уходил на сборку сценария, следующий вечер на починку того, что отвалилось, а потом ещё один, потому что у сервиса поменялся эндпоинт и цепочка встала. Сейчас похожая логика встроена в сами модели, и местами вся та конструкция укладывается в один запрос с подключёнными инструментами.
Значит ли это, что визуальные конструкторы стали не нужны? У них сменился участок работы. Внутри модели удобно решать задачу, которая начинается и заканчивается в диалоге. Когда же нужно поймать письмо в почте, дёрнуть строку из таблицы, сходить в CRM и положить результат в мессенджер по расписанию, без внешнего сценария всё равно не обойтись - и как раз здесь n8n остаётся рабочим инструментом. Поменялась пропорция: раньше в конструкторе жила и логика, и связки, теперь логика ушла в модель, а конструктор занимается доставкой данных туда и обратно.
Что из этой встроенной агентности реально получается у бизнеса, я разбирал в отдельном материале про ИИ-агентов; там же видно, где агент справляется сам, а где ему нужен человек с правом вето. Если стоит выбор между готовым решением и самостоятельной сборкой, полезен разбор «под ключ или собрать самому» - за год цифры в этом сравнении сдвинулись в пользу самостоятельной сборки, потому что базовые кирпичи подешевели.
Если хочется разобраться в этом по шагам и с примерами, у нас есть бесплатное обучение по работе с нейросетями: уроки, разборы связок и готовые шаблоны промптов, по которым можно собрать первую рабочую роль за вечер.
Какие текстовые модели держать в работе в 2026 году?
Почти вся практическая работа закрывается одной основной моделью и одной запасной на случай сбоя или недоступности. Верхушка сблизилась настолько, что аккуратно собранный промпт даёт больший прирост качества, чем прыжок между семействами. При этом характер у каждой линейки свой, и знание этих характеров экономит время.
| Семейство | В чём сильно | Когда не подходит |
|---|---|---|
| Claude (Opus 5, Sonnet 5, Haiku 4.5) | Длинные рабочие сессии, код, аккуратный русский текст, работа с файлами | Нужна генерация картинок или видео внутри того же окна |
| GPT-5 и то, что вокруг неё | Широкий набор режимов, голос, встроенный поиск, много готовых интеграций | Требуется предсказуемый стиль без правок, придётся дообучать промптом |
| Gemini 3 | Огромный контекст, разбор видео и документов, связка с Google-сервисами | Работа идёт вне Google-экосистемы и нужна тонкая настройка тона |
| Open-source (DeepSeek, Qwen, GLM и подобные) | Ставится на свой сервер, данные не уходят наружу, стоимость предсказуема | Нет своего админа, поддержка съест больше, чем сэкономит подписка |
Отдельного слова заслуживает код: за год этот участок ушёл дальше всех остальных. То, что я раньше переписывал по второму кругу, теперь чаще едет с первого прогона, модель держит в голове структуру проекта и правит соседние файлы согласованно, вместо того чтобы чинить один изолированный кусок. Для нетехнического читателя ближайший аналог - формулы и макросы в таблицах, и здесь сравнение макросов VBA с подходом через ИИ показывает разницу нагляднее любых бенчмарков.
Тем, кто выбирает первую платную подписку, я советую начинать с разбора Claude против ChatGPT под конкретные задачи: общие рейтинги тут помогают слабо, потому что считают среднее по чужим задачам. Знакомство с семейством Claude, его режимами и ограничениями удобно начать с обзорной статьи, а вопрос доступа из России закрывает отдельная инструкция.
Что нового в картинках, видео и звуке?
В генерации изображений прогресс видно глазом, без всяких таблиц с метриками: прикладываешь референс - и на пятом кадре стоит тот же самый человек. Год назад на его месте появлялся двоюродный брат с похожей стрижкой.
- Консистентность персонажа. Совсем недавно лицо уезжало уже на втором кадре, сейчас референса хватает, чтобы оно держалось всю серию. На этом стоят ИИ-инфлюенсеры и товарные карточки, отснятые с одной моделью в десятке образов.
- Текст внутри картинки. Надписи на русском перестали превращаться в кашу из похожих на буквы символов, поэтому обложка, ценник и схема с подписями получаются с первого-второго раза. Какие модели тут держатся лучше остальных, разбирал в материале про генерацию картинок.
- Звук в генерации видео. Ролик приходит сразу со звуковой дорожкой и репликами, отдельную озвучку клеить уже необязательно.
- Редактирование вместо перегенерации. Просьба поменять одну деталь возвращает тот же кадр с этой правкой. Раньше на выходе оказывалась совсем другая картинка, и приходилось вспоминать, каким промптом получился удачный первый вариант.
Ломается всё там же, где ломалось год назад, - на связном длинном сюжете. Ролик я по-прежнему собираю из коротких кусков, монтаж никуда не делся, и объяснить это заказчику, посмотревшему красивый анонс лаборатории, бывает сложнее, чем собрать сам ролик. Что из этого применимо в работе прямо сейчас, разложено в разборе про генерацию видео и в статье про ИИ-видео для бизнеса.
Музыка и озвучка подтянулись следом: фоновый трек под ролик делается за время, пока завариваешь чай, а голос для закадрового текста звучит уже без металлического призвука. Механику я расписывал в материале о том, как создать ИИ-музыку.
Что происходит с российскими моделями?
В прошлом году GigaChat стоял у меня скорее из вежливости - проверить, посмотреть, закрыть вкладку. В этом году я полез разбираться, куда утекла половина моей текстовой рутины, и обнаружил её именно там.
YandexGPT и GigaChat перестали быть вариантом «попробуем ради интереса». Письма, выжимки из документов, ответы клиентам по типовым вопросам, черновики описаний товаров - всё это закрывается спокойно и без танцев. Отставание я по-прежнему вижу на сложных многошаговых рассуждениях, где нужно удержать несколько условий и не потерять ни одного; на письмах и выжимках разница перестала быть заметной глазу.
Выбирают их обычно по двум причинам. Оплата проходит обычной картой, без посредников и обходных путей, что само по себе снимает половину головной боли у бухгалтерии, а данные остаются внутри российского периметра - для компаний, работающих с персональными данными клиентов, этот пункт часто перевешивает любое преимущество в качестве.
Про интеграции с почтой, облаком и телефонией стоит лезть в документацию платформы до того, как заложишь их в план работ. Часть подключается парой кликов из интерфейса, часть придётся собирать руками через API, и состав этого списка меняется от квартала к кварталу, поэтому обзор годичной давности здесь бесполезен.
У меня в итоге сложилась такая связка: российская модель забирает поток и всё, где фигурируют клиентские данные, зарубежная остаётся на стратегию, аналитику и код. Если у тебя стоит YandexGPT, попробуй отдать ему разбор недельной выгрузки заявок и посмотри, сколько придётся править. Как всё это выглядит в живом бизнесе, я показывал в статье про ИИ-агентов в России.
Как проверить, стоит ли менять свою модель?
Ответа на этот вопрос в обзорах нет: у автора обзора свой набор задач, свой тон и свой заказчик. Работает только собственный прогон, а собирается он за один вечер.
У меня лежит папка с пятью-семью задачами, которые проходят через меня каждую неделю, а рядом - результаты, которые в своё время меня устроили. После заметного релиза я прогоняю папку заново, промпты при этом не трогаю вообще. Переезжаю только если новая модель заметно лучше минимум на трёх задачах из набора; при спорной разнице остаюсь на месте и возвращаюсь к вопросу через пару месяцев.
Сама сборка теста выглядит так:
- Возьми задачи из прошлой недели. Годятся те, что реально были в работе: письмо клиенту с отказом, разбор выгрузки, пост в канал, описание товара. Придуманные примеры дают придуманный результат, по которому потом невозможно принять решение.
- Сохрани промпты и эталоны. К каждой задаче положи тот вариант ответа, который тебя устроил, и сравнивай новые прогоны именно с ним; ощущение «вроде неплохо» через неделю уже не воспроизводится.
- Прогоняй одинаково. Тот же промпт, тот же контекст, никаких подсказок по ходу диалога. Стоит начать подсказывать, и сравнение съезжает с моделей на собственную настойчивость.
- Оценивай по трём пунктам. Точность фактов, попадание в тон, объём правок после. Правки я считаю буквально: сколько абзацев пришлось переписать руками перед отправкой. Метрика грубая, зато не вызывает споров - три переписанных абзаца против одного видно без всякой экспертизы.
- Проверь скорость и цену. Модель, которая выигрывает по качеству чуть-чуть, а по счёту в конце месяца отличается кратно, на потоке не окупится. Её место на редких задачах, где цена ошибки высокая.
Самая частая ошибка при этом - менять модель, когда проблема сидит в промпте. Прежде чем переезжать, дай текущей модели больше контекста: кто ты, для кого пишешь, пример хорошего результата, перечень запретов. После такой подготовки разница с «новой суперверсией» часто исчезает совсем, и это неловкий, зато бесплатный вывод.
Как выглядел мой третий переезд?
Первые два прогона закончились ничем, и рассказывать про них особо нечего: разница проявлялась на одной задаче из шести, а на остальных модели выступали вровень. Третий случай оказался интереснее: там всё упёрлось в один конкретный пункт из папки, по нему я и решал.
В папке у меня лежала задача, которую я про себя называю «разбор недельной выгрузки»: таблица с заявками, к ней вопрос вроде «что тут повторяется и на что стоит посмотреть руководителю». Старая модель отвечала правильно по фактам, но каждый раз выдавала простыню, из которой я вытаскивал два-три полезных наблюдения и переписывал их своими словами. Новая на том же промпте вернула короткий список наблюдений с цифрами из таблицы и пометкой, какие строки она считала выбросами. Править пришлось одну формулировку.
Дальше я прогнал оставшиеся задачи. На письмах разницы не оказалось вовсе, на посте новая модель промахнулась мимо тона и написала бодрее, чем нужно, на описании товара выступила чуть аккуратнее. Итог получился неоднозначным: явный выигрыш на одной задаче, ничья на трёх, проигрыш на одной. По моему же правилу трёх задач переезжать было нельзя.
Решил я иначе, и вот почему. Разбор выгрузки занимал у меня больше времени, чем все остальные задачи вместе взятые, поэтому выигрыш именно там перевешивал ничью на письмах. Правило про три задачи после этого я переписал: вместо количества выигранных пунктов считаю время, которое каждая задача съедает за неделю. Переезд занял вечер, потому что промпты ролей у меня лежат отдельными файлами и подставляются под любую модель, а пост я вернул на старую - она до сих пор пишет его точнее.
Пара вещей после переезда всё-таки отвалилась. Сценарий в n8n дёргал модель через API и начал молча возвращать пустую строку, потому что изменился формат ответа. Починка заняла минут двадцать, но поломку я обнаружил через два дня, когда заметил, что еженедельная сводка приходит без содержания. С тех пор в каждый сценарий вшита проверка: ответ короче ста символов - мне падает уведомление в телеграм. Ещё пришлось заново подобрать температуру, на прежнем значении новая модель писала суше, чем мне хотелось.
Вывод, который я вынес: правило держит от решения на эмоциях после красивого анонса, но подчиняться ему вслепую смысла нет. Когда результат прогона спорит с правилом, это повод перепроверить правило.
Какие возражения я слышу чаще всего?
«Мне некогда собирать эту папку, у меня работа». Сборка занимает примерно час, потому что задачи не нужно придумывать - они уже прошли через тебя на прошлой неделе. Достаточно скопировать промпты и ответы в отдельную папку по мере того, как делаешь их обычным порядком. Через месяц набор соберётся сам собой, а первый же отказ от ненужного переезда окупит потраченное время многократно.
«Всё равно через полгода всё поменяется, зачем настраивать сейчас». Модели сменятся, только описание роли, факты о бизнесе и критерии готовности переживут их все. Вкладываться выгоднее в этот слой: в него потом подставляется любая новая модель. Про такой подход подробнее в материале о том, что такое цифровой сотрудник.
«У меня маленькая компания, это всё для крупных». Как раз наоборот: в маленькой команде некому забрать рутину, поэтому эффект от одной снятой задачи заметнее. С чего начинать при ограниченных ресурсах, разобрано в статье про ИИ для малого бизнеса.
«Я пробовал, получилась ерунда». Спроси себя, что именно ушло модели на входе. Задача в одну строку без контекста, без примера и без указания адресата возвращает средний по интернету текст, и для такого запроса это честный ответ. Расстояние между «напиши пост про наш сервис» и промптом на десять строк с фактами, аудиторией и образцом тона обычно больше, чем расстояние между двумя поколениями моделей.
«Модель врёт, я проверял». Врёт она чаще всего там, где ей не дали данных и она достраивает ответ по общим соображениям. Дай выгрузку, документ или базу знаний, попроси ссылаться на конкретные строки - и доля выдумок падает резко. Какие вопросы имеет смысл задавать по своим данным, показано в материале про ИИ для бизнес-аналитики.
«Мы отдаём наружу данные клиентов, это запрещено регламентом». Тогда основной моделью становится российская или self-hosted, а зарубежная работает только на обезличенных задачах вроде текстов для сайта. Такое разделение по контурам собирается за пару дней и снимает большую часть вопросов от службы безопасности.
Сколько это стоит и на чём экономят зря?
У большинства расходы на модели долго сводились к одной подписке. Дальше структура усложнилась: подписка на интерфейс закрывает ручную работу, а всё, что крутится по расписанию или внутри сценариев, тарифицируется по токенам через API, и эти два счёта живут отдельно друг от друга.
Дороже всего обходятся две привычки. Гонять поток на самой мощной модели соблазнительно, потому что «она лучше», однако массовые однотипные задачи вроде сортировки писем или коротких ответов на типовые вопросы прекрасно закрывает младшая модель семейства, и на объёме разница в счёте видна сразу. Вторая привычка - складывать в контекст всё подряд, включая переписку трёхнедельной давности, за которую ты платишь заново при каждом запросе.
Обратная крайность встречается не реже: человек выбирает модель по цене за токен и получает результат, который приходится переписывать наполовину. Здесь помогает та же метрика правок из тестовой папки - переписанный вручную абзац стоит твоего времени, и это время легко перевешивает любую экономию на тарифе.
Разумная схема выглядит так: одна платная подписка на основную модель, бесплатные тарифы у остальных для сравнения, и отдельный ключ API под сценарии с младшей моделью по умолчанию. Старшую подключают точечно - на задачи, где ошибка дорого обходится.
Куда ставить модель, чтобы не переделывать каждые три месяца?
Модель удобно держать в голове как сменное лезвие: станком остаётся описанный тобой рабочий контур. Роль задаётся один раз: список задач, регламент, доступ к базе знаний, понятный критерий готовности и перечень запретов. При очередном релизе под то же описание подставляется другая модель, прогоняется тестовая папка, и решение принимается за вечер.
Когда промпты живут в заметках, переписках и голове, каждый релиз превращается в переезд с нуля: тон съезжает, формат разваливается, факты о продукте модель не знает, и всё приходится восстанавливать по кусочкам уже третий раз за год. У того, кто собрал ИИ-команду, меняется ровно один слой, а сколько это займёт, зависит от числа ролей и подробности их описания.
Минимальный набор, который снимает панику при каждом анонсе:
- один документ с фактами о бизнесе: продукты, цены, аудитория, тон, стоп-слова;
- промпты ролей вынесены в отдельные файлы и не теряются в переписке;
- пять-семь тестовых задач с эталонами, те самые, что собирались в предыдущем разделе;
- список того, чего модель не делает: обещать сроки, давать скидки, писать от лица владельца без вычитки;
- отметка, какая роль на какой модели работает сейчас и почему её туда поставили.
Последний пункт кажется бюрократией ровно до того момента, пока через полгода не понадобится вспомнить, зачем конкретно эта роль сидит на дорогой модели.
Разборы свежих релизов, готовые промпты и связки, шаблоны ролей цифровых сотрудников собраны в закрытом канале ИИмперии: берём заметные релизы и смотрим, куда они встают в уже собранной команде.
Что сделать на этой неделе?
План на три подхода, каждый занимает меньше часа.
Понедельник. Выпиши три задачи, на которые уходит больше всего ручного времени, обязательно с цифрой. Формулировка «два часа в неделю на разбор заявок» даёт опору для сравнения, тогда как «много времени на почту» через неделю ничего не измерит.
Среда. Прогони эти три задачи через свою текущую модель и через одну новую, сохрани оба результата рядом и посчитай, сколько абзацев пришлось переписать после каждой.
Пятница. Ту задачу, где разница оказалась наибольшей, оформи как роль: промпт в отдельном файле, факты о бизнесе, критерий готовности, список запретов. Остальные пока не трогай. Если задач набралось много и все выглядят срочными, порядок действий разобран в отдельной статье.
Через месяц выйдут новые версии, и половина названий из этого текста сдвинется на цифру вперёд. Я к тому моменту снова сяду прогонять свою папку и приду рассказать, что из громких обещаний доехало до реальной работы. Собери свою параллельно: без неё следующий релиз придётся оценивать по чужим восторгам.
Источники
Частые вопросы
Как часто теперь выходят заметные обновления?
Большие релизы у лабораторий приходят несколько раз в год, мелкие правки прилетают почти каждую неделю. Следить за всеми бессмысленно, достаточно проверять свои три-четыре рабочие задачи.
Нужно ли переходить на новую модель сразу после релиза?
Спешить незачем: дай неделю-две, чтобы всплыли ограничения и подтянулись интеграции, потом прогони свой набор тестовых задач и решай по результату.
Сколько моделей держать в работе одновременно?
Обычно хватает двух-трёх: основная для текста и рассуждений, отдельная для картинок или видео, плюс запасная на случай сбоя основной.
Что делать, если нужная модель недоступна из России?
Смотри на российские модели и на open-source, который ставится на свой сервер: для большинства офисных задач разница по качеству уже перестала быть критичной.
Как понять, что дело в модели, а не в моём промпте?
Дай той же модели больше контекста и пример желаемого результата. Если качество резко подскочило, проблема сидела в постановке задачи.
Стоит ли платить за несколько подписок сразу?
Начни с одной платной и бесплатных тарифов остальных. Вторую подписку бери, когда упрёшься в лимиты или в качество по конкретной задаче.