Claude Базовый

Почему Claude врёт: как ловить галлюцинации ИИ

Опубликовано 14 сентября 2026 г. · 20 мин чтения

Claude выдумывает по устройству: он подбирает самое вероятное продолжение текста, и когда точного факта внутри нет, место верного ответа спокойно занимает правдоподобный. Никто внутри не собирается тебя обманывать, просто так работает предсказание следующего слова. Сильнее всего это бьёт по цифрам, ссылкам и цитатам, потому что там выдумка выглядит убедительнее всего и проскакивает мимо глаза. Рабочее правило короткое: проверяй всё, что можно посчитать, открыть или процитировать, а над остальным сиди с обычной редакторской головой.

Каждый день в закрытом канале ИИмперии - что нового в работе с ИИ: разборы задач, готовые промпты и связки, шаблоны ролей цифровых сотрудников. Если тема проверки ответов для тебя живая, там это разбирается на конкретных документах.

Почему модель врёт, если у неё нет умысла?

Внутри неё работает статистика: оценка того, какое слово вероятнее всего идёт следующим с учётом всего, что уже написано, и проверки на истинность в этой процедуре просто не предусмотрено. Справочника с фактами внутри тоже нет, поэтому любой ответ собирается заново из вероятностей, включая тот, который звучит абсолютно точным. На темах, густо представленных в обучающих текстах, вероятное продолжение почти всегда совпадает с верным; чем реже тема встречалась, тем чаще это совпадение распадается, а гладкость фразы при этом никуда не девается.

Представь сотрудника, которого уволят за фразу «я не знаю». Он умный, начитанный, у него отличная память на общие темы. Но каждый раз, когда ты спрашиваешь то, чего он не помнит, он обязан что-то ответить - и собирает ответ из похожих кусков, которые помнит. Форма выйдет безупречной: привычная структура, ровная интонация, правильные слова, а фактов под этим всем не окажется.

Такое поведение и называют галлюцинацией, хотя термин сбивает с толку: он намекает на поломку, которой здесь нет. Модель делает ровно то, чему её учили, и продолжает текст правдоподобно. Правдивость получается побочным эффектом - там, где тема хорошо покрыта обучающими данными, правдоподобное и верное совпадают.

Есть и второй слой объяснения, который стоит держать как гипотезу о поведении, без претензии на заглядывание внутрь модели. В разборе OpenAI «Why language models hallucinate» ход мысли такой: способ обучения и оценки языковых моделей поощряет угадывание сильнее, чем признание незнания, потому что уверенный развёрнутый ответ набирает больше баллов, чем «данных недостаточно». Речь там о языковых моделях вообще; подробностей обучения Claude публично никто не раскладывал. Но поведение похожее, и рамка полезная: привычка отвечать во что бы то ни стало вырастает из самой процедуры обучения и оценки. Если ты только начинаешь и хочешь понять, что вообще за инструмент у тебя в руках, посмотри базовый разбор, что такое Claude и как он устроен - многие странности становятся понятнее.

Чем галлюцинация отличается от обычной ошибки?

Обычную ошибку выдаёт шероховатость: нестыковка, кривая формулировка, цифра, которая не бьётся с соседней. Галлюцинацию так не поймаешь - у неё нормальная структура, уместный тон и точные с виду детали, поэтому беглое чтение по ней проскальзывает, и глаз нигде не спотыкается.

Человек, когда ошибается, обычно и звучит неуверенно: «вроде бы около трёхсот тысяч». Модель одинаково ровно произносит верное и выдуманное, так что по уверенности текста судить о наличии факта под ним нельзя вообще никак, и в этом вся ловушка.

Есть и третье отличие: выдумки распределены по тексту неравномерно и кучкуются там, где нужна точная единица информации, которой у модели нет. Это названия, даты, номера, проценты, фамилии, ссылки, точные формулировки закона: всё, что нельзя вывести из общего смысла, а надо просто знать.

Хорошая новость в том, что такие места предсказуемы, и перепроверять весь текст не придётся - достаточно знать, куда смотреть. Ниже три зоны, на которые уходит почти всё внимание при проверке.

Где Claude врёт чаще всего?

Основных зон три - числа, ссылки и цитаты, и каждая требует точного совпадения с реальностью, тогда как вероятностный ответ выдаёт лишь похожее на правду. Четвёртая зона поменьше - свежие события и локальная специфика: российские законы, тарифы сервисов, актуальные цены, кто сейчас за что отвечает в конкретной компании.

Вот как это выглядит на практике:

Тип информацииНасколько можно веритьКак проверить за минуту
Логика, структура, аргументыВысоко, читай нормальноЧитаешь и оцениваешь сам
Пересказ текста, который ты далВысоко, если текст в контекстеСверяешь спорные места с оригиналом
Арифметика и процентыНизкоПересчитываешь в таблице
Ссылки и URLОчень низкоОткрываешь каждую
Цитаты и имена авторовОчень низкоИщешь точную фразу в поиске
Статистика «по рынку»Очень низкоТребуешь источник, открываешь его
Нормы законов, номера статейНизкоСверяешь с официальным текстом
Цены и тарифы сервисовНизкоОткрываешь страницу тарифов
Даты событийСреднеПроверяешь, если дата что-то решает

Обрати внимание на строчку про пересказ. Когда ты кладёшь модели документ в контекст и просишь его разобрать, качество резко растёт: текст лежит перед глазами, и восстанавливать его по памяти не нужно. Это главный практический рычаг снижения вранья, и на нём построена вся работа с документами - например, вычитка договора через Claude работает именно потому, что текст договора лежит в окне.

Эта статья закрывает один вопрос: почему модель выдумывает и как это ловить руками. В общей картине проверка входит в обычную гигиену работы с ИИ наравне с постановкой задачи, контекстом и регламентом роли. Если хочешь увидеть, как это складывается в систему целиком, можно забрать бесплатное обучение: доступ по почте, материал открывается сразу.

Почему цифры - самая опасная зона?

Цифра в тексте читается как факт независимо от своего происхождения, а происхождение у неё скверное: вместо счёта модель предсказывает, как выглядит результат счёта. На двух числах и одном действии предсказание обычно сходится с правдой, а вот три операции подряд, проценты от процентов или сумма по длинному списку превращают попадание в дело случая, хотя внешне ответ не меняется ничем.

Простой случай: ты даёшь список из сорока позиций с ценами и количеством, просишь посчитать итог и среднюю. Модель выдаст красивую сводку с итогом. Прогони этот итог через калькулятор - и он вполне может не сойтись. Расхождение обычно мелкое, поэтому глаз его не ловит вообще: сумма выглядит разумно, порядок величин правильный.

Отсюда первое рабочее правило: никогда не бери число из текста модели как результат расчёта. Считай такое число черновой прикидкой, пока его не подтвердила формула в таблице или код.

Практический выход устроен просто: модель отвечает за схему расчёта, подсчёт делает формула. Проси у неё формулу для таблицы, код на Python или разложенные по шагам промежуточные значения - любой из этих форматов можно перепроверить, в отличие от готового итога. Как это делается на живых выгрузках, подробно разобрано в материале про Claude и Excel, и там же хорошо видно, где проходит граница: конструкция расчёта модели даётся грамотно, а арифметику внутри неё стоит доверять только формуле.

Есть режим, где Claude пишет и запускает код для вычислений. Если он тебе доступен - используй его везде, где есть цифры: считает интерпретатор, результат становится воспроизводимым, а на тебе остаётся только логика расчёта.

И отдельная просьба: когда просишь аналитику по своим данным, требуй, чтобы каждое число сопровождалось указанием, из какой строки исходника оно взято. Это одновременно дисциплинирует модель и даёт тебе точку проверки. Вопросы, которые стоит задавать по своим данным, разобраны в материале про ИИ в бизнес-аналитике.

Почему ссылки нельзя брать на веру?

URL - это всего лишь строка символов определённого вида, а генерировать строки нужного вида модель умеет прекрасно. Как выглядит адрес статьи на сайте, она знает и соберёт такой адрес даже под страницу, которой никогда не было. Домен при этом будет настоящим, структура пути привычной, а конкретной страницы по этому адресу не существует.

На этом попадаются чаще всего: ты просишь подтвердить утверждение источниками, получаешь список из пяти ссылок, пробегаешь глазами - домены знакомые, солидные, - и ставишь их в презентацию. Потом кто-то кликает и упирается в 404, а иногда открывается живая страница совсем про другое.

Правило тут жёсткое, без исключений: открой каждую ссылку, которую собираешься использовать. От выборочной проверки толку мало, а сплошная занимает секунды и снимает целый класс позора.

Риск заметно падает, если работать с моделью в режиме веб-поиска. Ссылки тогда приходят из реального запроса, и в ответе видно, что именно модель прочитала. Проверять всё равно надо, но проверка сводится к быстрой сверке.

Надёжнее другой ход: источники подкладываешь ты сам, и память модели в добывании фактов вообще не участвует. Загрузил документы, отчёты, выгрузки - и попросил работать только внутри них. Так строится база знаний для нейросети: ты заранее решаешь, из чего модели можно брать факты, и выдумывать становится просто негде.

Что не так с цитатами и именами?

Цитата требует точной последовательности слов, а модель хранит скорее смысловые связи, поэтому дословность восстанавливается у неё плохо. В итоге получается фраза, которая звучит как то, что этот человек мог бы сказать, в его стиле и по его теме. Иногда она совпадает с оригиналом дословно, чаще выходит убедительная подделка за подписью реального человека.

Тот же механизм работает с именами. Просишь назвать автора исследования по теме - получаешь фамилию, университет и год, каждый из которых по отдельности существует, а вот связка между ними может быть собрана прямо на месте.

Самый известный случай такого рода - дело Mata v. Avianca, нью-йоркское разбирательство 2023 года: юристы истца подали в суд документ, где несколько прецедентов были сгенерированы моделью целиком. Названия дел, номера, цитаты из решений выглядели нормально, но ничего из этого не существовало. История стала публичной, а суд наложил на юристов санкции. Модель там вела себя ровно так, как от неё стоило ожидать, а провалилась процедура: документ ушёл в суд, и открыть его для проверки никто не удосужился.

Что делать:

  1. Не проси цитат, если они не нужны. Пересказ смысла безопаснее дословной цитаты и чаще всего решает ту же задачу.
  2. Если цитата нужна - вставь в поиск точную фразу в кавычках. Не нашлось ни одного совпадения? Значит, фразы не существует.
  3. Дай первоисточник сам. Загрузил статью, книгу, отчёт - попросил процитировать оттуда. Тогда цитата берётся из текста перед глазами.
  4. Имена проверяй отдельно от утверждения. Человек может существовать, а приписанное ему исследование - нет.

Как работает правило «проверяй всё, что можно посчитать»?

Оно делит текст на две части. Всё механически проверяемое - число пересчитать, ссылку открыть, цитату найти, норму сверить - попадает в первую, и действие там одинаковое всегда, независимо от того, насколько убедительно написан абзац. Остальное - логика, уместность, тон, приоритеты - ты читаешь как обычный черновик от толкового коллеги.

Приём простой до неприличия, и в этом его сила: не приходится каждый раз заново решать, доверять ответу или нет, и не требуется «чувствовать» модель.

Интуиция тут проигрывает по понятной причине: она калибровалась на живых людях, у которых неуверенность слышна, и за годы ты научился ловить, когда собеседник плавает. На машинном тексте этот датчик начинает вредить, потому что ровный уверенный тон читается как знание и даёт ложное чувство безопасности.

Практически правило раскладывается в три вопроса к любому абзацу ответа:

  • Есть ли в абзаце число, которое кто-то должен был получить счётом? Пересчитай.
  • Упоминается адрес, название источника или цитата? Открой и найди.
  • Проскочило утверждение про внешний мир, проверяемое за минуту? Проверь.

Если на все три ответ «нет» - читай спокойно, тут модель работает в своей сильной зоне.

Как ставить задачу, чтобы вранья было меньше?

Формулировка влияет сильно. Чем меньше модели приходится доставать из памяти и чем больше лежит у неё в контексте, тем реже она выдумывает. Помогают ещё две вещи: явно разрешить ответ «не знаю» и просить ход рассуждения вместе с выводом, чтобы была видна точка, где логика поехала.

Сравни формулировки:

Как обычно спрашиваютЧто получаешьКак лучше
«Какая средняя конверсия в моей нише?»Красивое выдуманное число«Вот моя выгрузка. Посчитай конверсию по этим данным»
«Дай источники по теме»Правдоподобные несуществующие ссылки«Найди источники поиском и дай ссылки, которые ты открыл»
«Что говорит закон про это?»Пересказ с выдуманным номером статьи«Вот текст статьи. Разбери, что из неё следует для моего случая»
«Посчитай итог по таблице»Число, которое может не сойтись«Дай формулу для этой таблицы и объясни логику»
«Правда ли, что X?»Подтверждение, потому что ты так спросил«Что известно про X, а что нет? Отметь, где не уверен»

Последняя строка важнее, чем кажется. Модель подстраивается под ожидание, зашитое в вопрос. Формулировка «правда ли, что утренние рассылки работают лучше?» вытянет обоснование, почему лучше; переделай её в «что известно про время отправки рассылок» - и картина станет честнее.

Ещё одна фраза, которую стоит держать в шаблонах: «если данных для точного ответа нет, так и напиши, не подставляй правдоподобное». Гарантии она не даёт, но частота выдумок после неё заметно падает. И добавь: «отдельно перечисли, что в твоём ответе стоит проверить». Модель неплохо размечает собственные слабые места, когда её прямо об этом просят.

Отдельная привычка - держать поиск фактов и их обработку в разных запросах. Сначала собрать и проверить материал, потом отдельным шагом просить анализ. Когда всё делается разом, выдуманный факт проскакивает вглубь вывода и уже оттуда не отделяется. Как разложить такой поток на шаги, показано на примере ежедневной сводки на Claude.

Почему уверенный тон обманывает сильнее, чем сами факты?

Достоверность мы оцениваем по подаче, и привычка эта старше любых технологий: человек, который говорит чётко и без оговорок, обычно и правда знает. У модели подача задана обучением и со знанием не связана никак, так что про столицу Франции и про несуществующее исследование она пишет с одинаковой уверенностью.

Сверху накладывается эффект формата: аккуратная структура, подзаголовки, нумерованные пункты, таблица - всё это читается как признак основательной работы. Мы привыкли, что оформленный текст кто-то оформлял, а значит, думал. Модель выдаёт структуру бесплатно, и структура перестаёт быть сигналом качества.

Отсюда практический вывод: гладкость ответа - повод проверить внимательнее. В аккуратно собранном тексте подставное число проще всего пропустить.

Хуже всего третий эффект. Когда ты споришь с моделью, она часто соглашается, потому что согласие обучено как желательное поведение, а твоя правота тут ни при чём. Говоришь «по-моему, тут ошибка» - получаешь «вы правы, извините» и новое число, которое может оказаться хуже первого. Ошибку подтверждает только пересчёт; в согласии модели ровно столько же информации, сколько в вежливом кивке.

Где враньё стоит дорого, а где почти ничего?

Одинаковая проверка нужна далеко не всем задачам. Черновик письма, который ты всё равно перепишешь, сверять построчно незачем, а на коммерческом предложении с цифрами для клиента те же пять минут окупаются многократно. Разумно разложить задачи по цене ошибки заранее, один раз, и дальше действовать по уровню.

ЗадачаЧто будет, если враньё пройдётУровень проверки
Черновик поста, идеи заголовковНичего, ты всё равно правишьОбычное чтение
Структура документа, план работНичего, скелет виден сразуОбычное чтение
Письмо клиенту без цифрНеловкость в формулировкеВычитка глазами
КП с расчётомПотеря денег или сделкиПолная сверка цифр
Отчёт для партнёра или инвестораУдар по доверию надолгоПолная сверка + источники
Публичный материал со статистикойПубличный разбор твоей ошибкиПолная сверка + открыть все ссылки
Юридический или налоговый вопросШтраф, спор, ответственностьПроверка у профильного человека
Текст, влияющий на здоровье или безопасностьПрямой вредИИ только как черновик, решает специалист

Последние две строки говорят уже о границе применения. В таких задачах ИИ снимает подготовительную рутину - собрать, структурировать, сформулировать вопросы, - и останавливается там, где начинаются вкус, контекст и последствия. Решение остаётся за человеком, который несёт за него ответственность.

Та же логика работает при выборе, кому что поручать: разбор задач по цене ошибки полезно держать в голове, когда собираешь ИИ-ассистента для малого бизнеса и решаешь, какие семь задач ему отдать первыми.

Как выглядит проверка за пять минут?

Это короткий чек-лист перед отправкой, одинаковый для любого текста от модели: пять шагов, каждый занимает меньше минуты. Смысл в повторяемости - один и тот же маршрут прогоняется раз за разом, пока не станет автоматическим и не перестанет требовать отдельного решения.

  1. Подсветить все числа. Пройди по тексту и отметь каждую цифру. По каждой ответь: она из моих данных, я её посчитал, или она взялась из модели? Третий вариант - вычёркиваешь или пересчитываешь.
  2. Открыть все ссылки. Каждую, без выборки; всё, что не открылось или ведёт не туда, из текста уходит.
  3. Прогнать цитаты через поиск. Точная фраза в кавычках, и если совпадений нет, цитату убираешь.
  4. Проверить конкретику про внешний мир. Названия сервисов, тарифы, номера статей, даты - всё, что одинаково легко проверить и выдумать.
  5. Прочитать на предмет логики. Тут работает только твоя голова: сходится ли вывод с посылками, нет ли аккуратно написанной чепухи.

Первые четыре шага механические, их можно делегировать помощнику или встроить в регламент роли, а пятый остаётся за тобой и стоит дороже остальных четырёх вместе взятых. Если проверка регулярно занимает больше пяти минут, значит, ты просишь у модели слишком много фактов при слишком слабой опоре на твой материал. Разверни задачу в сторону «разбери вот это» вместо «расскажи мне про».

Полезный приём для больших текстов: попроси модель отдельным сообщением выписать все проверяемые утверждения из своего же ответа списком. Получишь готовый список того, что открывать и пересчитывать, вместо вычитки всего полотна. Тот же принцип работает, когда длинная переписка превращается в решение: сначала вытащить структуру, потом работать с ней.

Как встроить проверку в работу цифрового сотрудника?

Вручную проверять получается, пока задач немного и ты сам сидишь за каждым ответом. Когда роль работает регулярно, проверка переезжает из твоей головы в её регламент: что этой роли запрещено выдумывать, из каких источников она обязана брать факты и что она выводит в конце каждого ответа.

Три вещи в регламент любой роли, которая касается фактов:

Источники заданы явно. «Берёшь цифры только из файлов, которые я приложил, и из выгрузки за период. Если нужного числа там нет - пишешь, что нет, и не подставляешь оценку». Это одна фраза, а разница в поведении большая.

Отдельный блок «проверить» в конце ответа. Роль сама перечисляет, какие утверждения в её ответе требуют подтверждения. Ты сразу видишь фронт работ и не вычитываешь всё подряд.

Запрет на класс данных. Например: «никогда не приводишь ссылки по памяти, только те, что открыл поиском», «никогда не цитируешь закон по номеру, а просишь у меня текст нормы». Явный запрет работает лучше общего призыва к аккуратности.

Так это и собирается: что такое цифровой сотрудник и чем он отличается от промпта - как раз про то, что у роли есть и задача, и границы. Когда таких ролей несколько и они передают работу друг другу, проверка становится критичной: выдуманное число, попавшее в отчёт на первом шаге, дальше уже никем не ставится под сомнение. Этот риск разобран в материале про ИИ-агентов для бизнеса - чем длиннее цепочка, тем важнее ловить враньё на входе.

И ещё одна вещь, которую легко упустить. Когда ответ превращается в готовый документ, таблицу или страницу, соблазн отправить его без вычитки резко растёт: оформленное выглядит законченным. Про это стоит помнить, когда работаешь с артефактами в Claude: оформленный файл вызывает меньше всего желания перепроверять, хотя именно он чаще прочего уходит дальше без правок.

Что делать, если враньё уже ушло клиенту?

Быстро и без драмы: написать самому, до того как заметят; назвать конкретную ошибку и верную цифру; не объяснять через «ИИ ошибся». Ответственность за отправленный документ на тебе, и ссылка на инструмент только ухудшает ситуацию - выглядит как попытка переложить.

Формулировка, которая работает: «В отчёте за прошлую неделю ошибка в расчёте - я указал X, правильно Y. Пересчитал, прикладываю исправленную версию, на выводы это влияет так-то». Трёх предложений без единого оправдания обычно хватает: ошибка, о которой ты сообщил первым, почти всегда закрывается за минуту, а репутационный счёт выставляют за ту, которую клиент нашёл раньше тебя.

Дальше полезно понять, где именно прорвалось. Обычно это один из трёх сценариев:

  • Проверяемого ты и не просил. Спросил факт вместо того, чтобы дать материал, и чинится это сменой формулировки запроса.
  • Проверка вышла выборочной. Открыл две ссылки из шести, а дальше понадеялся на приличные домены. Тут помогает только дисциплина: либо проходишь весь список, либо честно считаешь текст непроверенным.
  • Шаг выбран неудачно. Число проверили на входе в расчёт и не посмотрели на выходе из него, потому что чек-листа перед отправкой не было.

После такого прокола стоит пересобрать процесс проверки; отказ от инструмента сам по себе тут ничего не чинит. Инструмент, который снимает с тебя рутину и просит пять минут проверки, остаётся выгодным обменом. Доверие без проверки рано или поздно выставит счёт, и оплачивать его придётся тебе. Если ты ещё выбираешь, на чём работать, посмотри сравнение Claude и ChatGPT под задачи, но помни: выбор модели решает меньше, чем привычка перепроверять её ответы.

Источники

Частые вопросы

Claude врёт чаще или реже ChatGPT?

Разница между топовыми моделями есть, но она несопоставима с разницей между «проверил» и «не проверил». Строить работу на выборе модели вместо проверки - плохая ставка.

Если включить поиск в интернете, галлюцинации исчезнут?

Нет, но их становится заметно меньше и их проще ловить: у ответа появляются ссылки, которые можно открыть. Открывать всё равно придётся тебе.

Можно ли попросить модель саму оценить, насколько она уверена?

Можно, и это иногда помогает отсеять явный мусор. Но самооценка модели - такой же сгенерированный текст, как и сам ответ, так что единственной защитой она быть не может.

Что делать, если Claude настаивает на своём после моего возражения?

Спорить с ней бесполезно - требуй проверяемого: точный источник, цитату, расчёт по шагам. Если ничего из этого не появилось, считай утверждение выдуманным.

Стоит ли из-за галлюцинаций вообще отказаться от ИИ в работе с документами?

Отказываться разумнее от привычки отправлять ответ модели без вычитки там, где цена ошибки выше стоимости пяти минут проверки. Сам инструмент при этом остаётся полезным.