Почему Claude врёт: как ловить галлюцинации ИИ
Claude выдумывает по устройству: он подбирает самое вероятное продолжение текста, и когда точного факта внутри нет, место верного ответа спокойно занимает правдоподобный. Никто внутри не собирается тебя обманывать, просто так работает предсказание следующего слова. Сильнее всего это бьёт по цифрам, ссылкам и цитатам, потому что там выдумка выглядит убедительнее всего и проскакивает мимо глаза. Рабочее правило короткое: проверяй всё, что можно посчитать, открыть или процитировать, а над остальным сиди с обычной редакторской головой.
Каждый день в закрытом канале ИИмперии - что нового в работе с ИИ: разборы задач, готовые промпты и связки, шаблоны ролей цифровых сотрудников. Если тема проверки ответов для тебя живая, там это разбирается на конкретных документах.
Почему модель врёт, если у неё нет умысла?
Внутри неё работает статистика: оценка того, какое слово вероятнее всего идёт следующим с учётом всего, что уже написано, и проверки на истинность в этой процедуре просто не предусмотрено. Справочника с фактами внутри тоже нет, поэтому любой ответ собирается заново из вероятностей, включая тот, который звучит абсолютно точным. На темах, густо представленных в обучающих текстах, вероятное продолжение почти всегда совпадает с верным; чем реже тема встречалась, тем чаще это совпадение распадается, а гладкость фразы при этом никуда не девается.
Представь сотрудника, которого уволят за фразу «я не знаю». Он умный, начитанный, у него отличная память на общие темы. Но каждый раз, когда ты спрашиваешь то, чего он не помнит, он обязан что-то ответить - и собирает ответ из похожих кусков, которые помнит. Форма выйдет безупречной: привычная структура, ровная интонация, правильные слова, а фактов под этим всем не окажется.
Такое поведение и называют галлюцинацией, хотя термин сбивает с толку: он намекает на поломку, которой здесь нет. Модель делает ровно то, чему её учили, и продолжает текст правдоподобно. Правдивость получается побочным эффектом - там, где тема хорошо покрыта обучающими данными, правдоподобное и верное совпадают.
Есть и второй слой объяснения, который стоит держать как гипотезу о поведении, без претензии на заглядывание внутрь модели. В разборе OpenAI «Why language models hallucinate» ход мысли такой: способ обучения и оценки языковых моделей поощряет угадывание сильнее, чем признание незнания, потому что уверенный развёрнутый ответ набирает больше баллов, чем «данных недостаточно». Речь там о языковых моделях вообще; подробностей обучения Claude публично никто не раскладывал. Но поведение похожее, и рамка полезная: привычка отвечать во что бы то ни стало вырастает из самой процедуры обучения и оценки. Если ты только начинаешь и хочешь понять, что вообще за инструмент у тебя в руках, посмотри базовый разбор, что такое Claude и как он устроен - многие странности становятся понятнее.
Чем галлюцинация отличается от обычной ошибки?
Обычную ошибку выдаёт шероховатость: нестыковка, кривая формулировка, цифра, которая не бьётся с соседней. Галлюцинацию так не поймаешь - у неё нормальная структура, уместный тон и точные с виду детали, поэтому беглое чтение по ней проскальзывает, и глаз нигде не спотыкается.
Человек, когда ошибается, обычно и звучит неуверенно: «вроде бы около трёхсот тысяч». Модель одинаково ровно произносит верное и выдуманное, так что по уверенности текста судить о наличии факта под ним нельзя вообще никак, и в этом вся ловушка.
Есть и третье отличие: выдумки распределены по тексту неравномерно и кучкуются там, где нужна точная единица информации, которой у модели нет. Это названия, даты, номера, проценты, фамилии, ссылки, точные формулировки закона: всё, что нельзя вывести из общего смысла, а надо просто знать.
Хорошая новость в том, что такие места предсказуемы, и перепроверять весь текст не придётся - достаточно знать, куда смотреть. Ниже три зоны, на которые уходит почти всё внимание при проверке.
Где Claude врёт чаще всего?
Основных зон три - числа, ссылки и цитаты, и каждая требует точного совпадения с реальностью, тогда как вероятностный ответ выдаёт лишь похожее на правду. Четвёртая зона поменьше - свежие события и локальная специфика: российские законы, тарифы сервисов, актуальные цены, кто сейчас за что отвечает в конкретной компании.
Вот как это выглядит на практике:
| Тип информации | Насколько можно верить | Как проверить за минуту |
|---|---|---|
| Логика, структура, аргументы | Высоко, читай нормально | Читаешь и оцениваешь сам |
| Пересказ текста, который ты дал | Высоко, если текст в контексте | Сверяешь спорные места с оригиналом |
| Арифметика и проценты | Низко | Пересчитываешь в таблице |
| Ссылки и URL | Очень низко | Открываешь каждую |
| Цитаты и имена авторов | Очень низко | Ищешь точную фразу в поиске |
| Статистика «по рынку» | Очень низко | Требуешь источник, открываешь его |
| Нормы законов, номера статей | Низко | Сверяешь с официальным текстом |
| Цены и тарифы сервисов | Низко | Открываешь страницу тарифов |
| Даты событий | Средне | Проверяешь, если дата что-то решает |
Обрати внимание на строчку про пересказ. Когда ты кладёшь модели документ в контекст и просишь его разобрать, качество резко растёт: текст лежит перед глазами, и восстанавливать его по памяти не нужно. Это главный практический рычаг снижения вранья, и на нём построена вся работа с документами - например, вычитка договора через Claude работает именно потому, что текст договора лежит в окне.
Эта статья закрывает один вопрос: почему модель выдумывает и как это ловить руками. В общей картине проверка входит в обычную гигиену работы с ИИ наравне с постановкой задачи, контекстом и регламентом роли. Если хочешь увидеть, как это складывается в систему целиком, можно забрать бесплатное обучение: доступ по почте, материал открывается сразу.
Почему цифры - самая опасная зона?
Цифра в тексте читается как факт независимо от своего происхождения, а происхождение у неё скверное: вместо счёта модель предсказывает, как выглядит результат счёта. На двух числах и одном действии предсказание обычно сходится с правдой, а вот три операции подряд, проценты от процентов или сумма по длинному списку превращают попадание в дело случая, хотя внешне ответ не меняется ничем.
Простой случай: ты даёшь список из сорока позиций с ценами и количеством, просишь посчитать итог и среднюю. Модель выдаст красивую сводку с итогом. Прогони этот итог через калькулятор - и он вполне может не сойтись. Расхождение обычно мелкое, поэтому глаз его не ловит вообще: сумма выглядит разумно, порядок величин правильный.
Отсюда первое рабочее правило: никогда не бери число из текста модели как результат расчёта. Считай такое число черновой прикидкой, пока его не подтвердила формула в таблице или код.
Практический выход устроен просто: модель отвечает за схему расчёта, подсчёт делает формула. Проси у неё формулу для таблицы, код на Python или разложенные по шагам промежуточные значения - любой из этих форматов можно перепроверить, в отличие от готового итога. Как это делается на живых выгрузках, подробно разобрано в материале про Claude и Excel, и там же хорошо видно, где проходит граница: конструкция расчёта модели даётся грамотно, а арифметику внутри неё стоит доверять только формуле.
Есть режим, где Claude пишет и запускает код для вычислений. Если он тебе доступен - используй его везде, где есть цифры: считает интерпретатор, результат становится воспроизводимым, а на тебе остаётся только логика расчёта.
И отдельная просьба: когда просишь аналитику по своим данным, требуй, чтобы каждое число сопровождалось указанием, из какой строки исходника оно взято. Это одновременно дисциплинирует модель и даёт тебе точку проверки. Вопросы, которые стоит задавать по своим данным, разобраны в материале про ИИ в бизнес-аналитике.
Почему ссылки нельзя брать на веру?
URL - это всего лишь строка символов определённого вида, а генерировать строки нужного вида модель умеет прекрасно. Как выглядит адрес статьи на сайте, она знает и соберёт такой адрес даже под страницу, которой никогда не было. Домен при этом будет настоящим, структура пути привычной, а конкретной страницы по этому адресу не существует.
На этом попадаются чаще всего: ты просишь подтвердить утверждение источниками, получаешь список из пяти ссылок, пробегаешь глазами - домены знакомые, солидные, - и ставишь их в презентацию. Потом кто-то кликает и упирается в 404, а иногда открывается живая страница совсем про другое.
Правило тут жёсткое, без исключений: открой каждую ссылку, которую собираешься использовать. От выборочной проверки толку мало, а сплошная занимает секунды и снимает целый класс позора.
Риск заметно падает, если работать с моделью в режиме веб-поиска. Ссылки тогда приходят из реального запроса, и в ответе видно, что именно модель прочитала. Проверять всё равно надо, но проверка сводится к быстрой сверке.
Надёжнее другой ход: источники подкладываешь ты сам, и память модели в добывании фактов вообще не участвует. Загрузил документы, отчёты, выгрузки - и попросил работать только внутри них. Так строится база знаний для нейросети: ты заранее решаешь, из чего модели можно брать факты, и выдумывать становится просто негде.
Что не так с цитатами и именами?
Цитата требует точной последовательности слов, а модель хранит скорее смысловые связи, поэтому дословность восстанавливается у неё плохо. В итоге получается фраза, которая звучит как то, что этот человек мог бы сказать, в его стиле и по его теме. Иногда она совпадает с оригиналом дословно, чаще выходит убедительная подделка за подписью реального человека.
Тот же механизм работает с именами. Просишь назвать автора исследования по теме - получаешь фамилию, университет и год, каждый из которых по отдельности существует, а вот связка между ними может быть собрана прямо на месте.
Самый известный случай такого рода - дело Mata v. Avianca, нью-йоркское разбирательство 2023 года: юристы истца подали в суд документ, где несколько прецедентов были сгенерированы моделью целиком. Названия дел, номера, цитаты из решений выглядели нормально, но ничего из этого не существовало. История стала публичной, а суд наложил на юристов санкции. Модель там вела себя ровно так, как от неё стоило ожидать, а провалилась процедура: документ ушёл в суд, и открыть его для проверки никто не удосужился.
Что делать:
- Не проси цитат, если они не нужны. Пересказ смысла безопаснее дословной цитаты и чаще всего решает ту же задачу.
- Если цитата нужна - вставь в поиск точную фразу в кавычках. Не нашлось ни одного совпадения? Значит, фразы не существует.
- Дай первоисточник сам. Загрузил статью, книгу, отчёт - попросил процитировать оттуда. Тогда цитата берётся из текста перед глазами.
- Имена проверяй отдельно от утверждения. Человек может существовать, а приписанное ему исследование - нет.
Как работает правило «проверяй всё, что можно посчитать»?
Оно делит текст на две части. Всё механически проверяемое - число пересчитать, ссылку открыть, цитату найти, норму сверить - попадает в первую, и действие там одинаковое всегда, независимо от того, насколько убедительно написан абзац. Остальное - логика, уместность, тон, приоритеты - ты читаешь как обычный черновик от толкового коллеги.
Приём простой до неприличия, и в этом его сила: не приходится каждый раз заново решать, доверять ответу или нет, и не требуется «чувствовать» модель.
Интуиция тут проигрывает по понятной причине: она калибровалась на живых людях, у которых неуверенность слышна, и за годы ты научился ловить, когда собеседник плавает. На машинном тексте этот датчик начинает вредить, потому что ровный уверенный тон читается как знание и даёт ложное чувство безопасности.
Практически правило раскладывается в три вопроса к любому абзацу ответа:
- Есть ли в абзаце число, которое кто-то должен был получить счётом? Пересчитай.
- Упоминается адрес, название источника или цитата? Открой и найди.
- Проскочило утверждение про внешний мир, проверяемое за минуту? Проверь.
Если на все три ответ «нет» - читай спокойно, тут модель работает в своей сильной зоне.
Как ставить задачу, чтобы вранья было меньше?
Формулировка влияет сильно. Чем меньше модели приходится доставать из памяти и чем больше лежит у неё в контексте, тем реже она выдумывает. Помогают ещё две вещи: явно разрешить ответ «не знаю» и просить ход рассуждения вместе с выводом, чтобы была видна точка, где логика поехала.
Сравни формулировки:
| Как обычно спрашивают | Что получаешь | Как лучше |
|---|---|---|
| «Какая средняя конверсия в моей нише?» | Красивое выдуманное число | «Вот моя выгрузка. Посчитай конверсию по этим данным» |
| «Дай источники по теме» | Правдоподобные несуществующие ссылки | «Найди источники поиском и дай ссылки, которые ты открыл» |
| «Что говорит закон про это?» | Пересказ с выдуманным номером статьи | «Вот текст статьи. Разбери, что из неё следует для моего случая» |
| «Посчитай итог по таблице» | Число, которое может не сойтись | «Дай формулу для этой таблицы и объясни логику» |
| «Правда ли, что X?» | Подтверждение, потому что ты так спросил | «Что известно про X, а что нет? Отметь, где не уверен» |
Последняя строка важнее, чем кажется. Модель подстраивается под ожидание, зашитое в вопрос. Формулировка «правда ли, что утренние рассылки работают лучше?» вытянет обоснование, почему лучше; переделай её в «что известно про время отправки рассылок» - и картина станет честнее.
Ещё одна фраза, которую стоит держать в шаблонах: «если данных для точного ответа нет, так и напиши, не подставляй правдоподобное». Гарантии она не даёт, но частота выдумок после неё заметно падает. И добавь: «отдельно перечисли, что в твоём ответе стоит проверить». Модель неплохо размечает собственные слабые места, когда её прямо об этом просят.
Отдельная привычка - держать поиск фактов и их обработку в разных запросах. Сначала собрать и проверить материал, потом отдельным шагом просить анализ. Когда всё делается разом, выдуманный факт проскакивает вглубь вывода и уже оттуда не отделяется. Как разложить такой поток на шаги, показано на примере ежедневной сводки на Claude.
Почему уверенный тон обманывает сильнее, чем сами факты?
Достоверность мы оцениваем по подаче, и привычка эта старше любых технологий: человек, который говорит чётко и без оговорок, обычно и правда знает. У модели подача задана обучением и со знанием не связана никак, так что про столицу Франции и про несуществующее исследование она пишет с одинаковой уверенностью.
Сверху накладывается эффект формата: аккуратная структура, подзаголовки, нумерованные пункты, таблица - всё это читается как признак основательной работы. Мы привыкли, что оформленный текст кто-то оформлял, а значит, думал. Модель выдаёт структуру бесплатно, и структура перестаёт быть сигналом качества.
Отсюда практический вывод: гладкость ответа - повод проверить внимательнее. В аккуратно собранном тексте подставное число проще всего пропустить.
Хуже всего третий эффект. Когда ты споришь с моделью, она часто соглашается, потому что согласие обучено как желательное поведение, а твоя правота тут ни при чём. Говоришь «по-моему, тут ошибка» - получаешь «вы правы, извините» и новое число, которое может оказаться хуже первого. Ошибку подтверждает только пересчёт; в согласии модели ровно столько же информации, сколько в вежливом кивке.
Где враньё стоит дорого, а где почти ничего?
Одинаковая проверка нужна далеко не всем задачам. Черновик письма, который ты всё равно перепишешь, сверять построчно незачем, а на коммерческом предложении с цифрами для клиента те же пять минут окупаются многократно. Разумно разложить задачи по цене ошибки заранее, один раз, и дальше действовать по уровню.
| Задача | Что будет, если враньё пройдёт | Уровень проверки |
|---|---|---|
| Черновик поста, идеи заголовков | Ничего, ты всё равно правишь | Обычное чтение |
| Структура документа, план работ | Ничего, скелет виден сразу | Обычное чтение |
| Письмо клиенту без цифр | Неловкость в формулировке | Вычитка глазами |
| КП с расчётом | Потеря денег или сделки | Полная сверка цифр |
| Отчёт для партнёра или инвестора | Удар по доверию надолго | Полная сверка + источники |
| Публичный материал со статистикой | Публичный разбор твоей ошибки | Полная сверка + открыть все ссылки |
| Юридический или налоговый вопрос | Штраф, спор, ответственность | Проверка у профильного человека |
| Текст, влияющий на здоровье или безопасность | Прямой вред | ИИ только как черновик, решает специалист |
Последние две строки говорят уже о границе применения. В таких задачах ИИ снимает подготовительную рутину - собрать, структурировать, сформулировать вопросы, - и останавливается там, где начинаются вкус, контекст и последствия. Решение остаётся за человеком, который несёт за него ответственность.
Та же логика работает при выборе, кому что поручать: разбор задач по цене ошибки полезно держать в голове, когда собираешь ИИ-ассистента для малого бизнеса и решаешь, какие семь задач ему отдать первыми.
Как выглядит проверка за пять минут?
Это короткий чек-лист перед отправкой, одинаковый для любого текста от модели: пять шагов, каждый занимает меньше минуты. Смысл в повторяемости - один и тот же маршрут прогоняется раз за разом, пока не станет автоматическим и не перестанет требовать отдельного решения.
- Подсветить все числа. Пройди по тексту и отметь каждую цифру. По каждой ответь: она из моих данных, я её посчитал, или она взялась из модели? Третий вариант - вычёркиваешь или пересчитываешь.
- Открыть все ссылки. Каждую, без выборки; всё, что не открылось или ведёт не туда, из текста уходит.
- Прогнать цитаты через поиск. Точная фраза в кавычках, и если совпадений нет, цитату убираешь.
- Проверить конкретику про внешний мир. Названия сервисов, тарифы, номера статей, даты - всё, что одинаково легко проверить и выдумать.
- Прочитать на предмет логики. Тут работает только твоя голова: сходится ли вывод с посылками, нет ли аккуратно написанной чепухи.
Первые четыре шага механические, их можно делегировать помощнику или встроить в регламент роли, а пятый остаётся за тобой и стоит дороже остальных четырёх вместе взятых. Если проверка регулярно занимает больше пяти минут, значит, ты просишь у модели слишком много фактов при слишком слабой опоре на твой материал. Разверни задачу в сторону «разбери вот это» вместо «расскажи мне про».
Полезный приём для больших текстов: попроси модель отдельным сообщением выписать все проверяемые утверждения из своего же ответа списком. Получишь готовый список того, что открывать и пересчитывать, вместо вычитки всего полотна. Тот же принцип работает, когда длинная переписка превращается в решение: сначала вытащить структуру, потом работать с ней.
Как встроить проверку в работу цифрового сотрудника?
Вручную проверять получается, пока задач немного и ты сам сидишь за каждым ответом. Когда роль работает регулярно, проверка переезжает из твоей головы в её регламент: что этой роли запрещено выдумывать, из каких источников она обязана брать факты и что она выводит в конце каждого ответа.
Три вещи в регламент любой роли, которая касается фактов:
Источники заданы явно. «Берёшь цифры только из файлов, которые я приложил, и из выгрузки за период. Если нужного числа там нет - пишешь, что нет, и не подставляешь оценку». Это одна фраза, а разница в поведении большая.
Отдельный блок «проверить» в конце ответа. Роль сама перечисляет, какие утверждения в её ответе требуют подтверждения. Ты сразу видишь фронт работ и не вычитываешь всё подряд.
Запрет на класс данных. Например: «никогда не приводишь ссылки по памяти, только те, что открыл поиском», «никогда не цитируешь закон по номеру, а просишь у меня текст нормы». Явный запрет работает лучше общего призыва к аккуратности.
Так это и собирается: что такое цифровой сотрудник и чем он отличается от промпта - как раз про то, что у роли есть и задача, и границы. Когда таких ролей несколько и они передают работу друг другу, проверка становится критичной: выдуманное число, попавшее в отчёт на первом шаге, дальше уже никем не ставится под сомнение. Этот риск разобран в материале про ИИ-агентов для бизнеса - чем длиннее цепочка, тем важнее ловить враньё на входе.
И ещё одна вещь, которую легко упустить. Когда ответ превращается в готовый документ, таблицу или страницу, соблазн отправить его без вычитки резко растёт: оформленное выглядит законченным. Про это стоит помнить, когда работаешь с артефактами в Claude: оформленный файл вызывает меньше всего желания перепроверять, хотя именно он чаще прочего уходит дальше без правок.
Что делать, если враньё уже ушло клиенту?
Быстро и без драмы: написать самому, до того как заметят; назвать конкретную ошибку и верную цифру; не объяснять через «ИИ ошибся». Ответственность за отправленный документ на тебе, и ссылка на инструмент только ухудшает ситуацию - выглядит как попытка переложить.
Формулировка, которая работает: «В отчёте за прошлую неделю ошибка в расчёте - я указал X, правильно Y. Пересчитал, прикладываю исправленную версию, на выводы это влияет так-то». Трёх предложений без единого оправдания обычно хватает: ошибка, о которой ты сообщил первым, почти всегда закрывается за минуту, а репутационный счёт выставляют за ту, которую клиент нашёл раньше тебя.
Дальше полезно понять, где именно прорвалось. Обычно это один из трёх сценариев:
- Проверяемого ты и не просил. Спросил факт вместо того, чтобы дать материал, и чинится это сменой формулировки запроса.
- Проверка вышла выборочной. Открыл две ссылки из шести, а дальше понадеялся на приличные домены. Тут помогает только дисциплина: либо проходишь весь список, либо честно считаешь текст непроверенным.
- Шаг выбран неудачно. Число проверили на входе в расчёт и не посмотрели на выходе из него, потому что чек-листа перед отправкой не было.
После такого прокола стоит пересобрать процесс проверки; отказ от инструмента сам по себе тут ничего не чинит. Инструмент, который снимает с тебя рутину и просит пять минут проверки, остаётся выгодным обменом. Доверие без проверки рано или поздно выставит счёт, и оплачивать его придётся тебе. Если ты ещё выбираешь, на чём работать, посмотри сравнение Claude и ChatGPT под задачи, но помни: выбор модели решает меньше, чем привычка перепроверять её ответы.
Источники
- Reduce hallucinations - документация Anthropic - официальные приёмы снижения выдумок в ответах Claude.
- Академия Anthropic - учебные курсы по работе с Claude.
- Citations - механизм ссылок на исходный документ - как заставить модель привязывать утверждения к тексту первоисточника.
- Chain of thought prompting - зачем просить ход рассуждения вместе с выводом.
- Tracing the thoughts of a large language model - Anthropic - исследование внутренних механизмов, включая то, как модель решает отвечать или отказаться.
- Why language models hallucinate - OpenAI - разбор, почему обучение поощряет угадывание вместо признания незнания.
- Survey of Hallucination in Natural Language Generation - arXiv - академический обзор природы галлюцинаций.
- Hallucination Leaderboard - Vectara - открытое сравнение моделей по частоте выдумок при пересказе документов.
- Mata v. Avianca - описание дела - случай с выдуманными судебными прецедентами в поданном в суд документе.
- AI Risk Management Framework - NIST - рамка управления рисками ИИ, включая достоверность выходных данных.
Частые вопросы
Claude врёт чаще или реже ChatGPT?
Разница между топовыми моделями есть, но она несопоставима с разницей между «проверил» и «не проверил». Строить работу на выборе модели вместо проверки - плохая ставка.
Если включить поиск в интернете, галлюцинации исчезнут?
Нет, но их становится заметно меньше и их проще ловить: у ответа появляются ссылки, которые можно открыть. Открывать всё равно придётся тебе.
Можно ли попросить модель саму оценить, насколько она уверена?
Можно, и это иногда помогает отсеять явный мусор. Но самооценка модели - такой же сгенерированный текст, как и сам ответ, так что единственной защитой она быть не может.
Что делать, если Claude настаивает на своём после моего возражения?
Спорить с ней бесполезно - требуй проверяемого: точный источник, цитату, расчёт по шагам. Если ничего из этого не появилось, считай утверждение выдуманным.
Стоит ли из-за галлюцинаций вообще отказаться от ИИ в работе с документами?
Отказываться разумнее от привычки отправлять ответ модели без вычитки там, где цена ошибки выше стоимости пяти минут проверки. Сам инструмент при этом остаётся полезным.