Как работать с AI, чтобы он не выдумывал

Влад Лямин5 мин чтенияClaudeChatGPTгаллюцинациипромпты
Как работать с AI, чтобы он не выдумывал

Пять приёмов из официальных гайдов Anthropic и OpenAI. Они реально снижают долю выдуманных фактов — без магии и без смены модели.

OpenAI в исследовании сентября 2025 года формулирует причину прямо. Модели обучают и оценивают так, что угадывание выгоднее честного «не знаю». Методика похожа на экзамен, где за пустой ответ ставят ноль, а за уверенную догадку иногда ставят балл. Отсюда вывод: галлюцинация — результат того, как модель тренировали отвечать. Лечится это не только со стороны разработчика. Со стороны того, кто пишет промпт, тоже.

1. Разреши модели сказать «не знаю»

Anthropic в собственном гайде по снижению галлюцинаций называет это первым приёмом: «Explicitly give Claude permission to admit uncertainty. This simple technique can drastically reduce false information». По умолчанию модель трактует любой вопрос как то, на что обязана ответить. Даже если данных не хватает.

Формулировка в промпте простая: «если не уверен или в документе не хватает информации — так и скажи, не придумывай». Разница на практике заметна сразу. Без этой фразы модель в спорных местах выбирает правдоподобный, но не проверенный вариант. С фразой — чаще признаёт пробел.

2. Требуй цитаты, а не пересказ

Второй приём из того же гайда Anthropic — прямые цитаты. Для длинных документов, больше 20 тысяч токенов, модели предлагают сначала выписать дословные цитаты. И только потом делать вывод на их основе. Это привязывает ответ к реальному тексту, а не к обобщённой памяти модели о похожих документах.

Третий, смежный приём — верификация цитатами постфактум. Модель сама проверяет каждое своё утверждение, ищет подтверждающую цитату в исходнике. Не находит — обязана убрать утверждение. Anthropic формулирует это так: «If it can't find a quote, it must retract the claim». Работает как встроенный фактчекер, только без отдельного вызова человека.

3. Включай и выключай поиск осознанно

Поиск в интернете — не универсальный переключатель «правда/неправда». Он полезен для свежих фактов и цифр, которые модель не могла видеть на обучении. Но он же добавляет источник ошибок. Сама выдача поиска бывает неточной, а модель иногда домысливает связь между результатами, которой в источниках не было.

Практическое правило: включай поиск, когда вопрос про текущие цены, новости, курсы, версии продуктов. Выключай и работай на закрытом документе, когда нужен точный разбор конкретного текста — договора, брифа, переписки. Смешение режимов — частая причина ошибки. Модель тихо подмешивает в ответ факт из поиска, который к твоему документу отношения не имеет.

4. Дроби задачу вместо одного большого промпта

Чем длиннее и разнороднее запрос, тем больше в ответе точек, где модель может соскользнуть в правдоподобную догадку. Разбивка задачи на шаги — извлечь факты, затем проанализировать, затем сформулировать вывод. Это даёт возможность проверить каждый промежуточный результат отдельно, до того как ошибка утечёт в финальный текст.

Anthropic описывает похожую логику как chain-of-thought verification: попросить модель объяснить рассуждение шаг за шагом до финального ответа. Так виднее, где логика сломалась, а не только то, что финальный вывод неверный.

5. Проверяй второй моделью

Best-of-N verification из гайда Anthropic — это прогон одного и того же промпта несколько раз и сравнение ответов. Расхождение между прогонами — сигнал, что модель не уверена, даже если в тексте ответа этой неуверенности не видно.

Работает и кросс-проверка другой моделью или другим провайдером: попросить Claude проверить факт, который вывел ChatGPT, и наоборот. Модели ошибаются по-разному, и то, что незаметно одной, часто ловит другая. Это не отменяет ручную проверку критичных фактов — только снижает число случаев, когда она вообще нужна.

Где галлюцинации опаснее всего

Цена ошибки разная в разных типах фактов, и внимание стоит распределять неравномерно.

Цифры и даты. Модель может уверенно назвать неверную сумму, процент или дату. Форма ответа звучит так же убедительно, как и при верном факте. Проверяй руками каждую цифру, которая пойдёт дальше в отчёт клиенту.

Ссылки и источники. Несуществующая ссылка на статью или исследование — один из самых частых типов галлюцинации. Название и авторы звучат правдоподобно, а материала не существует. Открывай ссылку перед тем как вставить её куда угодно.

Юридические факты. Формулировки законов, номера статей, сроки исковой давности — область, где модель звучит одинаково уверенно. И в верном ответе, и в выдуманном. Юридический факт без проверки у юриста — не факт, а гипотеза.

Медицинские факты. Дозировки, противопоказания, взаимодействие препаратов — тут цена ошибки не репутационная, а физическая. Использовать AI как первый черновик для врача — нормально. Как источник финального решения — нет.

Где это ломается

  • Просьба «покороче» без источников. Сжатый ответ убирает воду. Заодно убирает оговорки про неуверенность — модель округляет до более уверенного тона, чем было в развёрнутом варианте.
  • Документ без цитат в контексте. Дал модели пересказ вместо самого текста — она достраивает детали пересказа своими средствами. На выходе получается смесь фактов и логичных, но не подтверждённых догадок.
  • Слишком длинный ответ. Чем длиннее генерация, тем больше в ней токенов, которые нужно чем-то заполнить. Тем выше шанс, что заполнение окажется правдоподобной выдумкой, а не фактом.
  • Доверие к уверенному тону. Модель не понижает голос, когда не уверена, если её явно об этом не попросили. Уверенность звучания — не показатель точности.
  • Один прогон для важного решения. Спросил один раз, получил ответ, использовал. Без повторной проверки или запроса ко второй модели расхождение просто негде увидеть.
  • Смешение поиска и закрытого документа в одном запросе. Модель не всегда чётко разделяет, что взято из твоего файла, а что — из результатов поиска. В ответе источники смешиваются без пометки.

Частые вопросы

Разве требование цитат не замедляет работу? Да, замедляет — на длинных документах это дополнительный шаг перед выводом. Но именно этот шаг превращает непроверяемое утверждение в то, что можно кликом свести к первоисточнику.

Если модель извинилась и сказала «не знаю», это значит, что вопрос действительно нерешаемый? Не обязательно. Иногда «не знаю» означает, что нужного контекста нет в промпте, а не что ответа не существует в принципе. Добавь источник — документ, ссылку, цитату — и попробуй снова.

Работает ли это одинаково у Claude и ChatGPT? Механика галлюцинаций одна и та же: обе модели обучены так, что угадывание конкурирует с честным отказом отвечать. Формулировки промптов из этого текста применимы к обеим. Я не нашёл данных о том, что один продукт реагирует на них принципиально иначе другого.

Стоит ли снижать температуру модели, чтобы уменьшить выдумки? Для API это рабочий параметр — ниже температура, меньше случайности в выборе слов. В обычном чат-интерфейсе Claude.ai или ChatGPT этот параметр пользователю не виден и не регулируется напрямую. Для повседневной работы приёмы из этого текста дают больше контроля.

Сегодня: возьми последний важный ответ AI, за который ты не сверялся с источником. Проверь в нём хотя бы одну цифру или ссылку.

Источники

Гайд

Claude как рабочий инструмент

128 страниц: контекст, база знаний, каскады моделей и хуки. Два трека — для тех, кто не открывал терминал, и для тех, кому нужен готовый код

Забрать гайд →