Как понять, что AI угадывает, а не знает

Шесть признаков уверенной выдумки и четыре способа проверить ответ Claude или ChatGPT за минуту.
У модели нет отдельной кнопки «не уверен». OpenAI пишет это прямо в своём исследовании. Обучение и оценка моделей поощряют угадывание. Модель получает балл за смелый ответ. За честное «не знаю» — ноль.
Авторы сравнивают модель со студентом на экзамене. Студент не знает точный ответ — но пишет что-то похожее на правду, а не оставляет пустое поле. Угадывание приносит шанс на балл. Молчание — гарантированный ноль. Модель обучена на тех же стимулах.
1. Конкретика без источника
AI называет точную дату, цифру, имя — без ссылки на документ. Это не автоматически ошибка. Но повод насторожиться. Модель одинаково уверенно формулирует и факт, который помнит, и факт, который додумала по аналогии.
Проверка простая: спроси, откуда цифра. Настоящий факт модель привяжет к статье, отчёту или странице. Выдуманный — начнёт пересказывать общими словами. Или назовёт источник, которого не существует.
2. Ответ съезжает при переспросе
Задай тот же вопрос другими словами через несколько сообщений. Если факт настоящий, цифры и детали останутся теми же. Если модель угадывала, второй вариант ответа обычно отличается. Другая дата. Другая формулировка причины. Другой человек назван автором цитаты.
Совпадение при переспросе — не стопроцентная гарантия. Но расхождение почти всегда сигнал: первый ответ был реконструкцией, а не знанием.
3. Слишком точная цитата или ссылка
Anthropic в исследовании о внутренних механизмах Claude показала конкретный сценарий. Модель узнаёт имя человека, но больше о нём ничего не знает. Внутренний признак «известная сущность» всё равно активируется. Модель решает, что должна ответить, а не промолчать. Дальше она:
«confabulate: generate a plausible—but unfortunately untrue—response»
Источник: Anthropic, «Tracing the thoughts of a large language model».
На практике это выглядит так: точная цитата из статьи, которой не существует, или ссылка на несуществующий раздел закона. Формат безупречный — автор, год, номер страницы. Это и есть тревожный звонок. Настоящие цитаты люди обычно помнят приблизительно, а не с точностью до страницы.
Спроси у юриста номер статьи наизусть — он полезет в кодекс, а не ответит с ходу. Модель отвечает с ходу всегда, и в этом разница.
4. Вопрос касается событий после среза знаний
У каждой модели есть дата, после которой она ничего не видела. У Claude Sonnet 5 надёжный срез знаний — январь 2026 года. У GPT-5.6 — февраль 2026 года. Тема вопроса свежее этой даты, а модель отвечает без оговорок — значит, она либо ищет в интернете, либо угадывает по старому паттерну.
Проверка: спроси модель напрямую про её срез знаний. Сверь с датой события, о котором спрашиваешь.
5. Модель не спорит и не сомневается
Живой эксперт на сложный вопрос иногда отвечает «зависит от», «я не уверен», «дайте проверю». Модель другая. На любой вопрос — ровный уверенный тон, без единой оговорки. Это не признак компетентности. Это побочный эффект того, как её обучали.
OpenAI в справке по точности советует прямо: важные данные, цифры, цитаты и ссылки на документы проверяй отдельно. Не полагайся на уверенность формулировки.
6. Цифра звучит слишком круглой
Спроси модель про выручку компании, охват канала, дату основания стартапа. Часто в ответе всплывает ровное число: 50%, 10 000 подписчиков, «около трёх лет». Реальные бизнес-метрики почти никогда не выглядят так гладко.
Модель, не найдя точных данных, тянется к среднему по палитре похожих кейсов из обучения. Получается правдоподобная, но никем не измеренная цифра. Проверка та же, что и в первом пункте: спроси источник и открой его. Ровное число без ссылки на отчёт или дашборд — повод пересчитать самому.
Как проверить ответ за минуту
Ни один из четырёх приёмов не даёт стопроцентной гарантии сам по себе. Вместе они снижают риск за пару минут — быстрее, чем разбираться в последствиях чужой выдумки в клиентском отчёте.
Переспросить другими словами. Не повторяй вопрос дословно. Перефразируй и задай через два-три сообщения. Совпадение деталей — хороший знак.
Попросить источник и открыть его. Не «на основе каких данных», а прямую ссылку или название документа. Потом открыть самому. Модель может сослаться на реальный сайт, но переврать, что там написано.
Спросить вторую модель. Задай тот же вопрос в Claude и в ChatGPT отдельными чатами. Обе называют один факт — уверенность выше. Расходятся — минимум одна угадывает.
Включить режим поиска. В ChatGPT это ручной выбор Search в меню инструментов или автопоиск для свежих тем. В Claude — похожий режим веб-поиска. Ответ со ссылками на источники проверяется быстрее, чем ответ по памяти модели.
Где это ломается
Извинение не значит исправление. Укажи модели на ошибку — она извинится и тут же выдаст новую версию ответа. Новая версия может быть такой же выдуманной, просто другой.
Уверенный тон не коррелирует с точностью. Модель не понижает голос, когда не уверена. Единственный способ узнать степень уверенности — спросить прямо и потребовать источник.
Вторая модель — не независимый судья. Claude и GPT обучены на пересекающихся данных. Ошибка широко растиражирована в интернете — обе модели могут повторить одну неточность.
Поиск в интернете подсовывает то, что нашёл. Режим поиска решает проблему устаревших данных. Но не решает проблему слабого источника. Модель честно процитирует статью, которая сама написана с ошибкой.
Переспрос с подсказкой ответа не работает. В новом вопросе уже заложен желаемый ответ («правда же, что...») — модель чаще соглашается, а не проверяет заново.
Дата среза знаний — не гарантия. Даже внутри своего периода модель путает детали, если тема редкая или источники противоречат друг другу.
Круглая цифра проходит проверку логикой, но не фактом. Число может выглядеть правдоподобно и даже совпадать по порядку величины с реальностью — и всё равно быть не тем числом, которое было в источнике.
Частые вопросы
Правда ли, что новые модели галлюцинируют реже? Направление такое. Но конкретные цифры зависят от типа задачи и версии модели. Производители публикуют их в системных картах при каждом релизе — там их и стоит смотреть, а не в пересказах третьих сторон. Сравнивать версии по чужим пересказам бессмысленно: методика тестов у каждого релиза своя, и цифры разных статей редко сопоставимы напрямую.
Можно ли попросить модель отвечать «не знаю» вместо угадывания? Да. Прямая инструкция в промпте («если не уверен — скажи об этом прямо») снижает число уверенных выдумок. Проблему это не убирает полностью, но меняет поведение модели в конкретном чате.
Что делать, если модель настаивает на своём ответе после того, как я указал на ошибку? Не спорить внутри того же чата. Открыть новый диалог, задать вопрос иначе, без упоминания предыдущего разговора. Контекст спора иногда закрепляет неверный ответ вместо того, чтобы его исправить.
Почему модель вообще выдумывает, если она умнее меня в конкретной теме? Её учили и оценивали так, что за угадывание она получает балл. За честное «не знаю» — ноль. Причина в устройстве обучения, а не в конкретном ответе.
Что сделать сегодня
Возьми последний факт, который тебе выдал Claude или ChatGPT без ссылки — и открой источник вручную, прежде чем использовать его дальше. Если источника нет — это уже ответ.
Источники
- OpenAI, «Why language models hallucinate» — https://openai.com/index/why-language-models-hallucinate/
- Anthropic, «Tracing the thoughts of a large language model» — https://www.anthropic.com/research/tracing-thoughts-language-model
- OpenAI Help Center, «Does ChatGPT tell the truth?» — https://help.openai.com/en/articles/8313428-accuracy-and-reliability
- Anthropic, Claude Help Center, «How up-to-date is Claude's training data?» — https://support.claude.com/en/articles/8114494-how-up-to-date-is-claude-s-training-data
- Anthropic, Claude Sonnet 5 System Card — https://www.anthropic.com/claude-sonnet-5-system-card
Гайд
Claude как рабочий инструмент
128 страниц: контекст, база знаний, каскады моделей и хуки. Два трека — для тех, кто не открывал терминал, и для тех, кому нужен готовый код
Забрать гайд →