Умнее ≠ точнее: нейросети стали врать чаще. Как с этим работать
«Умная» рассуждающая модель может галлюцинировать в разы чаще старой. Реальные цифры тестов, мини-тест «в зоне ли вы риска» и чек-лист проверки ответа ИИ.

01 — Иллюзия
Почему «модели становятся умнее» — опасная полуправда?
Я часто слышу: «ну ИИ же становится умнее, постоянно выходят новые модели» — и следом вывод: «не нужно быть экспертом».
Хочу немного разрушить иллюзии. Есть технический термин «галлюцинации» — это когда ИИ выдумывает то, чего нет: несуществующие факты, источники, цифры, «исследования». И проблема в том, что с ростом «ума» моделей галлюцинаций не становится меньше. Иногда — наоборот.
Тезис «ИИ сделает из вас бога» очень удачен в маркетинге, и его используют все кому не лень — от топовых американских блогеров до начинающих ребят. Но увы, он вводит людей в заблуждение. За каждый такой пост от меня в среднем отписывается пара сотен человек — но сори, я не перейду на сторону волшебно-таблеточников.
02 — Цифры
Что показали реальные тесты на галлюцинации?

Смотрите на цифры теста PersonQA (это бенчмарк OpenAI на фактические вопросы о людях):
o3-mini (старая рассуждающая) → 14,8%
o1 (старая рассуждающая) → 16%
o3 (новая, «самая умная») → 33%
o4-mini (новая компактная) → 48% ← антирекордПо факту рассуждать новая модель стала лучше — вот только это приводит к ещё большему выдумыванию: чем длиннее цепочка уверенных рассуждений, тем дальше модель может уехать от реальности, ни разу не усомнившись.
Запомните это соотношение: умнее ≠ точнее. Новые поколения моделей заметно сильнее в рассуждениях и задачах — и при этом способны сочинять с той же уверенностью, с какой говорят правду. Уверенный тон ответа вообще ничего не говорит о его достоверности.
03 — Риск
Когда галлюцинации становятся по-настоящему опасными?
А теперь представим: мы взяли ChatGPT и пошли с ним делать то, в чём не разбираемся сами — и рядом нет никого, кто разбирается.
Как мы оценим адекватность результата? Как узнаем, что он предложил лучший путь для 2026 года, а не «так делали в 2003-м, я чаще всего видел это в статьях, поэтому и тебе рекомендую»?
Никак. В этом и ловушка: галлюцинация опасна не тогда, когда она есть, а тогда, когда её некому поймать. Мега-круто использовать ИИ получается при трёх условиях:
- вы базово разбираетесь в задаче — способны заметить, что ответ «пахнет» не тем;
- вы понимаете, как ставить задачу — умеете составлять промпты;
- вы владеете примерами и образцами — можете показать модели, что такое «правильно».
Недооценённый навык, который стал особенно актуален во времена ИИ, — критическое мышление. Потому что модель что угодно запакует в правду: с источниками, с уверенным тоном, с красивой структурой.
Вы: «Какой сервис лучше для X? Дай ссылки на исследования»
ИИ: «Согласно исследованию Стэнфорда 2024 года (Journal of...,
vol. 12), сервис Y повышает конверсию на 34%...»
→ Исследования не существует. Журнал есть, статьи нет.
→ Тон — абсолютно уверенный. Структура — безупречная.04 — Тест
В зоне ли вы риска? Проверьте за 30 секунд
Вспомните последнюю серьёзную задачу, которую вы делали с ИИ, и ответьте честно:
05 — Защита
Как проверять ответы ИИ, не убивая скорость?
Проверка — это не «перепроверить всё», это 3–5 минут на то, что реально может навредить. Мой рабочий проход:
- Выделить в ответе факты, цифры, названия, источники — всё, что можно проверить
- Ключевые цифры и факты проверить во внешнем источнике (не в том же чате)
- Спросить модель: «в чём ты не уверен? что здесь стоит перепроверить?»
- Попросить источники — и открыть хотя бы один: существует ли он вообще
- Для чужой темы: показать вывод человеку, который в ней разбирается
- Свежесть: уточнить, актуален ли совет сейчас, а не «так делали раньше»
В конце ответа отдельным блоком укажи:
1) факты и цифры, в которых ты НЕ уверен на 100%,
2) что я должен проверить вручную перед использованием,
3) где твои данные могут устареть.
Если не знаешь — пиши «не знаю», а не предполагай.Строка «если не знаешь — пиши „не знаю“» не отключает галлюцинации полностью, но заметно снижает количество уверенных выдумок: вы даёте модели легальный выход вместо обязанности что-то ответить.
06 — Позиция
Что значит работать с ИИ адекватно?
ИИ, безусловно, мощно растёт и открывает тысячи возможностей. Но именно поэтому вокруг него столько «волшебных кнопок» в маркетинге — и столько разочарованных людей, которые поверили.
Адекватность — это то, что позволяет реально круто внедрять ИИ в жизнь и рутину. Она складывается из трёх вещей: понимать, что модель предсказывает, а не знает; держать свою экспертизу в контуре — хотя бы на уровне «могу заметить бред»; и проверять то, что уходит наружу. Всё. Этого достаточно, чтобы забрать пользу и не наступить на 33%.
ИИ предсказывает, а не знает
+ моя экспертиза в контуре (замечаю бред)
+ проверка всего, что уходит наружу
= результат без «наступить на 33%»Умнее ≠ точнее: новые модели рассуждают лучше и выдумывают увереннее — до 33–48% галлюцинаций в фактических тестах. Ваша защита — экспертиза в контуре, промпт-предохранитель и чек-лист проверки на всё, что уходит наружу. Не волшебная кнопка — но именно так ИИ приносит результат.
Частые вопросы
Что такое галлюцинации нейросети?
Это когда модель уверенно выдумывает то, чего нет: факты, цифры, источники, «исследования», несуществующие функции сервисов. Тон при этом такой же уверенный, как у правды, — поэтому на глаз галлюцинацию не отличить, только проверкой.
Правда ли, что новые модели галлюцинируют чаще старых?
В фактических тестах — да, бывает и так: по PersonQA новая рассуждающая o3 выдумывала в 33% случаев против 16% у o1 и 14,8% у o3-mini, а o4-mini дошла до 48%. Модель лучше рассуждает — и увереннее уезжает от реальности. Умнее не значит точнее.
Как снизить количество галлюцинаций в ответах?
Три приёма: давать модели свои материалы и образцы (ей меньше приходится выдумывать); добавлять промпт-предохранитель — «укажи, в чём не уверен; не знаешь — пиши „не знаю“»; просить источники и открывать хотя бы один. Полностью галлюцинации не исчезнут — но уверенных выдумок станет заметно меньше.
Можно ли использовать ИИ в теме, в которой я не разбираюсь?
Можно — но с поправкой на риск: в чужой теме вы не заметите бред, который эксперт увидит за секунду. Для важных решений подключайте человека, который разбирается, или сначала наберите базовое понимание. ИИ отлично ускоряет эксперта — и опасно убедителен для новичка.