Как работают нейросети

Умнее ≠ точнее: нейросети стали врать чаще. Как с этим работать

«Умная» рассуждающая модель может галлюцинировать в разы чаще старой. Реальные цифры тестов, мини-тест «в зоне ли вы риска» и чек-лист проверки ответа ИИ.

Умнее ≠ точнее: нейросети стали врать чаще. Как с этим работать

01 — Иллюзия

Почему «модели становятся умнее» — опасная полуправда?

Я часто слышу: «ну ИИ же становится умнее, постоянно выходят новые модели» — и следом вывод: «не нужно быть экспертом».

Хочу немного разрушить иллюзии. Есть технический термин «галлюцинации» — это когда ИИ выдумывает то, чего нет: несуществующие факты, источники, цифры, «исследования». И проблема в том, что с ростом «ума» моделей галлюцинаций не становится меньше. Иногда — наоборот.

Тезис «ИИ сделает из вас бога» очень удачен в маркетинге, и его используют все кому не лень — от топовых американских блогеров до начинающих ребят. Но увы, он вводит людей в заблуждение. За каждый такой пост от меня в среднем отписывается пара сотен человек — но сори, я не перейду на сторону волшебно-таблеточников.

02 — Цифры

Что показали реальные тесты на галлюцинации?

Доля галлюцинаций по PersonQA: o3-mini 14,8%, o1 16%, o3 33%, o4-mini 48%
Схема. Чем смелее модель рассуждает, тем увереннее выдумывает.

Смотрите на цифры теста PersonQA (это бенчмарк OpenAI на фактические вопросы о людях):

Доля галлюцинаций по PersonQA
o3-mini (старая рассуждающая)  → 14,8%
o1      (старая рассуждающая)  → 16%
o3      (новая, «самая умная») → 33%
o4-mini (новая компактная)     → 48%  ← антирекорд

По факту рассуждать новая модель стала лучше — вот только это приводит к ещё большему выдумыванию: чем длиннее цепочка уверенных рассуждений, тем дальше модель может уехать от реальности, ни разу не усомнившись.

Запомните это соотношение: умнее ≠ точнее. Новые поколения моделей заметно сильнее в рассуждениях и задачах — и при этом способны сочинять с той же уверенностью, с какой говорят правду. Уверенный тон ответа вообще ничего не говорит о его достоверности.

03 — Риск

Когда галлюцинации становятся по-настоящему опасными?

А теперь представим: мы взяли ChatGPT и пошли с ним делать то, в чём не разбираемся сами — и рядом нет никого, кто разбирается.

Как мы оценим адекватность результата? Как узнаем, что он предложил лучший путь для 2026 года, а не «так делали в 2003-м, я чаще всего видел это в статьях, поэтому и тебе рекомендую»?

Никак. В этом и ловушка: галлюцинация опасна не тогда, когда она есть, а тогда, когда её некому поймать. Мега-круто использовать ИИ получается при трёх условиях:

  • вы базово разбираетесь в задаче — способны заметить, что ответ «пахнет» не тем;
  • вы понимаете, как ставить задачу — умеете составлять промпты;
  • вы владеете примерами и образцами — можете показать модели, что такое «правильно».

Недооценённый навык, который стал особенно актуален во времена ИИ, — критическое мышление. Потому что модель что угодно запакует в правду: с источниками, с уверенным тоном, с красивой структурой.

Как звучит типичная галлюцинация
Вы: «Какой сервис лучше для X? Дай ссылки на исследования»
ИИ: «Согласно исследованию Стэнфорда 2024 года (Journal of...,
vol. 12), сервис Y повышает конверсию на 34%...»
→ Исследования не существует. Журнал есть, статьи нет.
→ Тон — абсолютно уверенный. Структура — безупречная.

04 — Тест

В зоне ли вы риска? Проверьте за 30 секунд

Вспомните последнюю серьёзную задачу, которую вы делали с ИИ, и ответьте честно:

Вы работаете с ИИ адекватно: экспертиза + проверка на месте. Держите чек-лист из следующей секции под рукой для чужих тем — именно там ловушка ждёт даже осторожных.
Умеренный риск: часть ответов уходит в работу непроверенной. Возьмите за правило прогонять чек-лист из секции 05 хотя бы для всего, что уходит наружу, — это 3–5 минут на задачу.
Высокий риск: вы делаете с ИИ то, в чём не разбираетесь, и не проверяете — рано или поздно уверенная выдумка уйдёт клиенту или в публикацию. Начните с чек-листа проверки ниже и подключайте эксперта для важных тем.

05 — Защита

Как проверять ответы ИИ, не убивая скорость?

Проверка — это не «перепроверить всё», это 3–5 минут на то, что реально может навредить. Мой рабочий проход:

  • Выделить в ответе факты, цифры, названия, источники — всё, что можно проверить
  • Ключевые цифры и факты проверить во внешнем источнике (не в том же чате)
  • Спросить модель: «в чём ты не уверен? что здесь стоит перепроверить?»
  • Попросить источники — и открыть хотя бы один: существует ли он вообще
  • Для чужой темы: показать вывод человеку, который в ней разбирается
  • Свежесть: уточнить, актуален ли совет сейчас, а не «так делали раньше»
Заберите — промпт-предохранитель в конец запроса
В конце ответа отдельным блоком укажи:
1) факты и цифры, в которых ты НЕ уверен на 100%,
2) что я должен проверить вручную перед использованием,
3) где твои данные могут устареть.
Если не знаешь — пиши «не знаю», а не предполагай.

Строка «если не знаешь — пиши „не знаю“» не отключает галлюцинации полностью, но заметно снижает количество уверенных выдумок: вы даёте модели легальный выход вместо обязанности что-то ответить.

06 — Позиция

Что значит работать с ИИ адекватно?

ИИ, безусловно, мощно растёт и открывает тысячи возможностей. Но именно поэтому вокруг него столько «волшебных кнопок» в маркетинге — и столько разочарованных людей, которые поверили.

Адекватность — это то, что позволяет реально круто внедрять ИИ в жизнь и рутину. Она складывается из трёх вещей: понимать, что модель предсказывает, а не знает; держать свою экспертизу в контуре — хотя бы на уровне «могу заметить бред»; и проверять то, что уходит наружу. Всё. Этого достаточно, чтобы забрать пользу и не наступить на 33%.

Заберите — формула адекватности
ИИ предсказывает, а не знает
+ моя экспертиза в контуре (замечаю бред)
+ проверка всего, что уходит наружу
= результат без «наступить на 33%»
Вывод

Умнее ≠ точнее: новые модели рассуждают лучше и выдумывают увереннее — до 33–48% галлюцинаций в фактических тестах. Ваша защита — экспертиза в контуре, промпт-предохранитель и чек-лист проверки на всё, что уходит наружу. Не волшебная кнопка — но именно так ИИ приносит результат.

Частые вопросы

Что такое галлюцинации нейросети?

Это когда модель уверенно выдумывает то, чего нет: факты, цифры, источники, «исследования», несуществующие функции сервисов. Тон при этом такой же уверенный, как у правды, — поэтому на глаз галлюцинацию не отличить, только проверкой.

Правда ли, что новые модели галлюцинируют чаще старых?

В фактических тестах — да, бывает и так: по PersonQA новая рассуждающая o3 выдумывала в 33% случаев против 16% у o1 и 14,8% у o3-mini, а o4-mini дошла до 48%. Модель лучше рассуждает — и увереннее уезжает от реальности. Умнее не значит точнее.

Как снизить количество галлюцинаций в ответах?

Три приёма: давать модели свои материалы и образцы (ей меньше приходится выдумывать); добавлять промпт-предохранитель — «укажи, в чём не уверен; не знаешь — пиши „не знаю“»; просить источники и открывать хотя бы один. Полностью галлюцинации не исчезнут — но уверенных выдумок станет заметно меньше.

Можно ли использовать ИИ в теме, в которой я не разбираюсь?

Можно — но с поправкой на риск: в чужой теме вы не заметите бред, который эксперт увидит за секунду. Для важных решений подключайте человека, который разбирается, или сначала наберите базовое понимание. ИИ отлично ускоряет эксперта — и опасно убедителен для новичка.

Канал

Разборы и заметки — без воды

Новые материалы Анжелы об ИИ, экспертизе и маркетинге. Подписывайтесь на канал.

Подписаться в Telegram