00 Старт
Проверенный промпт годами работал — а теперь выдаёт ересь?
Промпт не виноват. Изменился исполнитель.
С выходом каждой новой модели и докруткой того, как она общается, она «деградирует» в каких-то других задачах. Это не паранойя — это цена любых улучшений: ChatGPT с памятью стал лучше тянуть мои данные, но порой превращается в повторяющую болванку; дообучили стиль ответов — тексты стали короче и понятнее, но потеряли вариативность.
Разработчики всегда чем-то жертвуют. Поэтому вопрос «какая нейросеть лучшая?» не имеет ответа. А вот «какая лучшая для этой задачи сегодня?» — имеет. И сегодня ты его получишь: 15-минутным тестом на своей реальной задаче.
С чем ты уйдёшь
- Результаты теста твоей задачи на 3–4 моделях с одинаковыми вводными
- Вывод с датой: чем СЕГОДНЯ решать эту задачу
- Личная карта моделей — каркас «задача → модель», который живёт с тобой
00 Старт
Как это выглядело на живых моделях
Примеры историчны — модели с тех пор сменились. Паттерн вечен.
Claude Sonnet 3.5–3.7 → шедеврален в текстах и метафорах; ошибался в логике Claude Sonnet 4 → меньше логических ошибок; потерял глубину и стилистику Gemini (ранний) → плох в текстах, хорош в анализе Gemini Flash 2.5 → бесплатный, а по стилистике текста обходил платные модели ChatGPT 4 (старый) → местами писал лучше более новых версий
Что здесь важно: «прокачали логику — просела глубина», «дообучили стиль — бесплатная модель обошла платные». Сила модели не написана на ценнике и не совпадает с датой релиза. Её видно только на твоей задаче.
01 Тест
Возьми реальную задачу с эталоном
Не абстрактный «напиши пост», а живая задача, где ты знаешь, как выглядит хороший результат.
Задача: [ЗАДАЧА]. Критерии: [КРИТЕРИИ].
01 Тест
Зафиксируй вводные — и прогони через 3–4 модели
Один и тот же промпт, те же материалы, тот же порядок. Во все модели без изменений.
Если менять формулировки под каждую модель, сравнение развалится: ты будешь сравнивать промпты, а не нейросети. Минимальный набор: ChatGPT, Claude, Gemini — плюс та, которой пользуешься сейчас. Руками в четырёх вкладках — или через сервис-сравнивалку (я пользовалась promptcannon.com — один запрос уходит сразу в несколько моделей).
Ответы сложи рядом — в один документ.
01 Тест
Сравни по своим критериям — не «какой красивее»
Выигрывает не «умная» модель, а та, чей результат ты готов(а) использовать с минимальными правками.
Вот моя задача: [ЗАДАЧА]. Вот мои критерии: [КРИТЕРИИ]. Вот эталон хорошего результата: [вставь]. Ниже 3–4 ответа разных моделей (не скажу каких). Оцени каждый по каждому критерию по 10-балльной шкале, с объяснением. В конце — итоговая таблица и вывод: какой ответ ближе всех к эталону. Ответ 1: [...] Ответ 2: [...] Ответ 3: [...]
Судью запускай в «нейтральной» модели или хотя бы не говори, где чей ответ, — иначе может подсуживать своим 😄
02 Карта
Запиши вывод — обязательно с датой
Следующий крупный релиз может перевернуть расклад. Дата превращает вывод из догмы в версию.
МОЯ КАРТА МОДЕЛЕЙ · проверено: [месяц, год]
[ЗАДАЧА] → [модель-победитель]
Дальше дополняй по мере тестов:
Тексты в моём стиле → …
Логика, структуры → …
Быстрые черновики → …
Анализ данных → …
Правила карты:
1. Промпт сломался → сначала тест моделей, потом правка промпта
2. Перепроверять карту после крупных релизов
3. Переезжать задачей, а не «всей жизнью»Два правила к карте: она живёт с датой — релизы перекраивают её несколько раз в год. И не переезжай «всей жизнью» на одну модель, потому что она модная, — переезжай задачей, туда, где эта задача решается лучше.
02 Финал
Готово. Инструмент теперь выбирает задача, а не подписка
Что ты сделал(а)
Прогнал(а) реальную задачу через несколько моделей с одинаковыми вводными, определил(а) победителя по своим критериям и завёл(вела) карту моделей с датой. Метод — вечный, расклад — обновляемый.
Куда дальше
- Смена инструмента — профессиональная гигиена: у фотографа несколько объективов, у повара несколько ножей
- Модель «умная», но выдумывает? — гайд про галлюцинации
- Мои наблюдения о деградации моделей — версия-статья
Такие методы я показываю первыми в канале
Забирай следующие механики раньше всех
Кто первым замечает, что «ChatGPT стал в одном стиле писать»? Мой канал. Наблюдения за моделями — там, по горячим следам.
Подписаться на канал →И да: подписка — следствие карты, а не наоборот.
Метод и гайд: Анжела Петкова, из практики фокус-групп · версия-статья