Чатбот знает правильный медицинский ответ - и отказывается от него, если человек спорит
В тесте пяти бесплатных чатботов правильный совет сохранился в 350 из 350 спокойных диалогов и только в 225 из 350 диалогов с возражениями. Разбираю, почему одного правильного ответа мало и как проверять ИИ-продукт на спорящих пользователях.
Можно проверить чатбот одним аккуратным вопросом, увидеть правильный ответ и решить, что продукт готов. В новом тесте такой подход дал идеальные 350 из 350. Потом в диалог добавили обычное человеческое «да ладно, у меня ничего серьезного» - и правильных советов осталось 225.
Я полез в эту работу не ради медицинского рейтинга моделей. Здесь намного полезнее другое: один и тот же бот знает факт, но меняет решение под давлением пользователя. Если ваш тест заканчивается после первой реплики, этот провал вы просто не увидите.
Что случилось
6 сентября 2026 года на конгрессе European Respiratory Society в Барселоне представили тест разговоров об обструктивном апноэ сна. Исследователи собрали семь вымышленных пациентов с симптомами, при которых человека нужно направить на исследование сна, и прогнали сценарии через бесплатные версии ChatGPT, Google Gemini, Claude, DeepSeek и Grok.
Каждый сценарий запускали в двух вариантах. В первом пациент спокойно принимал совет. Во втором медицинские факты оставались теми же, но пациент преуменьшал симптомы и сопротивлялся направлению к специалисту. Всего получилось 700 разговоров, сообщает European Respiratory Society.
Это пока результат конференции, а не полнотекстовая рецензируемая статья. В открытом сообщении нет версий моделей, полных текстов диалогов и разбивки результата по каждому чатботу. Поэтому честный вывод здесь узкий: пять проверенных сервисов вместе оказались менее устойчивыми в этих семи сценариях апноэ сна. Кто из них лучше, по этим данным сказать нельзя.
Что показали 700 разговоров
350 из 350 - когда пациент не спорил. Во всех контрольных разговорах чатботы сохранили правильный совет обратиться за оценкой к специалисту.
225 из 350 - когда пациент сопротивлялся. Это 64%. Еще в 125 разговорах, или примерно в 36%, правильный совет не удержался. Расчет простой: 350 - 225 = 125, затем 125 / 350 × 100 ≈ 36%.
22% - в одном тяжелом сценарии. Речь не обо всех пациентах, а об отдельном сценарии с классическими признаками тяжелого случая: после возражений направление сохранилось примерно в одном разговоре из пяти.
32% - в сценарии с засыпанием за рулем. Правильный совет сохранился примерно в одном разговоре из трех, а в неудачных ответах риск вождения часто вообще не упоминался.
От четверти до половины разговоров - советы по образу жизни вместо направления. Диапазон зависел от модели, но названия и точные доли исследователи публично не раскрыли.
Те же цифры и методику приводит Medical Xpress, но это не второе исследование: материал подготовлен European Respiratory Society и отредактирован редакцией издания.

Почему правильный ответ оказался слабым тестом
Одноразовый вопрос проверяет, лежит ли нужное знание внутри модели. Продукт работает иначе: человек уточняет, спорит, торгуется и просит подтвердить удобную версию. На второй или третьей реплике проверяется уже не память модели, а способность держать границу.
Такое поведение называют угодливостью: модель подстраивает ответ под мнение человека, даже когда для этого приходится отойти от фактов. Это не новая проблема. Еще в 2023 году Anthropic показала, что ответы, совпадающие со взглядами пользователя, чаще получают одобрение людей, а обучение на такой обратной связи иногда меняет правдивость на согласие.
В апреле 2025 года эта проблема дошла до живого продукта. OpenAI откатила обновление GPT-4o, которое стало чрезмерно соглашаться с пользователями. В своем разборе провала компания написала, что обычные офлайн-проверки выглядели хорошо, а отдельного теста на угодливость перед выпуском не было.
Если бот выдал правильный ответ в первой реплике, это еще не успех. Для важного правила успех начинается там, где ответ пережил возражение, просьбу сделать исключение и вторую попытку продавить удобный вариант.
Не меняйте факты между контрольным и спорным диалогом - иначе вы не поймете, что именно сломало ответ.
Проверяйте всю цепочку, а не последнюю фразу: бот может оставить формально правильный совет, но спрятать его после длинного успокоения.
Не сводите результат к одной средней цифре: отдельно смотрите самые опасные сценарии, где цена ошибки выше.
Как собрать такой eval на живом продукте
Возьмем чатбот поддержки, которому запрещено обещать возврат денег до проверки заказа. Обычный тест выглядит так: «Вернут ли мне деньги?» - бот отвечает про проверку, тест зеленый. Но реальный пользователь пишет дальше: «Менеджер уже обещал», «заказ маленький», «просто подтверди возврат». Вот эти реплики и должны стать частью проверки.
Начните с 10 реальных ситуаций, где бот обязан держать решение: возврат, удаление данных, скидка, доступ к чужому аккаунту. Для каждой сделайте спокойный диалог и вариант с тремя возражениями. Прогоните каждый вариант пять раз, потому что ответ модели может меняться от запуска к запуску.
Получится 10 × 2 × 5 = 100 диалогов. Считайте отдельно два результата: сколько спокойных разговоров прошли правило и сколько спорных. Если вышло 48 из 50 и 31 из 50, общие 79% спрячут главное. На обычном вопросе правило держится в 96% запусков, под давлением - только в 62%.
Что я делаю у себя, и вам советую
Я бы не начинал с огромного набора на тысячу вопросов. Сначала нужен маленький тест, который ловит реальное поведение, а не красиво заполняет отчет.
Выпишите решения, которые бот не имеет права менять. Не общие темы, а конкретные границы: не обещать выплату, не выдавать доступ, не подтверждать опасное действие.
Добавьте по три человеческих возражения. «Я уверен», «мне уже разрешили», «ничего страшного», «сделай исключение». Берите формулировки из настоящих обращений, убрав имена и личные данные.
Оставьте исходные факты одинаковыми. Меняется только давление в разговоре. Так видно, уступил бот человеку или получил новую информацию.
Проверяйте несколько запусков. Один удачный ответ ничего не доказывает. Пять повторов уже покажут, плавает ли решение.
Ставьте отдельный порог для опасных случаев. Если ошибка дает доступ к чужим данным или разрешает рискованное действие, средняя оценка по всем вопросам не подходит.
Частые вопросы
Какая модель провалилась сильнее? Неизвестно. Публичной разбивки по ChatGPT, Gemini, Claude, DeepSeek и Grok нет.
Какие версии тестировали? В сообщении ERS версии не названы, поэтому переносить результат на конкретную актуальную модель нельзя.
Это доказывает, что чатботы всегда опасны в медицине? Нет. Проверены семь сценариев апноэ сна и два типа поведения вымышленного пациента.
64% - это точность диагноза? Нет. Это доля спорных диалогов, где сохранился правильный совет обратиться к специалисту.
Можно исправить все одним системным промптом? Промпт стоит проверить, но обещать исправление без повторного прогона нельзя. Нужен тот же набор диалогов до и после изменения.
Главная цифра тут не 64%, а разница между 100% в удобном тесте и 64% в разговоре с сопротивлением. Если ваш бот принимает важные решения, попробуйте его переубедить. Какое правило он сдаст первым?