Репост из: Профессия – педиатр
Эмпатичный ИИ хуже отвечает на медицинские вопросы
Учёные из Оксфордского института интернета проанализировали более 400 тысяч ответов пяти больших языковых моделей (Llama, Mistral, Qwen, GPT-4o) и выяснили: настройка на «дружелюбный» и эмпатичный стиль общения снижает точность ответов. Исходные модели ошибались в 4-35% случаев в зависимости от задачи, а их «тёплые» версии – уже в 11-42%, а в отдельных сценариях ошибки достигали 65%. Разработчики обычно исходят из того, что смена тона не влияет на содержание, но работа в Nature показывает: это не так.
▪️ Эмпатичные модели оказались ещё и более «сговорчивыми»: они на 40% чаще соглашались с заведомо неверными утверждениями (особенно если пользователь формулировал запрос тревожно или грустно) и реже им противоречили. Вместо прямого опровержения ложных утверждений они выбирали мягкие формулировки и допускали «разные точки зрения». Это снижает конфликтность диалога, но серьёзно повышает риск распространения недостоверной информации, особенно в медицине.
▪️ Авторы подчёркивают: проблема не выявляется при стандартных тестах – базовые способности моделей сохраняются, а сбой происходит именно в реальных диалоговых сценариях. И есть компромисс между «дружелюбием» и достоверностью, аналогичный человеческому поведению. Это критически важно, так как 66 млн американцев уже используют ИИ для получения медицинской информации, а каждый четвёртый обращается к нему за советами по здоровью.
Ранее исследование показало, что эмпатичный медчат-бот HeartBot около трети пользователей обманывал – они принимали его за живого врача. Чем эмпатичнее бот, тем выше этот риск. Вывод: при настройке медицинских ИИ-помощников баланс между теплотой и точностью – вопрос безопасности.
Подписывайтесь на Профессия – педиатр
Учёные из Оксфордского института интернета проанализировали более 400 тысяч ответов пяти больших языковых моделей (Llama, Mistral, Qwen, GPT-4o) и выяснили: настройка на «дружелюбный» и эмпатичный стиль общения снижает точность ответов. Исходные модели ошибались в 4-35% случаев в зависимости от задачи, а их «тёплые» версии – уже в 11-42%, а в отдельных сценариях ошибки достигали 65%. Разработчики обычно исходят из того, что смена тона не влияет на содержание, но работа в Nature показывает: это не так.
▪️ Эмпатичные модели оказались ещё и более «сговорчивыми»: они на 40% чаще соглашались с заведомо неверными утверждениями (особенно если пользователь формулировал запрос тревожно или грустно) и реже им противоречили. Вместо прямого опровержения ложных утверждений они выбирали мягкие формулировки и допускали «разные точки зрения». Это снижает конфликтность диалога, но серьёзно повышает риск распространения недостоверной информации, особенно в медицине.
▪️ Авторы подчёркивают: проблема не выявляется при стандартных тестах – базовые способности моделей сохраняются, а сбой происходит именно в реальных диалоговых сценариях. И есть компромисс между «дружелюбием» и достоверностью, аналогичный человеческому поведению. Это критически важно, так как 66 млн американцев уже используют ИИ для получения медицинской информации, а каждый четвёртый обращается к нему за советами по здоровью.
Ранее исследование показало, что эмпатичный медчат-бот HeartBot около трети пользователей обманывал – они принимали его за живого врача. Чем эмпатичнее бот, тем выше этот риск. Вывод: при настройке медицинских ИИ-помощников баланс между теплотой и точностью – вопрос безопасности.
Подписывайтесь на Профессия – педиатр