50% медицинских ответов ИИ содержат ошибку
Искусственный интеллект активно внедряют в медицинскую практику и обучение. Однако исследования, опубликованные в BMJ Open, ставят под сомнение надёжность его ответов в клинических задачах.
Эксперты из США, Канады и Великобритании проанализировали работу нескольких популярных нейросетевых моделей, включая ChatGPT, Gemini, Meta AI, Grok и DeepSeek. В тестировании каждой системе задали 10 медицинских вопросов в пяти клинических областях, включая онкологию, вакцинацию, стволовые клетки, питание и физическую активность.
Результаты оказались сопоставимыми между моделями и показали системную проблему качества генерации медицинской информации:
▪️ около 50% всех ответов содержали ошибки или искажения фактов;
▪️ примерно 19% классифицировали как грубо ошибочные;
▪️ около 30% имели умеренные неточности;
К тому же нейросети часто генерировали несуществующие или недостоверные источники. Это усиливало риск ошибочной интерпретации данных пользователями, включая врачей и студентов.
В клинических темах ИИ-ассистенты лучше справлялись с вопросами о вакцинации и онкологии, хуже – с задачами, связанными с питанием и биологией стволовых клеток. При этом даже при ошибках ИИ сохранял уверенный стиль ответа, что повышает риск доверия к некорректной информации.
Коллеги, ваше мнение: как контролировать применения ИИ в медицине, чтобы избежать риск формирования ложной уверенности у пользователей?
Подписывайтесь на Профессия – кардиолог
Искусственный интеллект активно внедряют в медицинскую практику и обучение. Однако исследования, опубликованные в BMJ Open, ставят под сомнение надёжность его ответов в клинических задачах.
Эксперты из США, Канады и Великобритании проанализировали работу нескольких популярных нейросетевых моделей, включая ChatGPT, Gemini, Meta AI, Grok и DeepSeek. В тестировании каждой системе задали 10 медицинских вопросов в пяти клинических областях, включая онкологию, вакцинацию, стволовые клетки, питание и физическую активность.
Результаты оказались сопоставимыми между моделями и показали системную проблему качества генерации медицинской информации:
▪️ около 50% всех ответов содержали ошибки или искажения фактов;
▪️ примерно 19% классифицировали как грубо ошибочные;
▪️ около 30% имели умеренные неточности;
К тому же нейросети часто генерировали несуществующие или недостоверные источники. Это усиливало риск ошибочной интерпретации данных пользователями, включая врачей и студентов.
В клинических темах ИИ-ассистенты лучше справлялись с вопросами о вакцинации и онкологии, хуже – с задачами, связанными с питанием и биологией стволовых клеток. При этом даже при ошибках ИИ сохранял уверенный стиль ответа, что повышает риск доверия к некорректной информации.
Коллеги, ваше мнение: как контролировать применения ИИ в медицине, чтобы избежать риск формирования ложной уверенности у пользователей?
Подписывайтесь на Профессия – кардиолог