Top.Mail.Ru
Пятница, 18 сентября, 2026

Исследование выявило «пробелы» в рассуждениях ИИ при постановке диагнозов

Время на прочтение: 2 мин

Также по теме

Исследование Национального института здравоохранения (NIH) США показало, что искусственный интеллект (ИИ) способен точно диагностировать пациентов, однако ИИ на основе больших языковых моделей (LLM) всё ещё сталкивается с трудностями в четком объяснении своих ответов.

Модель GPT-4 с визуальными возможностями (GPT-4V), разработанная OpenAI, представляет собой усовершенствованную версию ChatGPT, способную анализировать изображения и текст одновременно. В начальных медицинских исследованиях эта модель превосходила студентов-медиков и врачей в условиях закрытой книги, т.е. без доступа к внешним источникам информации.

Учёные протестировали GPT-4V, используя четырехлетний архив изображений журнала The New England Journal of Medicine. GPT-4V были предоставлены 207 вопросов с множественным выбором ответов. Ответ должен был включать описание изображения, краткое изложение соответствующих медицинских знаний и пошаговое объяснение. Затем результаты модели сравнили с ответами девяти врачей разных специальностей, которые прошли те же тесты в условиях закрытой и открытой книги.

В условиях закрытой книги врачи правильно ответили на 77,8% вопросов, тогда как GPT-4V дал правильные ответы в 81,6% случаев. Разница в точности между ИИ моделью и врачами не была статистически значимой. Когда врачи имели доступ к внешним ресурсам, точность их ответов возрастала до 95,2%. Преимущество людей над моделью было особенно выражено в более сложных вопросах. При этом GPT-4V смог правильно ответить на как минимум 70% вопросов, на которые врачи не смогли ответить в обоих условиях.

Исследователи отметили, что несмотря на правильные ответы, объяснения GPT-4V содержали ошибки в понимании изображений в 27% случаев. Например, модель идентифицировала случай злокачественного сифилиса, но не распознала, что изображения двух кожных поражений, представленных под разными углами, были вызваны одним и тем же заболеванием.

Ошибки в воспроизведении знаний и рассуждениях были реже, но все же происходили примерно в 10% случаев. Искусственный интеллект мог правильно «угадывать» ответ, но показывать некомпетентность в различении похожих проявлений медицинских состояний.

Стивен Шерри, исполняющий обязанности директора Национальной медицинской библиотеки NIH, отметил, что ИИ имеет огромный потенциал как инструмент для помощи медицинским профессионалам в быстрой диагностике пациентов. Однако, как показало это исследование, ИИ еще недостаточно развит, чтобы заменить человеческий опыт, который является ключевым для точной диагностики.

Чжийонг Лу, старший исследователь NLM и один из авторов исследования, подчеркнул необходимость понимания рисков и ограничений моделей искусственного интеллекта для их эффективного использования в медицине.

Недавнее исследование, проведенное компанией Atropos, показало, что универсальные языковые модели, такие как ChatGPT, Claude и Gemini, неэффективны для принятия клинических решений.

spot_img

Популярные

ЧИТАЙТЕ ТАКЖЕ