Три теста медицинского ИИ не заметили часть клинически значимых ошибок
Новость опубликована 11.09.2026 ⦁ источник
Три системы оценки медицинских ответов ИИ часто не различали исходный ответ и его версию со специально внесённой клинически значимой ошибкой. К такому результату пришла команда Оксфордского университета в препринте, опубликованном 11 сентября.
Исследователи проверили HealthBench, HealthBench Professional и LiveMedBench. Для 500, 514 и 521 пригодного вопроса соответственно они создали пары: ответ модели и тот же ответ с одной контролируемой ошибкой — например, неверной дозировкой, пропущенным противопоказанием или выдуманным исследованием. Всего получилось 6344 пары с внесёнными ошибками. В отдельной выборке из 117 пар 12 клинических рецензентов сочли 80,3% правок способными изменить диагноз или лечение.
Во всех трёх наборах самым частым результатом стала ничья: рубрика оставляла оценку без изменения. Даже лучший результат, у HealthBench, составил 0,599 по метрике AUROC, где 0,5 соответствует случайному выбору; HealthBench Professional случайный уровень не превзошёл. Правильный ответ получал преимущество в большинстве случаев лишь для трёх из 13 типов ошибок.
Более подробные критерии помогали, особенно когда рубрика прямо проверяла конкретный факт. Дополнительная проверка через поиск источников находила многие пропущенные ошибки, но одновременно пометила неподтверждёнными 55,3% утверждений из исходных ответов — то есть пока создавала слишком много ложных тревог.
Работа ещё не прошла рецензирование. Ошибки добавляли искусственно, а в каждом тесте использовали одну модель-судью, поэтому исследование не измеряет частоту ошибок медицинского ИИ в реальной практике. Его более узкий вывод: высокий балл по фиксированной рубрике ещё не доказывает, что в ответе нет клинически важной ошибки.
Медицинский ИИ, HealthBench, HealthBench Professional, LiveMedBench, Оксфордский университет, Галлюцинации ИИ