Трое исследователей опубликовали Synthetic Hospital — открытый набор из 1 268 полностью вымышленных пациентов и 5 602 посещений. Он имитирует продольные электронные медкарты и больничную систему, но не содержит защищённых данных пациентов. В тесте десяти языковых моделей лучший результат при суммаризации всё равно означал пропуск примерно половины клинически значимых фактов.

До сих пор реалистичные тесты медицинского ИИ упирались в две проблемы: настоящие медкарты нельзя свободно распространять, а записанное врачами не всегда даёт полную и проверяемую картину болезни. Авторы сначала собрали состояние вымышленных пациентов из публичных учебных материалов и связали диагнозы и признаки с медицинскими справочниками. Только затем языковая модель превратила эту основу в записи врачей — поэтому правильный ответ берётся из графа фактов, а не из сгенерированного текста.

Реалистичность проверяли отдельно: десять врачей получили пять настоящих и пять синтетических карт, приведённых к одному формату, и сделали 100 оценок. Они угадали происхождение карты в 53% случаев — статистически не лучше случайного выбора. При восстановлении продольного списка диагнозов лучшая модель набрала F1 0,73: на совпадающей выборке это уровень среднего результата семи врачей, но ниже лучшего врача с 0,89.

Код и данные доступны на GitHub, однако это препринт без независимого воспроизведения и не испытание на пациентах. Проверка реалистичности охватила только десять карт, а набор повторяет состав учебных задач, а не распространённость болезней в населении. Synthetic Hospital даёт открытый способ искать ошибки клинического ИИ — но не доказывает, что какая-либо из протестированных моделей готова работать врачом.