Пять больших языковых моделей получили структурированные данные 11 966 пациентов и должны были оценить пригодность четырёх способов коррекции зрения. В исследовании BMC Medicine от 25 сентября Qwen-Max правильно решила 98,60% бинарных задач по отбору кандидатов на SMILE и 98,51% — на фемтосекундный LASIK.

Это был не экзамен по медицинским знаниям, на котором модели уже сравнивали с врачами, а ретроспективная имитация решения. В выборку вошли пациенты одного китайского центра, обследованные с января 2024-го по ноябрь 2025 года; у каждого использовали данные только правого глаза. Три старших хирурга задали эталон, а один офтальмолог с пятилетним опытом и модели DeepSeek-Chat, GLM-4.7, GPT-4o, Kimi-K2-Thinking и Qwen-Max независимо выставили оценки для LASIK, SMILE, TransPRK и имплантации линзы ICL.

Высокие цифры не распространились на все решения. Для TransPRK лучший результат Qwen-Max составил 72,90%, а для ICL лидировала DeepSeek-Chat с 89,20%. При более сложном выборе между вариантами максимальное согласие с экспертами по коэффициенту каппа достигло 0,743 — заметно слабее бинарного отбора. Авторы также обнаружили, что без подробной подсказки с клиническими правилами качество всех моделей существенно падало: система скорее последовательно применяла заданную схему, чем сама формировала её.

Сравнение с человеком тоже нельзя читать как победу над врачами. Единственный офтальмолог оценивал почти 12 тысяч случаев в течение восьми недель, и сами авторы допускают, что утомление могло ухудшить его результат. Выборка состояла преимущественно из молодых близоруких пациентов одного центра и исключала многие осложнённые случаи; эталон создала одна группа экспертов.

Главная граница результата ещё строже: рекомендации моделей не применяли к пациентам и не проверяли по качеству зрения, осложнениям или удовлетворённости после операции. Работа показывает пригодность LLM как помощника для стандартизированного первичного отбора в заданных условиях, но не безопасность автономного выбора операции и не готовность к клиническому внедрению без отдельной проспективной проверки.