SWE-Game: лучший ИИ-агент не набрал 60 из 100 при создании игр
Новость опубликована 03.10.2026 ⦁ источник
Исследователи представили SWE-Game — тест из 247 заданий, собранных на основе 41 небольшой игры на Godot. Шесть связок языковых моделей с агентскими средами должны были создавать игры по краткому описанию или готовому дизайн-документу, достраивать заготовки, чинить дефекты и переносить проекты из Godot в Unity. Лучшей во всех пяти режимах оказалась связка с Opus 5, но в трёх режимах создания и достройки игр она не достигла 60 баллов из 100.
Авторы проверяли не только то, запускается ли проект и похож ли кадр на эталон. Их система повторяла заданные действия, следила за состоянием игрового движка и проверяла, работают ли механики, прогресс и условия победы. В результате Opus 5 набрала 50,38 балла при создании игры по краткому описанию, 59,68 — по готовому дизайн-документу и 54,06 — при достройке каркаса. Главными проблемами оказались пропущенные требования и ошибки игровой логики.
С готовой основой агенты справлялись заметно лучше: лучший результат достиг 83,46 балла при исправлении ошибок и 72,40 — при переносе проекта из Godot в Unity. Это не значит, что ИИ уже надёжно заменяет разработчика: тест показывает скорее обратное — починить или перенести заданную систему пока легче, чем самостоятельно собрать запрошенную игру целиком.
Работа опубликована как препринт и ещё не прошла независимое воспроизведение. Набор ограничен 41 сравнительно небольшой игрой, а каждую модель тестировали со своей агентской средой и инструментами, поэтому таблица сравнивает готовые связки, а не «чистый интеллект» моделей. Но SWE-Game полезна уже тем, что отличает правдоподобный ролик от работающей игровой механики — и не позволяет выдать красивую демонстрацию за готовую игру.