Исследователи из Фуданьского университета, команды Hunyuan Tencent и Университета Цинхуа представили препринт ExplorationBench — тест способности ИИ добывать новые правила через собственные эксперименты. В среде AlienCode лучшая из трёх траекторий Claude Opus 5 поднялась с 3,8% правильных ответов до 87,6% за четыре раунда; GPT-5.6 Sol — с 11% до 87,1%. Столько же дополнительных ходов без обратной связи оставляли системы на уровне 0,5–11%.

Авторы построили два исполняемых «инопланетных мира»: язык программирования AlienCode с 31 скрытым изменением правил и формальную логику AlienLogic с 24 изменениями. После экспериментов модели решали по 70 отложенных задач без доступа к инструментам, а ответы проверяли интерпретатор и формальный верификатор, а не другая языковая модель. Так исследователи попытались отделить обучение на новой обратной связи от воспроизведения знакомых задач из обучающих данных.

Результат оказался сильным, но нестабильным. Траектории одной системы при одинаковом бюджете расходились до 72,8 процентного пункта, а шесть из 30 запусков AlienCode закончили как минимум на три пункта хуже своего более раннего результата. Даже когда модель правильно формулировала нужные правила, она решала соответствующие задачи лишь в 70,9% случаев. В AlienLogic готовый полный набор правил давал 93–97% — выше лучшего результата самостоятельного исследования, 83,8%.

Это контролируемый результат авторского препринта, а не доказательство готовности ИИ к научным открытиям. Два синтетических мира, четыре раунда и выбор лучшей из трёх траекторий не воспроизводят шумные, дорогие и открытые эксперименты реальной науки; независимого повторения пока нет. ExplorationBench показывает более узкую способность: некоторые современные модели могут сами выбрать проверку, извлечь из ответа незнакомое правило и применить его позже, но делают это пока ненадёжно.