ИИ-агента обучили по проверяемому результату — открытый T1 решил 64% задач Terminal-Bench
Новость опубликована 10.09.2026 ⦁ источник
ИИ-иллюстрация OpenAI · Изображение создано ИИ
Исследователи Tencent Hy Foundation Model Frontier и четырёх университетов 10 сентября опубликовали T1 — открытый чекпойнт ИИ-агента для работы в Linux-терминале. Модель получила 122 млрд параметров с архитектурой «смесь экспертов» и обучалась на задачах с цепочками длиной свыше 300 вызовов инструментов. Веса доступны на Hugging Face: собственные доработки выпущены под CC BY 4.0, компоненты базовой Qwen3.5 сохраняют Apache 2.0.
Каждая учебная задача запускалась в изолированной среде и имела скрытый проверяющий сценарий. Наградой служил не вердикт другой нейросети, а число реально пройденных проверок. Для разреженной модели авторы отдельно выровняли обучение с последующим запуском: сохраняли точные сгенерированные токены и выбор экспертов для каждого из них, а затем воспроизводили этот маршрут при обновлении весов.
На Terminal-Bench 2.1 базовая модель решила 43,8% задач, версия после обучения на примерах — 49,4%, а T1 после обучения с подкреплением — 64%. На отдельном Terminal-Bench Hard результат вырос с 20% у базы и 28,3% после обучения на примерах до 38%. Это измерения авторов в опубликованном стенде; независимого воспроизведения пока нет.
Предел результата виден в тех же тестах. В разрезе сложности T1 справился со всеми лёгкими задачами и 78% средних, но только с 33% трудных. В среднем ему понадобилось 94,4 шага против 31,5 у версии после обучения на примерах; на некоторых нерешённых задачах агент тратил сотни ходов и упирался в таймаут. Авторы также предупреждают, что условия по вычислительным ресурсам в части сравнений различались, а учебный набор особенно богат задачами командной строки.
Подтверждённое изменение здесь скромнее обещания автономного программиста, но полезнее очередного места в рейтинге: одна и та же открытая основа заметно прибавила на задачах с исполняемой проверкой, а веса и методика доступны для повторения. T1 показывает работающий способ обучать длинные последовательности действий; безопасную и надёжную работу такого агента в реальных системах эти испытания ещё не доказывают.
T1, Tencent Hy Foundation Model Frontier, Qwen3.5-122B-A10B, Terminal-Bench, ИИ-агенты, Обучение с подкреплением, Смесь экспертов