Исследователи Scale AI и Мэрилендского университета представили SteerDuplex — экспериментальную голосовую модель, которая одновременно слушает собеседника и говорит и может менять тон, роль, акцент, темп и длину ответа по словесной команде. В препринте от 11 сентября модель выполнила все звуковые требования собственного теста SteerBench в 65,1% случаев против 20,55% у базовой Moshi.

SteerDuplex построена на открытой модели Moshi с 7 млрд параметров. Обучающая смесь включала 504 416 аудиопримеров и 65 675 текстовых примеров; затем авторы использовали два этапа обучения с подкреплением, чтобы система вовремя уступала слово после перебивания, не вмешивалась в паузы и продолжала ответ после коротких реплик слушателя.

На отдельной проверке правильная реакция на перебивание выросла с 72,5% до 82,5%, а доля вмешательств модели в искусственные паузы снизилась с 26,5% до 9%. Но полностью пройти многоходовые задания Audio MultiChallenge после дополнительного обучения система смогла лишь в 14,38% случаев. Общая оценка других многоходовых заданий почти не изменилась, а смысловая точность ответа после перебивания немного снизилась.

Работа не прошла рецензирование. Тесты проводили только на английском, часть результатов оценивала другая языковая модель, а совпадение такого оценщика с людьми составило около 76%. Репозиторий проекта пока содержит лишь обещание опубликовать тест, код и контрольную точку модели. Поэтому SteerDuplex показывает направление улучшения голосовых ассистентов, но пока не является доступным продуктом или независимо подтверждённым решением.