Голосовую модель научили менять манеру речи по команде — многоходовые задания она выполняла лишь в 14% случаев
Новость опубликована 11.09.2026 ⦁ источник
Исследователи Scale AI и Мэрилендского университета представили SteerDuplex — экспериментальную голосовую модель, которая одновременно слушает собеседника и говорит и может менять тон, роль, акцент, темп и длину ответа по словесной команде. В препринте от 11 сентября модель выполнила все звуковые требования собственного теста SteerBench в 65,1% случаев против 20,55% у базовой Moshi.
SteerDuplex построена на открытой модели Moshi с 7 млрд параметров. Обучающая смесь включала 504 416 аудиопримеров и 65 675 текстовых примеров; затем авторы использовали два этапа обучения с подкреплением, чтобы система вовремя уступала слово после перебивания, не вмешивалась в паузы и продолжала ответ после коротких реплик слушателя.
На отдельной проверке правильная реакция на перебивание выросла с 72,5% до 82,5%, а доля вмешательств модели в искусственные паузы снизилась с 26,5% до 9%. Но полностью пройти многоходовые задания Audio MultiChallenge после дополнительного обучения система смогла лишь в 14,38% случаев. Общая оценка других многоходовых заданий почти не изменилась, а смысловая точность ответа после перебивания немного снизилась.
Работа не прошла рецензирование. Тесты проводили только на английском, часть результатов оценивала другая языковая модель, а совпадение такого оценщика с людьми составило около 76%. Репозиторий проекта пока содержит лишь обещание опубликовать тест, код и контрольную точку модели. Поэтому SteerDuplex показывает направление улучшения голосовых ассистентов, но пока не является доступным продуктом или независимо подтверждённым решением.
SteerDuplex, Scale AI, Мэрилендский университет, Moshi, SteerBench, Audio MultiChallenge, Голосовые модели, Обучение с подкреплением