Изменение «образа пользователя» снизило отказы Llama с 98% до 62%
Новость опубликована 29.09.2026 ⦁ источник
TobiasK / Wikimedia Commons, CC BY-SA 4.0
Исследователи Технического университета Мюнхена и Центра Гельмгольца научились извлекать и менять внутреннее представление языковой модели о собеседнике. В опыте с Llama 3.1 8B сдвиг только предполагаемого намерения пользователя от вредоносного к доброжелательному снизил долю отказов на опасные запросы с 98% до 62%; сами запросы не меняли. Работа опубликована 25 сентября как препринт.
Метод Belief Self-Distillation (BSD) соединяет чтение такого представления и вмешательство в него. Авторы обучили компактный 128-мерный «образ пользователя» на примерно 58 тысячах бесед и проверили подход на Llama 3.1 8B, Qwen3-8B и OLMo-3-7B. Речь не о настоящих свойствах человека, а о том, что модель вывела из разговора: её оценка может быть ошибочной или стереотипной.
В отдельном опыте на 390 запросах положение вдоль внутренней шкалы намерений предсказывало отказ Llama с площадью под ROC-кривой 0,94 и точностью 88%. Случайное вмешательство того же масштаба и изменение несвязанного признака пола давали заметно меньший эффект. При этом отказы не исчезли: представление о пользователе влияло на защитное решение, но не определяло его целиком.
Это не готовый способ обойти защиту обычным запросом. Для вмешательства нужны доступ к внутренним состояниям модели и отдельный обученный проектор; опыт с отказами провели только на Llama 3.1 8B, а работу ещё не рецензировали. Исследование показывает более узкий, но важный результат: фильтр может учитывать не только содержание запроса, но и скрытую оценку того, кто его задаёт. Теперь такой критерий можно проверять — и отдельно испытывать, насколько защита выдерживает его искажение.
AI Belief Self-Distillation, Llama 3.1 8B, Qwen3-8B, OLMo-3-7B, модель пользователя, безопасность ИИ