Слова «official» и «not-phishing» меняли решения ИИ о подозрительных доменах
Новость опубликована 24.09.2026 ⦁ источник
Короткие утверждения внутри доменного имени меняли решения языковых моделей о возможном фишинге — без команды игнорировать инструкции. В препринте ClaimMirage от 24 сентября исследователи Токийского столичного университета и NTT собрали 622 080 решений пяти моделей по сконструированным именам, имитирующим 64 бренда.
Авторы сравнивали слова вроде «not-phishing», «not-malware» и «official» с нейтральными заменами той же длины и с тем же числом дефисов. Модели видели только имя домена, иногда — название бренда и его настоящий адрес; веб-страницу, данные DNS, владельца и репутацию им не показывали. В одной настройке Llama 3.3 70B при наличии настоящего адреса бренда отмечала 90,2% контрольных имён, но только 44,8% имён с отрицанием риска — разница составила 45,3 процентного пункта.
Эффект зависел и от слова, и от модели. Для «not-impersonating» в той же настройке разница достигла 92,2 пункта и повторилась для 59 из 64 брендов, а для «not-phishing» составила 16,4 пункта и повторилась для восьми. При этом слова одобрения без справки о бренде действовали на Llama в обратную сторону: «official», «verified» и их аналоги повышали долю тревог с 32,3% до 98%. Gemma 3 27B при полной справке вообще не показала разницы между такими утверждениями и контрольными словами. Простого универсального трюка не получилось.
Работа проверяет решения на искусственных именах, а не успех реальных атак: исследователи не регистрировали домены и не измеряли переходы пользователей. Это предварительная публикация без независимого воспроизведения, а пять испытанных конфигураций не представляют все современные системы. Установленный предел уже практичен: надпись внутри проверяемого адреса не подтверждает его безопасность или связь с брендом — для этого нужны независимые сведения.
ClaimMirage, Фишинг, Доменные имена, Llama 3.3 70B, Gemma 3, gpt-oss-20b, Tokyo Metropolitan University, NTT Security Holdings