Короткие утверждения внутри доменного имени меняли решения языковых моделей о возможном фишинге — без команды игнорировать инструкции. В препринте ClaimMirage от 24 сентября исследователи Токийского столичного университета и NTT собрали 622 080 решений пяти моделей по сконструированным именам, имитирующим 64 бренда.

Авторы сравнивали слова вроде «not-phishing», «not-malware» и «official» с нейтральными заменами той же длины и с тем же числом дефисов. Модели видели только имя домена, иногда — название бренда и его настоящий адрес; веб-страницу, данные DNS, владельца и репутацию им не показывали. В одной настройке Llama 3.3 70B при наличии настоящего адреса бренда отмечала 90,2% контрольных имён, но только 44,8% имён с отрицанием риска — разница составила 45,3 процентного пункта.

Эффект зависел и от слова, и от модели. Для «not-impersonating» в той же настройке разница достигла 92,2 пункта и повторилась для 59 из 64 брендов, а для «not-phishing» составила 16,4 пункта и повторилась для восьми. При этом слова одобрения без справки о бренде действовали на Llama в обратную сторону: «official», «verified» и их аналоги повышали долю тревог с 32,3% до 98%. Gemma 3 27B при полной справке вообще не показала разницы между такими утверждениями и контрольными словами. Простого универсального трюка не получилось.

Работа проверяет решения на искусственных именах, а не успех реальных атак: исследователи не регистрировали домены и не измеряли переходы пользователей. Это предварительная публикация без независимого воспроизведения, а пять испытанных конфигураций не представляют все современные системы. Установленный предел уже практичен: надпись внутри проверяемого адреса не подтверждает его безопасность или связь с брендом — для этого нужны независимые сведения.