В раскрытых материалах по иску издателей к OpenAI и Microsoft появились внутренние предупреждения о рисках ИИ для производителей контента. В одном из документов Microsoft описана "петля": готовые ответы отнимают у издателей аудиторию и доходы, из-за чего те могут создавать меньше материалов, необходимых для обучения будущих моделей. Истцы используют эти оценки в споре об авторском праве.

Директор прикладных исследований Microsoft Брент Хехт также писал, что массовое использование чужих работ без оплаты многие сочтут присвоением труда. Microsoft ответила, что его комментарии отражают личную позицию сотрудника, а не взгляды компании или юридическую оценку. OpenAI и Microsoft продолжают защищать обучение моделей как добросовестное использование произведений.

По Bloomberg Law, истцы приводят данные Microsoft о снижении доли переходов на сайты издателей. Это основание обсуждать потерю аудитории, но сокращение трафика конкретных компаний ещё не показывает, что в целом станет меньше достоверных сведений или хуже будут обучаться модели. Готовый ответ может быть удобнее читателю, а ИИ — снижать стоимость подготовки материалов и открывать рынок новым участникам. Сохранность рекламной модели нынешних газет сама по себе не является мерой качества информации.

Человеческое происхождение текста тоже не гарантирует его ценности для обучения. В техническом отчёте Phi-4 сама Microsoft описывает эксперименты, в которых повторное обучение на подготовленных синтетических данных повышало результаты на тестах рассуждения сильнее, чем добавление новых веб-текстов. При этом модели, обученные только на синтетике, хуже справлялись с заданиями на знание фактов и чаще выдумывали ответы. Синтетические примеры создавали с опорой на отобранные исходные материалы: речь о подборе и проверке данных, а не об автоматическом превосходстве человеческого или машинного авторства.

Содержательный вопрос — кто и как будет получать и проверять новые сведения о мире. Генерация обучающих примеров не заменяет новых наблюдений, измерений и документов, но эти сведения не обязаны приходить через прежних издателей. Новые производители информации могут найти другие способы заработка, хотя успех такой замены не гарантирован, особенно если сбор сведений перестанет окупаться. Пока же из предупреждений сотрудников и данных о переходах нельзя вывести, что ИИ разрушает собственную базу знаний. Для этого нужно показать потери в производстве и доступности информации с учётом того, что создаёт новая технология.