Вероятность ИИ-апокалипсиса выше 10% — на чём основан прогноз?
Новость опубликована 09.09.2026 ⦁ источник
Вероятность того, что ИИ уничтожит всех людей в ближайшие десять лет, превышает 10% — такова личная оценка Эвана Хабингера, руководителя команды Anthropic, изучающей согласование поведения ИИ с человеческими целями. В посте он не приводит расчёта этой вероятности. Один из его доводов — у компании пока нет плана, как согласовать поведение будущего сверхинтеллекта с человеческими целями. При этом риск от нынешних моделей Хабингер считает низким: он опасается будущих систем, способных улучшать самих себя. Пост Хабингера, его уточнение.
Разговоры о конце света в Anthropic дошли до кадровых последствий. Хабингер поддержал исследователя Джейкоба Коксона, объявившего об уходе и обвинившего Anthropic и OpenAI в безответственной гонке за самосовершенствующимся сверхразумом. По словам Коксона, разработчики всерьёз допускают, что ИИ может уничтожить человечество к концу десятилетия, а в частных беседах боятся сильнее, чем показывают публично. Тред Коксона.
Коксон описывает почти мессианскую логику: в Anthropic якобы понимают опасность, но считают, что остальные поступят ещё безответственнее, поэтому первыми должны успеть они сами. Спасать мир от опасной гонки предлагается участием в опасной гонке. Сам Коксон с этим не согласен: он выступает за договорённости между лабораториями о темпе разработки и допускает временный запрет на улучшение возможностей моделей.
У осторожности нынешнего главы Anthropic Дарио Амодеи есть длинная история. В 2019 году, ещё работая в OpenAI, он убеждал коллег не выпускать сразу полную GPT-2 из-за возможной опасности. Позднее Амодеи объяснил: "Я не знал, опасна ли эта модель". Речь тогда шла о злоупотреблениях генерацией текста, включая дезинформацию и спам. В ноябре 2019 года OpenAI выпустила полную модель и сообщила, что к тому моменту не обнаружила убедительных свидетельств злоупотреблений. Интервью Амодеи, итоги выпуска GPT-2.
Непредвиденная технологическая катастрофа возможна, а история GPT-2 не гарантирует безопасности будущих систем. Но из этой возможности не следуют ни конкретный срок гибели человечества, ни названная вероятность. Основания для тревоги авторы называют: прогресс моделей, опасные инциденты и нерешённые задачи безопасности. Конкретные риски автоматизации исследований Anthropic также разбирает в августовском отчёте. Однако в постах не показано, как из этих доводов получаются конкретные сроки и численная вероятность катастрофы. Страшный прогноз не становится точнее от того, что его автору действительно страшно.