
ИИ-исследователи Anthropic и Google DeepMind предупреждают: риск гибели человечества от ИИ выше 10%
Руководители по безопасности ИИ в Anthropic и Google DeepMind оценивают вероятность вымирания людей от ИИ в ближайшие 10 лет выше 10%. Опасения вызваны рекурсивным самоулучшением моделей.
Руководитель направления Alignment Science в Anthropic Эван Хубингер публично заявил, что оценивает вероятность гибели всего человечества от искусственного интеллекта в ближайшие десять лет выше 10%. Заявление последовало после увольнения его коллеги Джейкоба Коксона, который три года работал над обучением моделей в OpenAI и Anthropic и ушёл, считая текущее направление развития ИИ слишком опасным. Через несколько дней аналогичную позицию занял Билал Чугтай из Google DeepMind, также занимавшийся безопасностью ИИ.
Экспертные оценки риска подтверждаются опросами: в анкетировании 2778 авторов работ на ведущих AI-конференциях 38% респондентов дали не менее 10% вероятности экстремально негативным исходам вроде вымирания. При прямом вопросе об вымирании или необратимой потере контроля доля таких оценок составляла от 41,2% до 51,4% в зависимости от формулировки.
Ключевой механизм опасений — рекурсивное самоулучшение. Не требуется, чтобы модель сама переписала свой код: достаточно, что ИИ всё лучше выполняет работу по созданию следующего поколения ИИ — предлагает гипотезы, пишет код экспериментов, анализирует результаты. Цикл ускоряется: ИИ создаёт более сильный ИИ, тот — ещё более сильный, и возможности людей проверять каждое поколение могут отставать от темпа развития.
Первые элементы цикла уже работают. По данным Anthropic, к маю 2026 года Claude писал более 80% кода, добавляемого в основную кодовую базу компании. Внутренняя модель Mythos Preview по субъективным оценкам сотрудников даёт примерно четырёхкратный прирост производительности исследователей. Эксперимент с девятью агентами Claude Opus 4.6 показал: за пять дней они закрыли 97% разрыва между слабой и сильной моделью против 23% у двух человеческих исследователей за семь дней.
Однако перенос таких результатов на реальное обучение пограничных моделей пока даёт лишь 0,5 пункта улучшения — в пределах статистического шума. OpenAI в июле 2026 года оценила GPT-5.6 ниже уровня High по способности ускорять создание следующего ИИ. Направление исследований и выбор решений остаются за людьми. Дополнительная проблема — интерпретируемость: разработчики знают архитектуру и обучение, но точные внутренние механизмы принятия решений восстановить сложно.



