Исследователь Anthropic оценил риск катастрофы от ИИ выше 10%
Оценка руководителя одной из команд безопасности Эвана Хубингера прозвучала после ухода исследователя Джейкоба Коксона. Оба говорят о рисках самоулучшения ИИ, однако процент — личная оценка, а не результат измерения или прогноз компании.
Уход сотрудника и оценка коллеги
Исследователь Anthropic Джейкоб Коксон объявил об уходе из компании, объяснив решение тем, что, по его мнению, она и OpenAI слишком быстро движутся к самоулучшающимся системам и недостаточно серьёзно относятся к безопасности. До этого он работал над обучением ИИ в Anthropic и OpenAI.
В ответ Эван Хубингер, руководящий одной из команд безопасности Anthropic, написал, что опасается самоулучшения ИИ и считает, что оно происходит быстрее ожидаемого. Он согласился с общей характеристикой риска и лично оценил вероятность того, что ИИ может привести к гибели всего человечества в ближайшее десятилетие, как превышающую одну десятую. Это его субъективная оценка, а не расчёт с опубликованной методикой.
Риск обсуждают, план безопасности не представлен
Коксон и Хубингер говорят о сценарии рекурсивного самоулучшения — когда системы помогают создавать более мощные системы, что теоретически может ускорить развитие вне человеческого контроля. The Verge подчёркивает, что такой сценарий пока не реализовался, хотя ИИ уже используют при написании программного кода.
По словам Хубингера, у Anthropic пока нет плана, гарантирующего безопасность и согласование продвинутого ИИ с человеческими ценностями; он добавил, что компания не находится на очевидном пути к такому плану. Обмен мнениями показывает расхождение между оценкой серьёзности риска и готовностью к нему, но не доказывает неизбежность катастрофы к конкретной дате.