Глава Anthropic предложил международные ограничения на самоулучшение ИИ

Дарио Амодеи предлагает обсуждать безопасность моделей, общие стандарты и отдельные ограничения на скорость рекурсивного самоулучшения. Он призывает включить Китай в международные переговоры.

Четыре уровня договорённостей

Глава Anthropic Дарио Амодеи призвал к международным ограничениям на рекурсивное самоулучшение ИИ — процесс, в котором системы помогают разрабатывать следующие поколения моделей. По его мнению, ускорение разработки может опередить способность людей понимать и контролировать технологии.

Амодеи предложил четыре уровня соглашений: запрет опасных применений, например создания биологического оружия; общие проверки безопасности; единые стандарты для лабораторий демократических стран; и отдельный «лимит скорости» на самоулучшение. Последний он сравнивает с договорами об ограничении вооружений.

Переговоры с участием Китая

Амодеи также призывает включить Китай в переговоры, поскольку значимые разработки и потенциальные риски не ограничены одной группой стран. Предложение описывает возможные направления международной координации, а не уже согласованный договор или действующие ограничения.

Аргумент о темпе развития — оценка руководителя компании, работающей над передовыми моделями. В публикации речь идёт о политическом предложении и необходимости обсуждения, а не о проверенном прогнозе конкретной даты, когда контроль станет невозможен.

Предложенные Амодеи уровни включают запрет отдельных опасных применений, общие проверки безопасности, общие стандарты для лабораторий демократических стран и отдельные ограничения скорости самоулучшения; он также предлагает вовлечь Китай. Ещё один элемент — постоянные независимые аудиторы внутри лабораторий с доступом к системам и правом публиковать результаты.

Амодеи считает полную остановку разработки нереалистичной: нарушитель мог бы получить преимущество. Выигранное время он предлагает направить на безопасность, изучение поведения моделей, более строгие тесты и эксплуатационный контроль. Его оценка угрозы интернету в горизонте шести–двенадцати месяцев является прогнозом главы Anthropic.

The Decoder: предложение Дарио Амодеи о темпах развития ИИ