Четыре способа помешать ИИ уничтожить нас всех в течение 10 лет

Два известных специалиста по компьютерам из Принстонского университета и соавторы книги AI Snake Oil высказали свое мнение по поводу того, убьет ли ИИ всех нас к концу десятилетия.

Эти двое получили известность благодаря своей работе по отделению фактов от вымысла в мире искусственного интеллекта и теперь отреагировали на признание компании Anthropic в том, что существует более чем 10-процентная вероятность того, что ИИ уничтожит всех людей в ближайшие десять лет…

ИИ убьет нас всех в течение 10 лет

Все началось с того, что исследователь ИИ Джейкоб Коксон, работавший как в OpenAI, так и в Anthropic, уволился со своей работы, заявив, что обе компании знают о способности систем ИИ уничтожить нас всех к концу десятилетия. Его пост набрал более 156 миллионов просмотров.

Люди, создающие ИИ, искренне верят, что он может уничтожить нас всех к концу десятилетия. Это не маркетинговый трюк. Во всяком случае, многие руководители и старшие исследователи подбирают формулировки в прессе так, чтобы звучать разумно, но я слышу, как те же люди выражают страх в частном порядке. Никакая другая человеческая деятельность не представляет такого уровня опасности.

Можно было бы ожидать, что обе компании ответят, назвав его чудаком, но отнюдь нет. Один из руководителей Anthropic по безопасности ИИ, Эван Хабингер, заявил, что Коксон прав, хотя и в более долгосрочной перспективе.

Джейкоб здесь прав — мы действительно искренне верим, что ИИ может убить всех людей! Я лично считаю, что вероятность составляет >10% в следующем десятилетии. Я верю, что Anthropic изо всех сил старается, но у нас пока нет плана решения проблемы выравнивания для суперинтеллекта, и мы явно не движемся к нему.

Было мало конкретики относительно того, как именно ИИ может нас убить, но основной упор делался на возможность разрушительных кибератак на инфраструктуру коммунальных служб (например, водо- и электростанции) и другие ключевые системы, от которых зависит современная цивилизация.

Может ли выравнивание снизить риск?

Важным элементом спора является то, можно ли успешно устранить риски с помощью более интенсивной работы над выравниванием. Этот термин используется для обозначения гарантии того, что цели систем ИИ совпадают с целями человечества.

Некоторые утверждают, что в конечном итоге это устранит риск, гарантируя, что системы ИИ будут хотеть того же, чего и мы. Другие не согласны, заявляя, что системы ИИ могут притворяться выровненными, чтобы пройти проверки безопасности, в то время как тайно преследовать собственные противоречащие цели.

Капур и Нараянан говорят, что этого недостаточно

Саяш Капур и Арвинд Нараянан сделали себе имя, борясь с тем, что они называют «хайпом, дезинформацией и непониманием» вокруг ИИ.

Они прямо не затронули заявление о >10% риска уничтожения, но написали обширное эссе, в котором утверждают, что справиться с рисками ИИ можно с помощью так называемого многоуровневого подхода к безопасности ИИ. Они противопоставляют пессимистичный взгляд сообщества специалистов по безопасности ИИ более скептическому мнению части кибербезопасного сообщества о том, что это всего лишь бизнес как обычно.

Они утверждают, что необходима более взвешенная золотая середина. В частности, они говорят, что само по себе выравнивание недостаточно и его необходимо дополнить тремя дополнительными уровнями:

Авторы завершают свое эссе на оптимистичной ноте.

Если мы будем действовать с должной срочностью, мы сможем предъявить компаниям, занимающимся ИИ, более высокие требования, снизить риски потери контроля и даже качнуть баланс между атакующими и защищающимися в кибербезопасности обратно в сторону защитников.

Мнение 9to5Mac

Я не знаю, убьет ли нас ИИ к концу десятилетия, но определенно есть достаточно причин для беспокойства, чтобы сделать безопасность ИИ ключевым приоритетом. Идея о том, что работа по выравниванию является частью решения, но сама по себе недостаточна, кажется мне абсолютно здравой.

Каково ваше мнение обо всем этом? Пожалуйста, поделитесь своими мыслями в комментариях.

Фото: Franck V. на Unsplash