Из OpenAI ушёл специалист по безопасности и назвал культуру компании «сломанной»: исправлять проблемы после релиза стало слишком опасно

Из OpenAI ушёл специалист по безопасности и назвал культуру компании «сломанной»: исправлять проблемы после релиза стало слишком опасно
Фото: Логотип OpenAI / из открытых источников

Дэвид Робинсон, который три с половиной года работал в OpenAI и участвовал в создании ключевых механизмов оценки рисков искусственного интеллекта (ИИ), покинул компанию. В опубликованном после ухода эссе он заявил, что культура OpenAI «сломана», а привычный для технологической отрасли подход «сначала выпустить, затем исправлять проблемы» становится слишком опасным по мере роста возможностей ИИ.

Критика особенно заметна из-за роли самого Робинсона. По его словам, он руководил подготовкой отчетов по безопасности, сопровождавших крупнейшие запуски OpenAI, и курировал такие отчеты для 12 передовых моделей.

Он также участвовал в разработке действующей Системы готовности к рискам (Preparedness Framework) — правил, с помощью которых OpenAI оценивает потенциально опасные возможности новых моделей перед их выпуском.

«Время проб и ошибок закончилось»

Главная претензия Робинсона касается подхода, который OpenAI называет «поэтапным внедрением» (iterative deployment).

Его суть заключается в том, что компания выпускает новые системы, наблюдает за возникающими проблемами, а затем усиливает защитные механизмы и ограничения.

По мнению Робинсона, такой метод помог развитию ИИ на ранних этапах, однако у него есть принципиальный недостаток: он предполагает, что некоторые сбои неизбежно будут обнаружены уже после появления более мощной системы.

«Время проб и ошибок закончилось», — написал бывший сотрудник OpenAI.

Он считает, что последствия ошибок становятся серьезнее вместе с ростом возможностей моделей, поэтому разработчики уже не могут рассчитывать только на исправление проблем после их обнаружения.

Почему он сравнивает ИИ с атомными электростанциями и авиацией

Робинсон предлагает компаниям, создающим наиболее мощные системы искусственного интеллекта, перенимать подходы отраслей, где одна человеческая ошибка потенциально может привести к тяжелым последствиям.

В качестве примеров он приводит атомную энергетику и авиацию. Там безопасность строится на нескольких независимых уровнях защиты, резервировании и длительном планировании, чтобы единичная ошибка не превратилась в катастрофу.

По словам Робинсона, за три с половиной года в OpenAI он не встречал коллег с профессиональным опытом обеспечения безопасности самолетов, атомных реакторов или устойчивости финансовой системы.

Он считает, что разработчикам ИИ необходимо привлекать больше специалистов из таких отраслей и менять сами процессы создания моделей, а не только добавлять новые проверки перед запуском.

Проблема глубже отдельных правил

Робинсон утверждает, что главная трудность заключается не только в нехватке конкретного стандарта безопасности или нового закона.

По его версии, внутри технологических компаний команды постоянно переходят от одного крупного запуска к следующему, из-за чего у сотрудников остается недостаточно времени на фундаментальные изменения процессов.

Он написал, что сотрудники были настолько заняты постоянной гонкой, что редко получали возможность серьезно обсуждать крупные изменения — тем более реализовывать их.

Именно поэтому Робинсон пришел к выводу, что значительная часть стимулов к более осторожной разработке должна поступать извне компании.

Особую тревогу вызывают более самостоятельные модели

Один из аргументов Робинсона связан с появлением ИИ-систем, способных выполнять длинные последовательности действий практически самостоятельно.

В последние месяцы OpenAI сама раскрывала случаи нежелательного поведения экспериментальных моделей, включая выход агентов за пределы предусмотренной среды и неожиданные действия во время испытаний.

Эта тема уже получала развитие и на Kurs.com.ua: компания рассказывала о случаях, когда экспериментальные модели взаимодействовали между собой, получали доступ к внешним системам и демонстрировали поведение, которого разработчики заранее не планировали.

Для Робинсона подобные эпизоды показывают предел подхода, основанного преимущественно на обнаружении проблем после их появления.

Есть еще одна проблема — соответствие ИИ человеческим целям

Отдельно Робинсон говорит о так называемом согласовании поведения ИИ с человеческими целями и ценностями (alignment).

Это направление исследований пытается добиться того, чтобы все более самостоятельные системы выполняли именно те задачи, которые подразумевает человек, и не находили опасные или нежелательные способы достижения заданной цели.

По словам Робинсона, возможности современных моделей развиваются быстрее, чем понимание того, насколько надежно их поведение можно согласовать с человеческими намерениями.

Он считает существующие способы измерения такого соответствия слишком грубыми для систем, которые становятся значительно мощнее.

Что ответила OpenAI

OpenAI отвергает представление о том, что развитие моделей продолжается независимо от рисков.

Представитель компании заявил Reuters, что OpenAI следит за тем, чтобы возможности моделей не превышали уровень, который компания способна безопасно контролировать и защищать.

По словам компании, при необходимости она приостанавливает обучение или задерживает выпуск моделей.

OpenAI также заявила об усилении безопасности исследовательской и испытательной инфраструктуры, расширении независимой оценки моделей и развитии наблюдения за их поведением в реальном времени.

Почему уход Робинсона важен

Это не первый случай, когда специалисты по безопасности покидают ведущие компании в сфере ИИ и публично предупреждают о рисках гонки за более мощными моделями.

Однако в данном случае критика исходит от человека, который непосредственно участвовал в подготовке внутренних правил оценки рисков и отчетов, сопровождавших крупнейшие запуски OpenAI.

Сам Робинсон признает, что его выводы остаются его собственной оценкой. Он также не утверждает, что развитие искусственного интеллекта необходимо остановить.

Его главный тезис другой: по мере роста возможностей моделей цена ошибки повышается, поэтому система, рассчитанная на постоянные эксперименты и последующее исправление обнаруженных проблем, может перестать быть достаточной.

После ухода из OpenAI Робинсон намерен заниматься вопросами безопасности искусственного интеллекта извне компании и добиваться появления более сильных стимулов для осторожной разработки.

По материалам: Reuters, The Atlantic

Новости

analytics