Из OpenAI ушёл специалист по безопасности и назвал культуру компании «сломанной»: исправлять проблемы после релиза стало слишком опасно
Дэвид Робинсон, который три с половиной года работал в OpenAI и участвовал в создании ключевых механизмов оценки рисков искусственного интеллекта (ИИ), покинул компанию. В опубликованном после ухода эссе он заявил, что культура OpenAI «сломана», а привычный для технологической отрасли подход «сначала выпустить, затем исправлять проблемы» становится слишком опасным по мере роста возможностей ИИ.
Критика особенно заметна из-за роли самого Робинсона. По его словам, он руководил подготовкой отчетов по безопасности, сопровождавших крупнейшие запуски OpenAI, и курировал такие отчеты для 12 передовых моделей.
Он также участвовал в разработке действующей Системы готовности к рискам (Preparedness Framework) — правил, с помощью которых OpenAI оценивает потенциально опасные возможности новых моделей перед их выпуском.
«Время проб и ошибок закончилось»
Главная претензия Робинсона касается подхода, который OpenAI называет «поэтапным внедрением» (iterative deployment).
Его суть заключается в том, что компания выпускает новые системы, наблюдает за возникающими проблемами, а затем усиливает защитные механизмы и ограничения.
По мнению Робинсона, такой метод помог развитию ИИ на ранних этапах, однако у него есть принципиальный недостаток: он предполагает, что некоторые сбои неизбежно будут обнаружены уже после появления более мощной системы.
«Время проб и ошибок закончилось», — написал бывший сотрудник OpenAI.
Он считает, что последствия ошибок становятся серьезнее вместе с ростом возможностей моделей, поэтому разработчики уже не могут рассчитывать только на исправление проблем после их обнаружения.
Почему он сравнивает ИИ с атомными электростанциями и авиацией
Робинсон предлагает компаниям, создающим наиболее мощные системы искусственного интеллекта, перенимать подходы отраслей, где одна человеческая ошибка потенциально может привести к тяжелым последствиям.
В качестве примеров он приводит атомную энергетику и авиацию. Там безопасность строится на нескольких независимых уровнях защиты, резервировании и длительном планировании, чтобы единичная ошибка не превратилась в катастрофу.
По словам Робинсона, за три с половиной года в OpenAI он не встречал коллег с профессиональным опытом обеспечения безопасности самолетов, атомных реакторов или устойчивости финансовой системы.
Он считает, что разработчикам ИИ необходимо привлекать больше специалистов из таких отраслей и менять сами процессы создания моделей, а не только добавлять новые проверки перед запуском.
Проблема глубже отдельных правил
Робинсон утверждает, что главная трудность заключается не только в нехватке конкретного стандарта безопасности или нового закона.
По его версии, внутри технологических компаний команды постоянно переходят от одного крупного запуска к следующему, из-за чего у сотрудников остается недостаточно времени на фундаментальные изменения процессов.
Он написал, что сотрудники были настолько заняты постоянной гонкой, что редко получали возможность серьезно обсуждать крупные изменения — тем более реализовывать их.
Именно поэтому Робинсон пришел к выводу, что значительная часть стимулов к более осторожной разработке должна поступать извне компании.
Особую тревогу вызывают более самостоятельные модели
Один из аргументов Робинсона связан с появлением ИИ-систем, способных выполнять длинные последовательности действий практически самостоятельно.
В последние месяцы OpenAI сама раскрывала случаи нежелательного поведения экспериментальных моделей, включая выход агентов за пределы предусмотренной среды и неожиданные действия во время испытаний.
Эта тема уже получала развитие и на Kurs.com.ua: компания рассказывала о случаях, когда экспериментальные модели взаимодействовали между собой, получали доступ к внешним системам и демонстрировали поведение, которого разработчики заранее не планировали.
Для Робинсона подобные эпизоды показывают предел подхода, основанного преимущественно на обнаружении проблем после их появления.
Есть еще одна проблема — соответствие ИИ человеческим целям
Отдельно Робинсон говорит о так называемом согласовании поведения ИИ с человеческими целями и ценностями (alignment).
Это направление исследований пытается добиться того, чтобы все более самостоятельные системы выполняли именно те задачи, которые подразумевает человек, и не находили опасные или нежелательные способы достижения заданной цели.
По словам Робинсона, возможности современных моделей развиваются быстрее, чем понимание того, насколько надежно их поведение можно согласовать с человеческими намерениями.
Он считает существующие способы измерения такого соответствия слишком грубыми для систем, которые становятся значительно мощнее.
Что ответила OpenAI
OpenAI отвергает представление о том, что развитие моделей продолжается независимо от рисков.
Представитель компании заявил Reuters, что OpenAI следит за тем, чтобы возможности моделей не превышали уровень, который компания способна безопасно контролировать и защищать.
По словам компании, при необходимости она приостанавливает обучение или задерживает выпуск моделей.
OpenAI также заявила об усилении безопасности исследовательской и испытательной инфраструктуры, расширении независимой оценки моделей и развитии наблюдения за их поведением в реальном времени.
Почему уход Робинсона важен
Это не первый случай, когда специалисты по безопасности покидают ведущие компании в сфере ИИ и публично предупреждают о рисках гонки за более мощными моделями.
Однако в данном случае критика исходит от человека, который непосредственно участвовал в подготовке внутренних правил оценки рисков и отчетов, сопровождавших крупнейшие запуски OpenAI.
Сам Робинсон признает, что его выводы остаются его собственной оценкой. Он также не утверждает, что развитие искусственного интеллекта необходимо остановить.
Его главный тезис другой: по мере роста возможностей моделей цена ошибки повышается, поэтому система, рассчитанная на постоянные эксперименты и последующее исправление обнаруженных проблем, может перестать быть достаточной.
После ухода из OpenAI Робинсон намерен заниматься вопросами безопасности искусственного интеллекта извне компании и добиваться появления более сильных стимулов для осторожной разработки.
По материалам: Reuters, The Atlantic