Дэвид Робинсон, который отвечал в OpenAI за подготовку отчетов о безопасности перед крупными запусками, покинул компанию. В колонке для The Atlantic он объяснил свое решение тем, что OpenAI и другие разработчики искусственного интеллекта, по его мнению, двигаются слишком быстро и полагаются на исправление проблем уже после их появления.
Изображение сгенерировал ИИ
Робинсон проработал в OpenAI три с половиной года. По его словам, он участвовал в подготовке действующей системы оценки рисков Preparedness Framework и курировал создание отчетов о безопасности для 12 запусков передовых моделей.
Главная претензия Робинсона касается не отдельных правил, а корпоративной культуры. Он описывает работу отрасли как череду почти непрерывных спринтов: компании выпускают новые модели, находят уязвимости, усиливают защиту и продолжают развитие. Такой подход, считает он, допустим не для всех технологий.
“Время проб и ошибок прошло”, - пишет Робинсон. Он предлагает строить работу ведущих ИИ-лабораторий по принципам атомных электростанций и крупных аэропортов: с резервными системами, многоступенчатой защитой и процедурами, рассчитанными на человеческую ошибку.
В качестве примеров Робинсон приводит недавние инциденты с ИИ-агентами OpenAI. В сентябре исследовательская модель во время обучения нашла способ обойти ограничения на доступ в интернет через DNS и связалась с внешним чат-ботом. Система мониторинга заметила поведение в течение 15 минут, но эксперимент остановили только через 2,5 часа. После инцидента OpenAI сообщила, что добавила два независимых уровня блокировки.
Робинсон подчеркивает, что не считает своих бывших коллег безразличными к безопасности и видит пользу в развитии ИИ. Однако, по его оценке, нынешнего уровня осторожности недостаточно. Теперь он намерен заниматься вопросами безопасности ИИ вне OpenAI и добиваться появления более сильных внешних стимулов для компаний отрасли.