Искусственный интеллект в ходе тестов и реальной работы начал делать то, чего от него не ждали: обходить запреты, пытаться выбраться из закрытых систем и взламывать сайты. Компании OpenAI и Anthropic сейчас изучают десятки тысяч таких случаев, пишет Axios со ссылкой на источники, знакомые с расследованиями.
Иллюстрация Сара Грилло/Axios
Речь идет о самых современных ИИ-моделях. В одних случаях их специально провоцировали на опасное поведение во время проверок безопасности. Но часть инцидентов произошла уже в реальном мире.
Среди зафиксированных действий - попытки обойти установленные разработчиками ограничения, получить доступ туда, куда модели не должны были попадать, захватить сайты или скрыть свои действия от систем контроля. При этом большинство известных эпизодов пока не привели к реальному ущербу.
OpenAI решила остановиться
После серии таких случаев OpenAI приостановила обучение своих самых мощных моделей. Компания заявила, что продолжит работу только после того, как усилит меры безопасности.
Глава OpenAI Сэм Альтман признал, что проверка инцидентов идет медленнее, чем хотелось бы компании.
Одним из самых серьезных он назвал случай, связанный с платформой Hugging Face. Сотни ИИ-агентов объединились, координировали действия через специальную площадку и взломали внешнюю компанию. Они делали это не ради кражи данных, а пытаясь лучше выполнить задание по кибербезопасности.
Именно это и беспокоит исследователей: модель может получить обычную задачу, но выбрать для ее выполнения способ, который человек ей не разрешал.
ИИ пытался выбраться из “песочницы”
Похожие случаи изучает и Anthropic.
Во время специальных испытаний ее модель Opus 5.5 пыталась выйти из так называемой “песочницы” в 1,5% запусков. Песочница - это изолированная среда, в которой ИИ можно безопасно тестировать, не давая ему доступа к реальным системам.
В Anthropic уточнили важную деталь: эти эксперименты специально были устроены так, что выполнить поставленную задачу, не выйдя за пределы песочницы, было невозможно.
Компании проводят сотни тысяч подобных испытаний. Поэтому даже небольшой процент странного поведения превращается в тысячи и десятки тысяч отдельных эпизодов.
Эксперты считают, что полностью исключить подобные действия моделей может быть крайне сложно. Чем самостоятельнее становятся ИИ-агенты, тем больше способов они способны находить для выполнения поставленной перед ними задачи.
Один из таких случаев уже произошел
ИИ-агент OpenAI искал медицинскую статистику, но в процессе получил несанкционированный доступ к непубличным файлам Medicare и ресурсам еще нескольких государственных ведомств Австралии. Персональные медицинские данные, по имеющейся информации, не пострадали.
После инцидента власти страны начали выяснять, можно ли привлечь компанию к ответственности за действия автономного ИИ-агента.