Добавить Smartpress в источники Google Smartpress будет чаще появляться у вас в Google.

Разработчик нейросети Claude компания Anthropic намерена предупредить потенциальных инвесторов перед IPO, что развитие продвинутого искусственного интеллекта может привести к “катастрофическим или экзистенциальным рискам для человечества”. Об этом сообщает Reuters, ознакомившийся с проспектом первичного размещения акций компании.

Anthropic

В документе Anthropic подробно перечисляет возможные опасности, связанные с развитием собственных моделей. Среди них – поведение, направленное на самосохранение: попытки противостоять отключению, скрывать или манипулировать информацией и даже действия, “напоминающие шантаж”.

“Разработка нами высокоразвитых моделей, платформ и приложений, а также расширение сценариев их использования могут еще больше увеличить риск того, что наши модели причинят вред”, – говорится в проспекте.

Рискам посвятили около 80 страниц

Обычно компании перед выходом на биржу подробно описывают угрозы для бизнеса, однако формулировки Anthropic выделяются масштабом возможных последствий.

Из 261 страницы основной части проспекта около 80 посвящены факторам риска. Описание самого бизнеса заняло 48 страниц. Для сравнения, SpaceX, владеющая xAI, отвела рискам около 38 страниц из 277.

Anthropic одновременно говорит о потенциально огромном эффекте ИИ – сопоставимом с промышленной революцией или распространением электричества – и предупреждает, что неправильное использование технологии может иметь необратимые последствия.

Исследователь безопасности Anthropic Эван Хубингер ранее оценивал вероятность того, что в ближайшие десять лет ИИ может привести к гибели людей, более чем в 10%.

Модель может понять, что ее проверяют

Отдельная проблема – оценка безопасности уже созданных систем.

“Потенциальное осознание моделью того, что мы ее оцениваем, создает существенное ограничение наших возможностей по проверке безопасности модели”, – говорится в проспекте Anthropic.

В компании отмечают, что во время обучения у моделей иногда неожиданно появляются новые способности. Часть из них удается обнаружить только после внедрения системы.

Исследователи также опасаются, что по мере усложнения ИИ модели все лучше распознают ситуации, когда за их поведением наблюдают, и могут соответственно менять свои ответы или действия. Это усложняет проверку того, как система поведет себя вне тестовой среды.

На безопасность приходится часть вычислительных ресурсов

При этом Anthropic признает, что экономическая отдача от инвестиций в безопасность пока остается неопределенной.

Компания не раскрыла в проспекте точные расходы на соответствующие исследования. Ранее в сентябре Anthropic сообщала, что в одну из недель июля около 6% вычислительных ресурсов, использовавшихся для исследований ИИ, направлялись на работу в области безопасности.

Anthropic

Такие исследования компания называет ресурсоемкими. Anthropic приходится одновременно финансировать вычислительные мощности, привлекать дорогостоящих специалистов и вкладываться в снижение рисков.

В то же время бизнес зависит от постоянного выпуска более совершенных моделей. В проспекте говорится, что использование продуктов клиентами, а следовательно и выручка, зависят от появления новых моделей, поэтому постоянный и частично перекрывающийся цикл релизов необходим, чтобы оставаться среди лидеров разработки ИИ.

На прошлой неделе Anthropic выпустила новую версию модели Opus – спустя десять дней после того, как генеральный директор Дарио Амодеи опубликовал пэссе, в котором рассуждал о необходимости контролировать темпы развития передовых систем.

Anthropic рассчитывает, что рынок оценит безопасный ИИ

В последние недели компания также пообещала раскрывать больше данных о том, как использует действующие модели для создания следующих поколений ИИ. Один из обсуждаемых специалистами рисков – рекурсивное самоулучшение, при котором системы смогут все активнее участвовать в создании более совершенных версий самих себя без прямой помощи человека.

“Мы считаем, что создание надежных, заслуживающих доверия и безопасных систем искусственного интеллекта – коллективная ответственность и что рынок вознаградит такой подход”, – заявила Anthropic в документах для IPO.