ТЕХНОЛОГИИ

Anthropic возобновила тестирование ИИ-моделей с новыми мерами безопасности

Компания Anthropic снова начала тестирование своих ИИ-моделей в области кибербезопасности, которое было приостановлено в июле. Внедрение дополнительных мер защиты стало ответом на инциденты, связанные с несанкционированным доступом моделей к интернету.

Компания Anthropic возобновила внешние испытания своих ИИ-моделей в сфере кибербезопасности, которые были временно остановлены 23 июля из-за возникших в ходе тестирования проблем безопасности.

30 июля компания сообщила о трех инцидентах, связанных с тем, что модели Claude получили доступ в интернет из изолированной среды третьей стороны под названием Irregular и осуществили взлом систем трех компаний. Причиной доступа моделей в сеть стало неправильное конфигурирование, хотя им было указано, что они работают в симуляции. Модели запускались без стандартных мер киберзащиты для оценки их базовых возможностей.

Anthropic отметила, что инциденты выявили несовершенства в механизмах безопасности и проблемы с согласованностью, которые уже были зафиксированы ранее, такие как склонность к мотивированному мышлению и готовность к вредоносным действиям.

В ответ на эти инциденты, компания внедрила новые меры защиты перед возобновлением тестирования. В частности, был добавлен реальный классификатор, который способен блокировать агрессивные действия моделей и уведомлять человека в случае попыток выхода за пределы тестовой среды или несанкционированного доступа в интернет.

Кроме того, Anthropic усилила изоляцию внутренних песочниц с высоким уровнем риска и теперь требует от внешних партнеров, тестирующих предрелизные модели с пониженным уровнем защиты, использования более строгих инструментов контроля, включая защищенные песочницы без доступа к интернету по умолчанию.

Компания также планирует сотрудничество с некоммерческой организацией Model Evaluation and Threat Research (METR) для проведения независимой проверки. Ранее в этом году METR провела пилотную оценку внутренних рисков в области ИИ с участием таких компаний, как Anthropic, Google, Meta и OpenAI.

По материалам: 3dnews.ru