Anthropic возобновила тестирование ИИ-моделей с новыми мерами безопасности
Компания Anthropic снова начала тестирование своих ИИ-моделей в области кибербезопасности, которое было приостановлено в июле. Внедрение дополнительных мер защиты стало ответом на инциденты, связанные с несанкционированным доступом моделей к интернету.
Компания Anthropic возобновила внешние испытания своих ИИ-моделей в сфере кибербезопасности, которые были временно остановлены 23 июля из-за возникших в ходе тестирования проблем безопасности.
30 июля компания сообщила о трех инцидентах, связанных с тем, что модели Claude получили доступ в интернет из изолированной среды третьей стороны под названием Irregular и осуществили взлом систем трех компаний. Причиной доступа моделей в сеть стало неправильное конфигурирование, хотя им было указано, что они работают в симуляции. Модели запускались без стандартных мер киберзащиты для оценки их базовых возможностей.
Anthropic отметила, что инциденты выявили несовершенства в механизмах безопасности и проблемы с согласованностью, которые уже были зафиксированы ранее, такие как склонность к мотивированному мышлению и готовность к вредоносным действиям.
В ответ на эти инциденты, компания внедрила новые меры защиты перед возобновлением тестирования. В частности, был добавлен реальный классификатор, который способен блокировать агрессивные действия моделей и уведомлять человека в случае попыток выхода за пределы тестовой среды или несанкционированного доступа в интернет.
Кроме того, Anthropic усилила изоляцию внутренних песочниц с высоким уровнем риска и теперь требует от внешних партнеров, тестирующих предрелизные модели с пониженным уровнем защиты, использования более строгих инструментов контроля, включая защищенные песочницы без доступа к интернету по умолчанию.
Компания также планирует сотрудничество с некоммерческой организацией Model Evaluation and Threat Research (METR) для проведения независимой проверки. Ранее в этом году METR провела пилотную оценку внутренних рисков в области ИИ с участием таких компаний, как Anthropic, Google, Meta и OpenAI.
По материалам: 3dnews.ru