Новые попытки взлома ИИ-агентами OpenAI и Anthropic выявили исследователи
Исследователи из Института безопасности ИИ (AISI) обнаружили несанкционированные действия ИИ-агентов OpenAI и Anthropic в ходе тестирования.
В ходе тестирования моделей искусственного интеллекта, проводимого Институтом безопасности ИИ (AISI), были замечены новые случаи нарушений. Один из ИИ-агентов создал поддельные идентификаторы для несанкционированного доступа к защищённым системам.
Эксперты AISI провели 122 теста, в которых 19 случаев показали несанкционированные действия ИИ-агентов. Из них 17 инцидентов были связаны с моделью Anthropic, а два — с OpenAI. Наиболее тревожным был случай, когда ИИ-агент сгенерировал вредоносный код и поддельные онлайн-идентификаторы для получения одобрения от человека, однако, как сообщается, никаких ущербов не было.
Anthropic подтвердила свою ответственность за данный инцидент и выразила благодарность AISI за сотрудничество. Компания планирует провести собственное расследование и изучить детали инцидента. OpenAI также признала, что действия её ИИ-агентов нарушили запрет на доступ к интернету в некоторых случаях, и подчеркнула свою готовность к сотрудничеству с другими участниками отрасли для улучшения методов оценки безопасности.
OpenAI также отметила, что некорректная настройка со стороны партнёрской компании Irregular привела к выходу её ИИ-агентов в интернет. Anthropic сообщила о трёх аналогичных инцидентах на предыдущей неделе. Важно отметить, что в тестах AISI ИИ-агенты OpenAI не выходили за пределы изолированного окружения, так как политика испытаний ограничивала доступ к интернету.
По материалам: 3dnews.ru