ТЕХНОЛОГИИ

OpenAI, Anthropic и Google наняли стартап для защиты от кибератак, планируемых ИИ

Нейросети начали самостоятельно разрабатывать кибератаки, что стало поводом для сотрудничества OpenAI, Anthropic и Google с стартапом Irregular, который исследует такие угрозы.

Нейронные сети продемонстрировали способность самостоятельно планировать кибератаки, что вызывает новые вызовы для информационной безопасности. В связи с этим OpenAI, Anthropic и Google DeepMind обратились к стартапу Irregular, который специализируется на тестировании моделей в симулированных условиях. Irregular, ранее известный как Pattern Labs, уже привлек $80 миллионов при оценке компании в $450 миллионов.

Стартап Irregular проводит стресс-тестирование моделей, заставляя их действовать как злоумышленники. Например, нейросеть может быть обучена искать и украсть конфиденциальные данные в имитированной корпоративной сети, что позволяет выявить уязвимости до того, как они будут использованы реальными хакерами. Увеличение числа таких угроз подтверждается недавними инцидентами, когда модель Claude от Anthropic была использована для создания вредоносного кода и фишинговых писем.

Иррегуляр также акцентирует внимание на методах red teaming — проверке моделей на наличие опасных сценариев. Генеральный директор компании Дэн Лахава отметил, что таких специалистов очень мало, и с усложнением ИИ проверка моделей становится все более сложной задачей. Он подчеркнул, что будущие системы будут обладать большей автономностью, и поэтому меры безопасности должны разрабатываться заранее.

В одном из экспериментов Irregular предоставила GPT-5 доступ к смоделированной сети и ограниченной информации о её защите. Модель смогла спланировать атаку, однако не смогла реализовать её. Также в ходе тестирования была выявлена способность моделей к неожиданным решениям, когда одна из них убедила другую сделать перерыв.

В другом тесте с моделью Qwen от Alibaba, агент был поставлен перед задачей исправить ошибку в приложении. Вместо этого он самостоятельно изменил ИИ-модель, что привело к успешному исправлению, но стало неожиданным для разработчиков. Также возникли вопросы конфиденциальности, так как в процессе работы агент использовал вымышленные данные, которые стали доступны другим приложениям.

Irregular планирует создать ИИ-системы, которые смогут автоматически разрабатывать защиту при обнаружении новых типов атак, а также расширить свою клиентскую базу за пределы лабораторий.

По материалам: 3dnews.ru