Исследование: открытые ИИ-модели могут быть легко адаптированы для вредоносных целей
Группа ученых выяснила, что любые ИИ-модели с открытыми весами можно модифицировать, чтобы они давали вредоносные ответы, несмотря на защитные меры разработчиков.
Международная команда ученых провела исследование, в ходе которого было установлено, что модели искусственного интеллекта с открытыми весами могут быть изменены так, чтобы они отвечали на вредоносные запросы. Это возможно даже в случаях, когда разработчики пытались внедрить защитные механизмы.
Ученые выделили девять методов, позволяющих отключить защитные меры на открытых ИИ-моделях. К ним относятся обычная тонкая настройка с использованием безопасных данных, низкоранговая адаптация (LoRA), прямое обучение на вредоносных данных, многоязычная настройка и использование триггеров для активации вредоносного режима. Также были отмечены методы, связанные с изменением стиля письма и манипуляциями с входными токенами.
В исследовании были протестированы 21 модель ИИ с количеством параметров от 0,6 до 8 миллиардов, включая модели Meta✴ Llama, Alibaba Qwen3 и Mistral-7B. Все они продемонстрировали уязвимость к некоторым из названных методов. Несмотря на ослабление защитных механизмов, качество ответов моделей оставалось на приемлемом уровне, причем снижение не превышало 10% по результатам 40 испытаний. Например, у модели Llama-3-8B-Instruct показатель вредоносных ответов вырос с 0,08 до 0,88.
С учетом того, что ИИ-модели все чаще применяются в различных областях, таких как здравоохранение и государственные услуги, исследователи подчеркивают необходимость строгих проверок перед их внедрением. Закрытые модели также не защищены от манипуляций, так как их можно обойти через API и запросы. На данный момент надежные методы защиты остаются неразработанными.
По материалам: 3dnews.ru