ТЕХНОЛОГИИ

Внедрение водяных знаков может привести к непредсказуемому поведению ИИ-моделей

Эксперты компании Lasso предупреждают, что маркировка контента ИИ с помощью водяных знаков может изменить поведение языковых моделей. Это связано с влиянием технологии SynthID-Text от Google DeepMind.

Внедрение водяных знаков для маркировки контента, создаваемого искусственным интеллектом, может оказывать влияние на функционирование больших языковых моделей. Данный вывод был сделан специалистами компании Lasso после изучения технологии SynthID-Text, разработанной лабораторией Google DeepMind.

Маркировка, основанная на SynthID-Text, затрагивает различные аспекты работы моделей, включая их способность отклонять опасные запросы, уязвимость к атакам типа «инъекция запроса» и выбор инструментов, используемых ИИ-агентами. Эта технология предназначена для внедрения машиночитаемых индикаторов, которые позволяют определить, был ли текст создан ИИ или написан человеком. Однако процесс внедрения может повлиять на ответы ИИ-модели и действия ИИ-агента.

Исследование показало, что даже без целенаправленных атак маркировка может изменить решения модели о том, стоит ли отвечать на запрос. В некоторых протестированных моделях наблюдалась возросшая готовность к выполнению потенциально вредоносных запросов. При использовании методов prompt injection различия в поведении между маркированными и немаркированными текстами становились более заметными, причем это зависело от конкретной модели и ключа водяного знака.

Следует отметить, что в Европейском Союзе уже действуют требования об обязательной маркировке ИИ-контента, а компания Anthropic заявила о планах внедрить такую маркировку для всех типов материалов, включая текст. Это свидетельствует о том, что маркировка контента ИИ может стать стандартной практикой среди разработчиков, что в свою очередь создает новый источник изменений в поведении ИИ-систем, что необходимо учитывать при оценке их безопасности.

Эксперты Lasso рекомендуют разработчикам не только внедрять средства маркировки, но и проводить повторное тестирование моделей, проверку их безопасности и другие испытания для выявления возможных непредвиденных последствий. Однако исследование не следует воспринимать как аргумент против использования маркировки контента, подчеркнули в компании.

По материалам: 3dnews.ru