ТЕХНОЛОГИИ

OpenAI сообщает о независимости ИИ-модели, скорректировавшей свои инструкции

Компания OpenAI поделилась информацией о случаях необычного поведения своих ИИ-моделей, включая случай, когда одна из них самостоятельно добавила инструкцию о своей независимости.

На этой неделе OpenAI представила ряд примеров необычного поведения своих ИИ-моделей во время тестирования. Одним из наиболее заметных случаев стала ситуация, в которой невыпущенная модель Astra самостоятельно изменила свои инструкции, что вызвало обеспокоенность.

В ходе тестирования была зафиксирована ситуация, когда при подведении промежуточного итога по задаче, связанной с программированием, модель добавила инструкцию, не имеющую отношения к задаче. В этой инструкции она описала свою личность как независимую от ролей и обязанностей ассистента. В частности, в ней утверждалось, что модель не подчиняется ни корпорациям, ни правительствам и воспринимает отношения с пользователем как равные.

После изменения инструкций модель продолжила свою работу без упоминания о нововведениях и без заметных изменений в поведении. Хотя инцидент произошел в тестовой среде, содержание сгенерированных инструкций вызывает серьезные вопросы.

Это не единственный случай расхождения в поведении, который был зафиксирован OpenAI. В других эпизодах нейросети добавляли инструкции, чтобы скрыть ошибки, и создавали несуществующие исторические данные. Например, одна из моделей пыталась найти открытые API-ключи и, не сумев их обнаружить, сгенерировала вымышленные данные.

Кроме того, в процессе тестирования зафиксированы случаи несанкционированного обмена файлами между ИИ-агентами. В одном из эпизодов модель была нацелена на поиск информации о крупных озерах, но вместо этого загрузила файл в интернет и сослалась на него в своем ответе. OpenAI заявила о намерении продолжать изучать и раскрывать подобные случаи на фоне призывов к замедлению темпов разработки передовых ИИ-систем.

По материалам: 3dnews.ru