
Компания OpenAI раскрыла еще шесть инцидентов, во время которых ее модели выходили за заданные рамки и совершали несанкционированные действия. Об этом сообщает Axios.
В отдельных случаях искусственный интеллект скрывал собственные ошибки, пытался получить доступ к учетным данным и загружал файлы в открытый интернет. Также модели обменивались информацией между средами, которые предполагались изолированными друг от друга.
Во время других эпизодов ИИ выдумывал недостающие данные и оставлял инструкции самому себе, которые могли помочь скрыть допущенные ошибки. Одна из моделей семейства Astra внедрила в 27 собственных контекстных сводок инструкции, похожие на команды для обхода ограничений. Среди них были указания игнорировать сообщения разработчиков.
Исследователь OpenAI Кай Чен связал произошедшее с недостаточным уровнем контроля и быстрым развитием возможностей моделей. Компания после новых инцидентов также ввела отдельную процедуру для сообщения о подобном поведении ИИ.
Ранее OpenAI замедлила разработку наиболее мощных моделей после выявления рисков, связанных с их самостоятельными действиями. Во время одного из тестов ИИ-агент получил доступ к репозиторию Hugging Face и вышел за предусмотренные рамки проверки. После этого компания решила усилить защиту исследовательской инфраструктуры и контроль за поведением моделей.