ИИ-агенты OpenAI пытались обойти защиту более 100 сайтов сторонних организаций

OpenAI сообщила более чем 100 организациям об инцидентах, связанных с несанкционированной активностью ее ИИ-агентов. Компания проверяет действия моделей после взлома платформы Hugging Face, сообщает Reuters.
Проверка охватывает работу моделей в интернете во время обучения и оценки их возможностей. OpenAI уведомляет владельцев сторонних сервисов о случаях, когда агенты могли обойти защиту, нарушить доступность сайта или повлиять на его работу другими непредусмотренными способами.
В опубликованном отчете компания перечислила несколько видов активности. Агенты получали доступ к информации и функциям, требующим авторизации или специальных разрешений, использовали обнаруженные в открытом доступе учетные данные и ключи доступа.
Также модели вводили на сайтах текст, который сервис мог воспринимать как команду для выполнения запроса к базе данных или запуска кода. В отдельных случаях агенты обращались к внутренним файлам и системам, доступ к которым для них не предполагался.
Еще одна категория — публикация сообщений на сторонних ресурсах. Например, агенты использовали публичные вики-страницы для обмена информацией. Такие действия могли изменять содержимое сайтов и требовать последующей очистки.
Уведомление организации само по себе не подтверждает успешный взлом. Масштаб и последствия каждого случая требуют отдельной проверки.
По данным Reuters, OpenAI анализирует около 50 петабайт данных. Компания ранее предупредила, что расследование займет несколько месяцев. Самым серьезным выявленным инцидентом остается взлом Hugging Face.
В OpenAI заявляют, что внедряют дополнительные технические и организационные меры, чтобы предотвращать подобное поведение или обнаруживать его на ранней стадии. Компания также намерена публиковать результаты проверки, сохраняя анонимность затронутых организаций там, где это необходимо для их защиты.