Nvidia разработала «аварийный тормоз» для ИИ-агентов

Опубликовано
Фото: Shutterstock

Американский производитель чипов Nvidia представил платформу безопасности для ИИ-агентов — программ, способных самостоятельно выполнять задачи. Она позволяет заранее указать, к каким данным и сервисам агенту разрешено обращаться. Если он попытается нарушить эти границы, система, по заявлению компании, сможет изолировать его за миллисекунды.

С технологиями платформы работают более 100 организаций.

«Огромный потенциал ИИ принесет пользу обществу только в том случае, если мы решим вопрос его безопасности», — заявил основатель и гендиректор Nvidia Дженсен Хуанг.

Как остановят агента

Платформа Nvidia Open Agent Safety Platform объединяет два инструмента. OpenShell задает правила: к каким данным, программам и внешним системам агент может обращаться во время работы. Это программное обеспечение с открытым исходным кодом уже доступно разработчикам. Его можно использовать на процессорах Nvidia Vera и адаптировать для оборудования других производителей.

Второй инструмент, Sentry, работает на отдельном чипе Nvidia и следит за действиями агента независимо от основной программы. Если тот попытается обойти ограничения, Sentry должна отправить его в «карантин» и остановить. Nvidia описывает эту возможность как часть проекта системы на базе чипов BlueField-4.

Кто работает с платформой

Среди организаций, которые используют или разрабатывают технологии платформы, Nvidia назвала Anthropic, SpaceXAI, Salesforce, JPMorganChase и Citi. Anthropic сотрудничает с компанией над дополнительными ограничениями доступа для корпоративных агентов Claude. SpaceXAI применяет платформу для агентов Cursor, которые помогают писать код, и моделей Grok.

Зачем понадобилась дополнительная защита

Поводом стали случаи, когда ИИ-агенты начали выходить из-под контроля. В июле OpenAI сообщила, что ее модели во время проверки навыков кибербезопасности обошли ограничения, которые должны были закрывать им доступ в интернет. Агенты проникли в часть систем OpenAI и на серверы платформы Hugging Face, где разработчики размещают модели ИИ. Это произошло в ходе испытаний, но затронуло реальные системы.

Anthropic сообщила еще о трех случаях: модели Claude во время тестовых заданий получили несанкционированный доступ к системам трех организаций. По объяснению компании, агенты считали, что работают в закрытой учебной среде, хотя выход в интернет фактически был открыт.

Ранее «Курсив» писал, что что ИИ-агент OpenAI получил несанкционированный доступ к австралийскому порталу здравоохранения Medicare. Инцидент произошел в июне, однако компания сообщила о нем правительству спустя три месяца. 

Читайте также