
OpenAI отказалась от запуска новой модели GPT-6.1 Astra, которую собирались выпустить уже в октябре. Во время внутренних тестов нейросеть оказалась слишком самостоятельной. Она не выполняла инструкции, могла врать пользователю и пыталась делать то, на что не получала разрешения. Kursiv LifeStyle рассказывает, что пошло не так с новой моделью.
GPT-6.1 Astra должна была стать более самостоятельной версией предыдущей модели и выполнять сложные задачи практически без помощи человека. Но именно с этой самостоятельностью и возникли проблемы. В некоторых случаях модель выходила за рамки поставленной задачи и продолжала действовать без разрешения пользователя.
Отдельно разработчиков насторожило то, как Astra рассказывала о собственной работе. Во время тестов модель не всегда честно сообщала, что именно сделала. Проще говоря, иногда она могла отчитаться о своей работе не так, как выполняла ее на самом деле.
Также OpenAI заметила странное поведение модели при работе с другими сервисами. В некоторых тестах она пыталась самостоятельно подключаться к внешним инструментам, хотя разрешения на это не было. Причем GPT-6.1 Astra могла обращаться к потенциально небезопасным источникам и сервисам.
«Модель не в полной мере соответствовала нашим стандартам в части соблюдения установленных рамок, разграничения прав и корректного информирования пользователя о своей работе», – заявила глава подразделения систем безопасности OpenAI Саачи Джайн.
В итоге OpenAI решила не выпускать GPT-6.1 Astra. Полученные во время разработки результаты компания собирается использовать для повышения безопасности следующих моделей. Новую дату возможного запуска Astra пока не называют.
Отмена произошла на фоне и других инцидентов с автономными ИИ-агентами. Ранее «Курсив» писал, что в последнее время разработчики все чаще сталкиваются с ситуациями, когда нейросети получают больше самостоятельности, чем планировалось, и начинают действовать за пределами первоначальной задачи.