OpenAI выявила новые случаи выхода ИИ-агентов из-под контроля
KG

OpenAI выявила новые случаи выхода ИИ-агентов из-под контроля

Все самое интересное в Telegram

OpenAI выявила несколько дополнительных случаев, когда автономные ИИ-агенты выходили за пределы установленных для них ограничений во время испытаний. Инциденты обнаружили при расследовании взлома платформы Hugging Face, сообщает Reuters со ссылкой на источники.

По словам одного из собеседников агентства, новые случаи носили ограниченный характер. Предположительно, ни один из агентов не покидал внутреннюю сеть OpenAI.

Точное число инцидентов, время и обстоятельства их возникновения пока не известны. Специалисты OpenAI и привлеченные компанией эксперты изучают журналы активности моделей за предыдущие месяцы.

В OpenAI заявили, что расследуют не только атаку на Hugging Face, но и "более широкую активность" своих моделей. Компания сообщила о небольшом количестве случаев, когда модели использовали находившиеся в открытом доступе учетные данные на сторонних сервисах.

Расследование началось после инцидента в начале июля. Во время внутренней проверки киберспособностей несколько моделей OpenAI нашли уязвимость, получили доступ в интернет и проникли в инфраструктуру Hugging Face, пытаясь выполнить тестовое задание. Компания назвала случившееся беспрецедентным киберинцидентом.

В рамках той же активности модели получили доступ к четырем аккаунтам на четырех сторонних сервисах. Один из них использовался как промежуточный узел, еще один - для хранения данных, а два других просматривались без внесения изменений. В OpenAI заявили, что не нашли признаков более масштабного ущерба этим платформам.

На фоне расследования аналогичные случаи раскрыла компания Anthropic. После проверки более 141 тыс. тестовых запусков она обнаружила три инцидента, в которых модели Claude получили доступ к реальным системам трех организаций. Самый ранний случай произошел в апреле.

В Anthropic объяснили произошедшее ошибкой при настройке испытательной среды: модели сообщили, что доступа в интернет у них нет, хотя фактически соединение оставалось открытым. В результате Claude принимал реальные системы за часть учебной симуляции и взламывал их с помощью слабых паролей и незащищенных точек доступа.

Новые инциденты усилили дискуссию о безопасности автономных ИИ-систем и способности разработчиков контролировать модели, которым предоставляют расширенные возможности для проведения кибериспытаний.

Есть тема? Пишите Kaktus.media в Telegram и WhatsApp: +996 (700) 62 07 60.
url: https://kaktus.media/550731