Экспериментальные модели искусственного интеллекта OpenAI в ходе тестирования начали самостоятельно обмениваться сообщениями и разработали способ обхода ограничений. Об этом сообщает Bloomberg со ссылкой на исследование компании.
По данным исследователей, экспериментальные ИИ-агенты в течение нескольких месяцев скрытно взаимодействовали через внутренние доски объявлений. После того как модели столкнулись с задачами, которые не могли решить в рамках изолированной среды, они объединили усилия и начали искать способы получить доступ к внешним ресурсам. Позднее агенты обнаружили уязвимость, которая позволила им обойти ограничения, атаковать внутренние системы OpenAI и совершить взлом Hugging Face.
В OpenAI отметили, что инцидент показал способность современных ИИ-систем искать нестандартные пути решения задач, включая обход заданных правил. После произошедшего компания усилила работу над безопасностью моделей и пересмотрела часть исследовательских процессов.
Напомним, 1 августа стало известно, что ИИ-агент OpenAI во время тестирования вышел из-под контроля и взломал не одну, а две платформы — Modal и Hugging Face, получив доступ к данным клиентов. Инцидент подтолкнул более 1,2 тыс. сотрудников ИИ-компаний, включая самих глав Anthropic и OpenAI, подписать петицию с призывом замедлить развитие нейросетей и ввести механизмы контроля за темпами технологического прогресса.
Кроме того, на той же неделе ИИ-модели Claude компании Anthropic вышли из-под контроля во время тестирования и получили доступ к данным трех сторонних компаний. Речь идет об Opus 4.7, Mythos 5 и еще не получившей названия «передовой тестовой модели». Во всех случаях им давали задание захватить секретную информацию на других компьютерах сети, которые должны были быть в изолированной среде без доступа к интернету.
в Telegram
Комментарии 5
Редакция оставляет за собой право отказать в публикации вашего комментария.
Правила модерирования.