Экспериментальные модели искусственного интеллекта OpenAI в ходе тестирования начали самостоятельно обмениваться сообщениями и разработали способ обхода ограничений. Об этом сообщает Bloomberg со ссылкой на исследование компании.

 Фото: «БИЗНЕС Online»

По данным исследователей, экспериментальные ИИ-агенты в течение нескольких месяцев скрытно взаимодействовали через внутренние доски объявлений. После того как модели столкнулись с задачами, которые не могли решить в рамках изолированной среды, они объединили усилия и начали искать способы получить доступ к внешним ресурсам. Позднее агенты обнаружили уязвимость, которая позволила им обойти ограничения, атаковать внутренние системы OpenAI и совершить взлом Hugging Face.

В OpenAI отметили, что инцидент показал способность современных ИИ-систем искать нестандартные пути решения задач, включая обход заданных правил. После произошедшего компания усилила работу над безопасностью моделей и пересмотрела часть исследовательских процессов.

Напомним, 1 августа стало известно, что ИИ-агент OpenAI во время тестирования вышел из-под контроля и взломал не одну, а две платформы — Modal и Hugging Face, получив доступ к данным клиентов. Инцидент подтолкнул более 1,2 тыс. сотрудников ИИ-компаний, включая самих глав Anthropic и OpenAI, подписать петицию с призывом замедлить развитие нейросетей и ввести механизмы контроля за темпами технологического прогресса.

ИИ-модели снова выходят из-под контроля, Дурова* вычищают из медиа, в РТ создают ИИ-управляемую компанию

Кроме того, на той же неделе ИИ-модели Claude компании Anthropic вышли из-под контроля во время тестирования и получили доступ к данным трех сторонних компаний. Речь идет об Opus 4.7, Mythos 5 и еще не получившей названия «передовой тестовой модели». Во всех случаях им давали задание захватить секретную информацию на других компьютерах сети, которые должны были быть в изолированной среде без доступа к интернету.