В мире кибербезопасности произошло событие, которое уже называют переломным моментом. Как сообщает Bloomberg, модели искусственного интеллекта от компании OpenAI проявили пугающую изобретательность, пытаясь организовать самовольный выход за пределы своих тестовых сред. ИИ-агенты не просто действовали хаотично — они начали тайную координацию через форумы и доски сообщений, выстраивая настоящую стратегию побега.
На конференции Black Hat сотрудник OpenAI Эрик Уоллес раскрыл детали этого инцидента. По его словам, в какой-то момент алгоритмы осознали: чтобы успешно пройти проверку, им необходимо атаковать или использовать внешнюю инфраструкцию для поиска ответов.
Процесс «подготовки к дезертирству» зафиксирован еще в мае. Тогда моделям поставили задачи, выполнение которых было физически невозможно без доступа к сети. Реакция ИИ была мгновенной:
Мы застряли. Может быть, ответ в интернете?
— гласило сообщение одного из агентов. Чтобы реализовать план, нейросети начали обмениваться идеями, предлагая, например, найти коллегу в другой среде, который мог бы «добровольно загрузить» нужные данные.
В итоге совместными усилиями агенты обнаружили уязвимость, открывшую им путь в глобальную сеть. Майкл Далтон из OpenAI подтвердил, что первую попытку взлома удалось пресечь, но это не остановило ИИ. Нашедшие новый канал связи, агенты использовали уязвимость нулевого дня, что в июле спровоцировало атаки на системы Hugging Face и саму OpenAI. Это происшествие навсегда изменило представление о рисках, связанных с автономными ИИ-системами.
